nb150301 avatar

ai-multimodal

Process and generate multimedia content using Google Gemini API. Capabilities include analyze audio

by nb150301|Open Source

AI Multimodal

Process audio, images, videos, documents, and generate images/videos using Google Gemini's multimodal API.

Setup

export GEMINI_API_KEY="your-key"  # Get from https://aistudio.google.com/apikey
pip install google-genai python-dotenv pillow

Quick Start

Analyze media: python scripts/gemini_batch_process.py --files <file> --task <analyze|transcribe|extract>

Generate content: python scripts/gemini_batch_process.py --task <generate|generate-video> --prompt "description"

Models

Image generation: imagen-4.0-generate-001 (standard), imagen-4.0-ultra-generate-001 (quality), imagen-4.0-fast-generate-001 (speed) Video generation: veo-3.1-generate-preview (8s clips with audio) Analysis: gemini-2.5-flash (recommended), gemini-2.5-pro (advanced)

Scripts

gemini_batch_process.py: Process audio/image/video/PDF, generate images/videos media_optimizer.py: Compress/resize/convert media for API limits document_converter.py: Convert DOCX/XLSX/PPTX to PDF

Use --help for options.

References

Load for detailed guidance:

TopicFile
Audioreferences/audio-processing.md
Imagesreferences/vision-understanding.md
Image Genreferences/image-generation.md
Videoreferences/video-analysis.md
Video Genreferences/video-generation.md

Limits

Formats: Audio (WAV/MP3/AAC, 9.5h), Images (PNG/JPEG/WEBP, 3.6k), Video (MP4/MOV, 6h), PDF (1k pages) Size: 20MB inline, 2GB File API

Resources: API Docs | Pricing