Genai Vision

Integrating Stable Diffusion for vision generation and Whisper for audio/multimodal tasks.

j4flmao Updated

File contents

GenAI Vision & Multimodal

Integration Strategy

  • Stable Diffusion: Use Diffusers library for image generation. Optimize with xformers.
  • Whisper: Process audio locally or via API for high-accuracy transcription to complement visual tasks.

Multimodal Workflow

%%{init: {"theme": "default", "flowchart": {"useMaxWidth": true}}}%%
graph TD
    A[User Audio] --> B(Whisper)
    B -->|Text Prompt| C[Stable Diffusion]
    C --> D[Generated Image]

Stable Diffusion Snippet

import torch
from diffusers import StableDiffusionPipeline

def generate_image(prompt: str, output_path: str):
    pipe = StableDiffusionPipeline.from_pretrained(
        "runwayml/stable-diffusion-v1-5", 
        torch_dtype=torch.float16
    ).to("cuda")
    pipe.enable_xformers_memory_efficient_attention()
    
    image = pipe(prompt, num_inference_steps=30).images[0]
    image.save(output_path)

j4flmao/agent-skills/tree/main/skills/ai/genai-vision commit 3178b068c6

Frequently asked questions

npx skillmds@latest add j4flmao/genai-vision