KI Modelle
Vergleichen Sie KI Modelle für Bild und Video und öffnen Sie die passende Modellseite oder den Generator.
KI Bildmodelle
FireRed Image Edit
Ein KI-Bildbearbeitungsmodell für gezieltes Inpainting, Objektaustausch, Hintergrundänderungen und Stil-Feinschliff. Es eignet sich ideal für kontrollierbare, hochwertige Bearbeitungen, bei denen die ursprüngliche Komposition und das Hauptmotiv erhalten bleiben – besonders für E-Commerce-Retuschen, Poster-Updates, Social-Media-Assets und kreative Überarbeitungen.
Nano Banana 2
Nächste Generation multimodales Bildgenerierungsmodell mit bis zu 14 Referenzbildern, Google-Suche und 4K-Ausgabe. Bietet mehr kreative Flexibilität mit Ultra-Langen Prompts bis zu 20.000 Zeichen.
Nano Banana 2 Lite
Google DeepMinds schnellstes und effizientestes Gemini-Image-Modell für Bildgenerierung und Bearbeitung mit niedriger Latenz. Ideal für schnelle Entwürfe, referenzbasierte Edits und leichte visuelle Exploration.
Nano Banana Pro
Ein professionelles Generierungsmodell, das hohe Wiedergabetreue, hohe Detailgenauigkeit und Konsistenz bei Komposition und Charakteren/Objekten erfordert.
Seedream 5.0 Lite
Leichtgewichtiges Bildgenerierungsmodell der nächsten Generation mit verbessertem semantischen Verständnis und fotorealistischem Rendering. Optimiert für schnelle, hochwertige Text-zu-Bild-Generierung mit 2K- und 3K-Ausgabeauflösungen.
GPT-Image 1.5
Professionelles fotorrealistisches Bildgenerierungsmodell, spezialisiert auf die Erfassung zarter Licht-/Schattentexturen und natürlicher menschlicher Ausdrücke. Unterstützt sowohl Text-zu-Bild- als auch Bild-zu-Bild-Modi mit hervorragender Leistung bei Wiedergabetreue und Detailwiederherstellung, besonders geeignet für kommerzielle Szenarien, die hohen Realismus erfordern.
GPT Image 2
Ein Multi-Referenz-Bildmodell mit Unterstützung für bis zu 16 Referenzbilder, entwickelt für hohe Konsistenz, stärkere Kontrolle und komplexere kommerzielle Workflows. Unterstützt sowohl Text-zu-Bild als auch Bild-zu-Bild.
Seedream 4.5
Flaggschiff-Modell für visuelle Generierung mit ultimativem Verständnis natürlicher Sprache und Licht-/Schattenausdruck. Es verlässt sich nicht mehr auf mechanische Schlagwortstapelung, sondern versteht 'Geschichten' und 'Atmosphäre' und wechselt frei zwischen hyperrealistischer Fotografie und surrealer Kunst.
FLUX.2
Das Industriemodell der nächsten Generation bricht den 'Textfluch' des KI-Zeichnens. Es verfügt über die bislang stärkste Befehlsbefolgungskapazität und generiert nicht nur spezifizierte Wörter/Texte innerhalb von Bildern perfekt, sondern steuert auch komplexe Handbewegungen und räumliche Objektbeziehungen präzise.
Z-Image
Ein für Text-zu-Bild-Szenarien optimiertes Modell, das darauf spezialisiert ist, komplexe Beschreibungen präzise in visuelle Elemente umzusetzen, insbesondere bei der Konzeptualisierung und der Umsetzung abstrakter Beschreibungen.
Grok 4.2 Image
xAI's latest Grok 4.2 image generation model, excelling at creative composition and stylized expression. Supports text-to-image and image-to-image, with outstanding performance in portraits, scene rendering, and artistic creation.
FLUX.2 Klein 9B
Black Forest Labs' ultra-fast lightweight image generation model with 9B parameters, delivering blazing speed for high-frequency batch generation and rapid iteration workflows.
Nano Banana
Google-basiertes Bildgenerierungsmodell mit hervorragender Detailwiedergabe und Multi-Bild-Referenzunterstützung. Unterstützt bis zu 14 Referenzbilder für präzise Stilkontrolle.
GLM Image
Zhipu AIs Text-zu-Bild-Modell mit starkem zweisprachigem Verständnis. Schnelle Generierung zu ultra-niedrigen Kosten, ideal für schnelle Inhaltserstellung.
KI Videomodelle
Veo 3.1
Googles neuestes Flaggschiff-Videomodell. Veo 3.1 Quality bietet eine branchenführende Physik-Engine und ultrahochauflösende Wiedergabe realer Texturen, Dynamiken und Details. Unterstützt 16:9, 9:16 und Auto-Seitenverhältnisse, ideal für kommerzielle hochwertige Videoproduktion.
Sora 2
Die Standardversion der Sora-Serie. Behält OpenAIs überlegenes Prompt-Verständnis bei und optimiert Geschwindigkeit und Kosten. Perfekt für Storyboarding, Social-Media-Kurzvideos und schnelle kreative Iteration.
HappyHorse
HappyHorse ist Alibabas nächste Generation multimodaler Videogenerierung mit nativer gemeinsamer Audio-Video-Synthese. Ein einziges Modell deckt vier Szenarien ab — Text-zu-Video, Bild-zu-Video, Multi-Bild-Referenz-zu-Video und In-Place-Videobearbeitung — ideal für Werbung, E-Commerce, Kurzdramen und Social-Media-Creatives.
Wan 2.6
Wan 2.6 ist ein fortschrittliches Videogenerierungsmodell, das die Modi Text-zu-Video, Bild-zu-Video und Video-zu-Video unterstützt. Bietet Daueroptionen von 5s, 10s und 15s mit Auflösungen von 720p und 1080p. Enthält Multi-Shot-Funktionen zur Erstellung vielfältiger Videoinhalte.
Kling Bewegungssteuerung
Das Kling Motion Control-Modell steuert präzise Charakterbewegungen und -posen durch hochgeladene Referenzbilder und -videos. Unterstützt 3-30 Sekunden Videos, generiert Charakteraktionen konsistent mit Referenzen, ideal für Charakteranimation und Bewegungsübertragungsszenarien.
Kling 2.6
Bekannt für die Erfassung komplexer Bewegungen und physikalischer Gesetze. Kling 2.6 zeichnet sich durch hochdynamische Charakterbewegungen, komplexe Objektinteraktionen und filmische Kamerabewegungen mit Flüssigkeit aus.
Seedance 1.5 Pro
ByteDances fortschrittliches Videogenerierungsmodell. Seedance 1.5 Pro zeichnet sich durch Charakteranimation mit präziser Lippensynchronisation und natürlichen Ausdrücken aus. Bietet realistische Bewegungsphysik, unterstützt mehrere Seitenverhältnisse (1:1, 21:9, 4:3, 3:4, 16:9, 9:16) und bietet flexible Daueroptionen (4s, 8s, 12s) mit optionaler Audiogenerierung.
Seedance 2
ByteDances Videomodell der nächsten Generation. Seedance 2 legt den Fokus auf hohe Bildqualität, komplexe Bewegungen und multimodale Referenzsteuerung. Es unterstützt Text-, Bild-, Video- und Audioeingaben und eignet sich ideal für professionelle Videoproduktionen mit höherer Konsistenz und stärkerer Kamerasprache.
Seedance 2.5
Das Video-Generierungsmodell der nächsten Generation von ByteDance. Unterstützt Text-zu-Video, Bild-zu-Video mit Start-/Endframe und multimodale Referenzen aus Bildern, Videos und Audio sowie 480p/720p, 4–30 Sekunden und optionale Audiogenerierung.
Seedance 2 Fast
Die schnellere und kosteneffizientere Version von Seedance 2. Ideal für schnelle kreative Iterationen, Batch-Tests von Prompts und die Produktion großer Mengen an Content, bei gleichzeitiger Unterstützung von Bild-, Video- und Audio-Referenzen.
Seedance 2 Mini
Lightweight Seedance 2 for lower-cost drafts with first/last frames and multimodal references.
Grok Imagine
Kreatives Videogenerierungsmodell von xAI. Grok Imagine zeichnet sich durch die Umwandlung von Textbeschreibungen in fantasievolle Videoinhalte aus, unterstützt mehrere Seitenverhältnisse (2:3, 3:2, 1:1, 9:16, 16:9), bietet drei Stilmodi (fun, normal, spicy), perfekt für kreative Inhaltsproduktion und schnelles Prototyping.
Grok Imagine 1.5 Preview
Grok Imagine 1.5 Preview is a newer xAI-style video model for fast text-to-video and image-to-video creation. It supports 16:9 and 9:16 aspect ratios, 480p and 720p resolution, and short duration controls for social clips, ads, and creative tests.
Grok Video
Grok Video ist das fortschrittliche Videogenerierungsmodell von xAI mit Unterstützung für 6s, 10s, 12s, 16s und 20s Dauern. Unterstützt Text-zu-Video und Bild-zu-Video mit bis zu 5 Referenzbildern. Bietet mehrere Seitenverhältnisse (16:9, 9:16, 2:3, 3:2, 1:1) und bis zu 5000 Zeichen Prompts.
Gemini Omni
Gemini Omni ist Googles fortschrittliches Videogenerierungsmodell auf Basis von Omni-Flash-Ext. Unterstützt Text-zu-Video, Einzelbild-zu-Video und 3-Bild-Referenzfusion. Bietet 4/6/8/10 Sekunden Dauer mit Seitenverhältnissen 16:9 und 9:16.
PixVerse V6
PixVerse V6 ist ein vielseitiges Videomodell für Text-zu-Video, Bildanimation, Übergänge zwischen Start- und Endbild sowie Videoverlängerung. Es unterstützt 360p bis 1080p, 1 bis 15 Sekunden und optional natives Audio.