Modelos IA
Compara modelos IA de imagen y video disponibles en FireRed Image Edit y abre el modelo o generador adecuado.
Modelos IA de imagen
FireRed Image Edit
Un modelo de edición de imágenes con IA diseñado para inpainting localizado, reemplazo de objetos, modificación de fondos y refinamiento de estilo. Es ideal para realizar ediciones controladas y de alta calidad manteniendo la composición y el sujeto principal originales, especialmente en retoque para e-commerce, actualización de pósters, optimización de recursos para redes sociales y reelaboración creativa.
Nano Banana 2
Modelo de generación de imágenes multimodal de nueva generación que admite hasta 14 imágenes de referencia, búsqueda de Google y salida 4K. Ofrece mayor flexibilidad creativa con prompts ultra-largos de hasta 20.000 caracteres.
Nano Banana 2 Lite
El modelo Gemini Image más rápido y eficiente de Google DeepMind para generación y edición de imágenes con baja latencia. Úsalo para borradores rápidos, ediciones con referencia y exploración visual ligera.
Nano Banana Pro
Un modelo de generación profesional que requiere alta fidelidad, alto detalle y consistencia en la composición y personajes/objetos.
Seedream 5.0 Lite
Modelo de generación de imágenes ligero de próxima generación con comprensión semántica mejorada y renderizado fotorrealista. Optimizado para generación rápida y de alta calidad de texto a imagen con resoluciones de salida 2K y 3K.
GPT-Image 1.5
Modelo de generación de imágenes fotorrealistas de nivel profesional, especializado en capturar texturas delicadas de luz/sombra y expresiones humanas naturales. Admite tanto el modo texto-a-imagen como imagen-a-imagen, con excelente rendimiento en fidelidad y restauración de detalles, particularmente adecuado para escenarios comerciales que requieren alto realismo.
GPT Image 2
Un modelo de generación con múltiples referencias que admite hasta 16 imágenes de referencia, pensado para una mayor consistencia, mejor control y flujos comerciales más complejos. Admite tanto texto a imagen como imagen a imagen.
Seedream 4.5
Modelo insignia de generación visual con una comprensión suprema del lenguaje natural y expresión de luz/sombra. Ya no depende de la acumulación mecánica de etiquetas, sino que entiende 'historias' y 'atmósfera', cambiando libremente entre fotografía hiperrealista y arte surrealista.
FLUX.2
Modelo de grado industrial de próxima generación, rompiendo la 'maldición del texto' del dibujo con IA. Tiene la capacidad de seguimiento de instrucciones más fuerte hasta la fecha, no solo generando perfectamente palabras/texto especificados dentro de las imágenes, sino también controlando con precisión movimientos complejos de manos y relaciones espaciales de objetos.
Z-Image
Un modelo optimizado para escenarios de texto a imagen, dedicado a mapear con precisión descripciones complejas a elementos visuales, destacando especialmente en la conceptualización y realización de descripciones abstractas.
Grok 4.2 Image
xAI's latest Grok 4.2 image generation model, excelling at creative composition and stylized expression. Supports text-to-image and image-to-image, with outstanding performance in portraits, scene rendering, and artistic creation.
FLUX.2 Klein 9B
Black Forest Labs' ultra-fast lightweight image generation model with 9B parameters, delivering blazing speed for high-frequency batch generation and rapid iteration workflows.
Nano Banana
Modelo de generación de imágenes basado en Google con excelente renderizado de detalles y soporte de múltiples imágenes de referencia. Admite hasta 14 imágenes de referencia.
GLM Image
Modelo texto-a-imagen de Zhipu AI con fuerte comprensión bilingüe. Generación rápida a costo ultra bajo, ideal para creación rápida de contenido.
Modelos IA de video
Veo 3.1
El último modelo insignia de generación de video de Google. Veo 3.1 Quality cuenta con un motor de física líder en la industria y una fidelidad ultra alta, replicando perfectamente las texturas, dinámicas y detalles del mundo real. Soporta relaciones de aspecto 16:9, 9:16 y Auto, ideal para la producción de video comercial de alta calidad.
Sora 2
La edición estándar de la serie Sora. Mantiene la comprensión superior de las indicaciones de OpenAI mientras optimiza la velocidad y el costo. Perfecto para guiones gráficos, videos cortos para redes sociales e iteración creativa rápida.
HappyHorse
HappyHorse es el modelo multimodal de nueva generación de Alibaba, con co-generación nativa de audio y vídeo. Un único modelo cubre cuatro escenarios — texto a vídeo, imagen a vídeo, referencia multi-imagen a vídeo y edición de vídeo en el lugar — ideal para publicidad, e-commerce, mini-series y creatividades sociales.
Wan 2.6
Wan 2.6 es un modelo de generación de video avanzado que admite los modos de texto a video, imagen a video y video a video. Ofrece opciones de duración de 5s, 10s y 15s con resoluciones de 720p y 1080p. Incluye capacidades de tomas múltiples para crear diversos contenidos de video.
Kling Control de movimiento
El modelo Kling Motion Control controla con precisión los movimientos y poses de los personajes mediante imágenes y videos de referencia cargados. Admite videos de 3 a 30 segundos, genera acciones de personajes consistentes con las referencias, ideal para animación de personajes y escenarios de transferencia de movimiento.
Kling 2.6
Reconocido por capturar movimientos complejos y leyes físicas. Kling 2.6 destaca en la generación de movimientos de personajes de alta dinámica, interacciones complejas de objetos y movimientos de cámara cinematográficos con fluidez.
Seedance 1.5 Pro
Modelo avanzado de generación de video de ByteDance. Seedance 1.5 Pro sobresale en animación de personajes con sincronización labial precisa y expresiones naturales. Cuenta con física de movimiento realista, soporta múltiples relaciones de aspecto (1:1, 21:9, 4:3, 3:4, 16:9, 9:16) y ofrece opciones de duración flexibles (4s, 8s, 12s) con generación de audio opcional.
Seedance 2
Modelo de video de nueva generación de ByteDance. Seedance 2 se centra en una alta calidad visual, movimiento complejo y control multimodal mediante referencias. Soporta entradas de texto, imagen, video y audio, ideal para producciones profesionales que requieren mayor consistencia y un lenguaje de cámara más rico.
Seedance 2.5
El modelo de vídeo de nueva generación de ByteDance. Admite texto a vídeo, imagen a vídeo con fotogramas inicial y final, y referencias multimodales de imagen, vídeo y audio, además de 480p/720p, 4–30 segundos y generación de audio opcional.
Seedance 2 Fast
La versión más rápida y rentable de Seedance 2. Es ideal para iterar ideas rápidamente, probar prompts en lote y producir contenido de alta frecuencia, manteniendo el soporte para referencias de imagen, video y audio.
Seedance 2 Mini
Lightweight Seedance 2 for lower-cost drafts with first/last frames and multimodal references.
Grok Imagine
Modelo de generación de video creativo de xAI. Grok Imagine sobresale en transformar descripciones de texto en contenido de video imaginativo, admite múltiples relaciones de aspecto (2:3, 3:2, 1:1, 9:16, 16:9), ofrece tres modos de estilo (fun, normal, spicy), perfecto para producción de contenido creativo y prototipado rápido.
Grok Imagine 1.5 Preview
Grok Imagine 1.5 Preview is a newer xAI-style video model for fast text-to-video and image-to-video creation. It supports 16:9 and 9:16 aspect ratios, 480p and 720p resolution, and short duration controls for social clips, ads, and creative tests.
Grok Video
Grok Video es el modelo avanzado de generación de video de xAI con soporte para duraciones de 6s, 10s, 12s, 16s y 20s. Soporta texto a video e imagen a video con hasta 5 imágenes de referencia. Ofrece múltiples relaciones de aspecto (16:9, 9:16, 2:3, 3:2, 1:1) y prompts de hasta 5000 caracteres.
Gemini Omni
Gemini Omni es el modelo avanzado de generación de vídeo de Google basado en Omni-Flash-Ext. Soporta texto a vídeo, imagen a vídeo y fusión de 3 imágenes de referencia. Ofrece duraciones de 4/6/8/10 segundos con relaciones de aspecto 16:9 y 9:16.
PixVerse V6
PixVerse V6 es un modelo de vídeo versátil para texto a vídeo, animación de imágenes, transiciones entre fotogramas iniciales y finales y extensión de vídeos. Admite 360p a 1080p, 1 a 15 segundos y audio nativo opcional.