AI 模型
比较 FireRed Image Edit 上可用的 AI 图像模型和 AI 视频模型,并打开最适合你工作流的模型页面或生成器。
AI 图像模型
FireRed Image Edit
专注于局部重绘、物体替换、背景修改与风格细化的 AI 图片编辑模型。适合在保留原图主体结构的前提下,快速完成高质量可控编辑,尤其适用于电商修图、海报改图、社媒素材优化和创意二次加工。
Nano Banana 2
基于 Google Gemini Flash Image 的快速、实惠图像生成模型,支持0.5K至4K分辨率,适合日常高频创作。
Nano Banana 2 Lite
Google DeepMind 速度最快、效率最高的 Gemini Image 模型,适合低延迟图像生成与编辑。适用于快速草稿、参考图改图和轻量成本下的 1K 视觉探索。
Nano Banana Pro
面向高保真、高细节、对构图与人物/物体一致性要求很高的专业生成模型。
Seedream 5.0 Lite
字节跳动新一代轻量级图像生成模型,在保持旗舰级视觉质量的同时大幅提升生成速度。支持最多15张批量生成,提示词理解能力强,适合高频创作场景。
GPT-Image 1.5
专业级真实感图像生成模型,擅长捕捉细腻的光影质感与自然的人物表情。支持文生图和图生图两种模式,在保真度和细节还原上表现出色,特别适合需要高度真实感的商业场景。
GPT Image 2
支持最多16张参考图的多图参考图像生成模型,适合需要高一致性、强可控性和复杂需求表达的商业创作。支持文生图与图生图,适用于电商主图、角色设定、品牌海报和多图融合场景。
Seedream 4.5
旗舰级视觉生成模型,拥有极致的自然语言理解力与光影表现力。它不再依赖机械的标签堆砌,而是能听懂‘故事’与‘氛围’,在超写实摄影与超现实艺术间自由切换。
FLUX.2
次世代工业级模型,突破了 AI 绘图的“文字魔咒”。它拥有目前最强的指令遵循能力,不仅能完美生成图片内的指定单词/文本,还能精确控制复杂的人体手部动作与物体空间关系。
Z-Image
专为文本到图像场景优化的模型,致力于把复杂描述准确映射为视觉元素,尤其擅长概念化与抽象描述还原。
Grok 4.2 Image
xAI 最新的 Grok 4.2 图像生成模型,擅长创意构图与风格化表达,支持文生图和图生图,在人物肖像、场景渲染和艺术创作方面表现出色。
FLUX.2 Klein 9B
黑森林实验室推出的超速轻量图像生成模型,9B参数量实现极快出图速度,适合高频批量生成和快速迭代场景。
Nano Banana
基于 Google 技术的图像生成模型,细节渲染出色,支持多图参考。最多可上传14张参考图片,精准控制风格,支持多种宽高比。
GLM Image
智谱AI的文生图模型,中英文双语理解能力强。生成速度快、成本极低,适合快速内容创作和批量工作流。
AI 视频模型
Veo 3.1
Google 最新旗舰视频生成模型。Veo 3.1 Quality 拥有业界顶尖的光影物理引擎和超高保真度,能完美还原现实世界的纹理、动态与细节。支持 16:9、9:16 和自动宽高比,适合商业级高质量视频制作。
Sora 2
Sora 系列的标准版本。在保持 OpenAI 优秀的语义理解能力的同时,优化了生成速度与成本。非常适合快速验证分镜脚本、社交媒体短视频制作及通用创意生成。
HappyHorse
HappyHorse 是阿里巴巴下一代多模态视频生成模型,原生支持音视频协同生成。单一模型覆盖四种场景——文生视频、图生视频、多图参考生视频、视频原位编辑,非常适合广告、电商、短剧和社媒创意内容。
Wan 2.6
Wan 2.6 是一款先进的视频生成模型,支持文本生成视频、图片生成视频和视频转视频三种模式。提供 5秒、10秒、15秒 的时长选项和 720p、1080p 两种分辨率,支持多镜头切换功能,适合创作多样化的视频内容。
Kling 动作控制
Kling 动作控制模型,通过上传参考图片和视频,精准控制角色的动作和姿态。支持3-30秒视频,可生成与参考一致的角色动作,适合角色动画和动作迁移场景。
Kling 2.6
以惊人的动作一致性和物理规律捕捉著称。Kling 2.6 擅长生成大幅度的人物动作、复杂的物体交互以及电影级的运镜效果,画面细腻且连贯。
Seedance 1.5 Pro
字节跳动先进的视频生成模型。Seedance 1.5 Pro 擅长角色动画,具有精准的口型同步和自然的表情。拥有逼真的运动物理效果,支持多种视频比例(1:1、21:9、4:3、3:4、16:9、9:16),提供灵活的时长选项(4秒、8秒、12秒),并可选择生成音频。
Seedance 2
字节跳动新一代视频生成模型。Seedance 2 强调高质量画面、复杂运动表现与多模态参考控制,支持文本、图片、视频与音频输入,适合需要更高一致性与更强镜头表达的专业视频创作。
Seedance 2.5
字节跳动的新一代视频生成模型,支持文生视频、首尾帧图生视频和多模态参考生视频。支持图片、视频、音频参考,提供 480p/720p、4–30 秒时长和可选音频生成。
Seedance 2 Fast
Seedance 2 的高速版本,兼顾速度与成本效率。适合快速迭代创意、批量测试提示词与高频内容生产,同时保留对图片、视频与音频参考的支持。
Seedance 2 Mini
Seedance 2 的轻量低成本版本。支持首尾帧与多模态参考,单秒积分更低,适合草稿、社交短视频与大批量试跑。
Grok Imagine
xAI 推出的创意视频生成模型。Grok Imagine 擅长将文本描述转化为富有想象力的视频内容,支持多种宽高比(2:3、3:2、1:1、9:16、16:9),提供 fun、normal、spicy 三种风格模式,适合创意内容制作和快速原型验证。
Grok Imagine 1.5 Preview
Grok Imagine 1.5 Preview is a newer xAI-style video model for fast text-to-video and image-to-video creation. It supports 16:9 and 9:16 aspect ratios, 480p and 720p resolution, and short duration controls for social clips, ads, and creative tests.
Grok Video
Grok Video 是 xAI 推出的高级视频生成模型,支持 6秒、10秒、12秒、16秒和20秒多种时长。支持文生视频和图生视频,最多可上传5张参考图片。提供多种宽高比(16:9、9:16、2:3、3:2、1:1),支持最长5000字符的提示词,实现精细的创意控制。
Gemini Omni
Gemini Omni 是 Google 基于 Omni-Flash-Ext 的高级视频生成模型。支持文生视频、单图生视频和3张参考图融合。支持 4/6/8/10 秒时长,提供 16:9 和 9:16 宽高比。
PixVerse V6
PixVerse V6 是一款灵活的视频生成模型,支持文生视频、图生视频、首尾帧转场和视频续写。支持 360p 至 1080p、1 至 15 秒视频,以及可选的原生音频。