AI 视频生成器

使用 AI 模型 generate 视频,支持文本到视频、图片到视频和视频到视频。

视频生成器

Veo 3.1

Veo 3.1

52.5
Sora 2

Sora 2

10
HappyHorse

HappyHorse

155
Wan 2.6

Wan 2.6

80
Kling 动作控制

Kling 动作控制

55
Kling 2.6

Kling 2.6

55
Seedance 1.5 Pro

Seedance 1.5 Pro

20
Seedance 2

Seedance 2

220
Seedance 2.5

Seedance 2.5

124
Seedance 2 Fast

Seedance 2 Fast

73
Seedance 2 Mini

Seedance 2 Mini

50
Grok Imagine

Grok Imagine

20
Grok Imagine Video 1.5 Preview

Grok Imagine Video 1.5 Preview

30
Grok Video

Grok Video

10
Gemini Omni

Gemini Omni

78

PixVerse V6

4
0 / 3000
最多 2 张图片

上传素材

拖拽参考图到这里或 浏览文件

支持格式: JPG, PNG, WEBP • MAX 10MB

16:9
消耗 30 积分
购买积分

准备生成

没有生成视频

真实效果

看看 AI 生成的视频效果

不用猜效果好不好,直接看实拍。这些视频全部由 AI 生成,展示了运镜、动作、特效和音频卡点的真实表现。

动作与运镜

动作大片级效果

快速打斗、极限运动、复杂交互——AI 能精准捕捉动作节奏和物理细节,生成连贯、逼真、有冲击力的画面。

动态运镜
点击播放

动态运镜效果

跟踪镜头、环绕镜头、快速转场,AI 自动规划运镜路线,画面流畅不抖动,出片即有电影感。

动作一致
点击播放

动作一致性

人物跑跳、物体碰撞、环境交互,动作逻辑全程保持一致,不会出现穿模或违和感。

多模态控制

用参考素材精准控制结果

传视频学运镜、传音频卡节拍、传图片定风格。AI 理解你的参考素材,生成更贴合预期的视频。

镜头复现
点击播放

参考视频复现镜头

上传一段参考视频,AI 学习镜头调度和动作逻辑,生成风格一致的新视频,团队协作更高效。

特效转场
点击播放

特效与转场

甩镜、匹配剪辑、风格化揭示——AI 学习转场节奏,批量生成有剪辑感的视频片段。

分镜成片
点击播放

分镜一键成片

把脑海里的画面描述出来,AI 自动串联场景、补全动作和叙事节奏,从想法到成片最快几分钟。

音频卡点
点击播放

音乐节奏卡点

上传音乐,AI 根据节拍控制画面切换和动作节奏,做抖音卡点视频、广告节奏片再也不用手动对。

开始创作

输入一句话,AI 帮你出视频

不需要学剪辑、不需要买设备。输入描述或上传素材,AI 几分钟生成高质量视频。支持文生视频、图生视频和多模态参考,内容创作者、品牌团队和独立工作室都在用。

探索所有 16 款 AI 视频生成模型

从多款 AI 视频模型中选择,支持文生视频、图生视频、视频转视频等多种生成模式。

Veo 3.1

Veo 3.1

Google 最新旗舰视频生成模型。Veo 3.1 Quality 拥有业界顶尖的光影物理引擎和超高保真度,能完美还原现实世界的纹理、动态与细节。支持 16:9、9:16 和自动宽高比,适合商业级高质量视频制作。

光影物理模拟写实纹理商业级画质动态细节+2
查看详情
Sora 2

Sora 2

Sora 系列的标准版本。在保持 OpenAI 优秀的语义理解能力的同时,优化了生成速度与成本。非常适合快速验证分镜脚本、社交媒体短视频制作及通用创意生成。

顶尖物理引擎语义理解力4K超清超长时长+2
查看详情
HappyHorse

HappyHorse

HappyHorse 是阿里巴巴下一代多模态视频生成模型,原生支持音视频协同生成。单一模型覆盖四种场景——文生视频、图生视频、多图参考生视频、视频原位编辑,非常适合广告、电商、短剧和社媒创意内容。

原生多模态统一模型四合一场景视频编辑+2
查看详情
Wan 2.6

Wan 2.6

Wan 2.6 是一款先进的视频生成模型,支持文本生成视频、图片生成视频和视频转视频三种模式。提供 5秒、10秒、15秒 的时长选项和 720p、1080p 两种分辨率,支持多镜头切换功能,适合创作多样化的视频内容。

多镜头设计长时长生成多模式支持分辨率可选+2
查看详情
Kling 动作控制

Kling 动作控制

Kling 动作控制模型,通过上传参考图片和视频,精准控制角色的动作和姿态。支持3-30秒视频,可生成与参考一致的角色动作,适合角色动画和动作迁移场景。

精准姿态控制动作一致性动作迁移角色动画专家+2
查看详情
Kling 2.6

Kling 2.6

以惊人的动作一致性和物理规律捕捉著称。Kling 2.6 擅长生成大幅度的人物动作、复杂的物体交互以及电影级的运镜效果,画面细腻且连贯。

物理规律专家大幅度动作物体交互电影级运镜+2
查看详情
Seedance 1.5 Pro

Seedance 1.5 Pro

字节跳动先进的视频生成模型。Seedance 1.5 Pro 擅长角色动画,具有精准的口型同步和自然的表情。拥有逼真的运动物理效果,支持多种视频比例(1:1、21:9、4:3、3:4、16:9、9:16),提供灵活的时长选项(4秒、8秒、12秒),并可选择生成音频。

口型同步角色动画表情自然音效集成+2
查看详情
Seedance 2

Seedance 2

字节跳动新一代视频生成模型。Seedance 2 强调高质量画面、复杂运动表现与多模态参考控制,支持文本、图片、视频与音频输入,适合需要更高一致性与更强镜头表达的专业视频创作。

高质量画面复杂运动表现多模态输入视频参考支持+2
查看详情
Seedance 2.5

Seedance 2.5

字节跳动的新一代视频生成模型,支持文生视频、首尾帧图生视频和多模态参考生视频。支持图片、视频、音频参考,提供 480p/720p、4–30 秒时长和可选音频生成。

文生视频首尾帧控制多模态参考视频与音频参考+2
查看详情
Seedance 2 Fast

Seedance 2 Fast

Seedance 2 的高速版本,兼顾速度与成本效率。适合快速迭代创意、批量测试提示词与高频内容生产,同时保留对图片、视频与音频参考的支持。

生成更快成本更优多模态支持适合批量测试+2
查看详情
Seedance 2 Mini

Seedance 2 Mini

Seedance 2 的轻量低成本版本。支持首尾帧与多模态参考,单秒积分更低,适合草稿、社交短视频与大批量试跑。

成本最低快速出草稿支持首尾帧多模态参考+2
查看详情
Grok Imagine

Grok Imagine

xAI 推出的创意视频生成模型。Grok Imagine 擅长将文本描述转化为富有想象力的视频内容,支持多种宽高比(2:3、3:2、1:1、9:16、16:9),提供 fun、normal、spicy 三种风格模式,适合创意内容制作和快速原型验证。

想象力丰富多样化风格指令遵循快速原型+2
查看详情
Grok Imagine 1.5 Preview

Grok Imagine 1.5 Preview

Grok Imagine 1.5 Preview is a newer xAI-style video model for fast text-to-video and image-to-video creation. It supports 16:9 and 9:16 aspect ratios, 480p and 720p resolution, and short duration controls for social clips, ads, and creative tests.

Text-to-VideoImage ReferenceDuration ControlVertical Video+2
查看详情
Grok Video

Grok Video

Grok Video 是 xAI 推出的高级视频生成模型,支持 6秒、10秒、12秒、16秒和20秒多种时长。支持文生视频和图生视频,最多可上传5张参考图片。提供多种宽高比(16:9、9:16、2:3、3:2、1:1),支持最长5000字符的提示词,实现精细的创意控制。

多种时长选择高质量输出图片参考支持灵活宽高比+2
查看详情
Gemini Omni

Gemini Omni

Gemini Omni 是 Google 基于 Omni-Flash-Ext 的高级视频生成模型。支持文生视频、单图生视频和3张参考图融合。支持 4/6/8/10 秒时长,提供 16:9 和 9:16 宽高比。

多图融合灵活时长高质量输出图片参考+2
查看详情
PixVerse V6

PixVerse V6

PixVerse V6 是一款灵活的视频生成模型,支持文生视频、图生视频、首尾帧转场和视频续写。支持 360p 至 1080p、1 至 15 秒视频,以及可选的原生音频。

四种创作模式原生音频选项360p 至 1080p1 至 15 秒时长+2
查看详情
核心能力

一个工具搞定所有视频创作

输入文字、图片或参考视频,AI 自动生成高质量视频。不需要剪辑经验,不需要昂贵设备,几分钟出片。

文字和图片都能变视频

输入一段描述或上传一张图片,AI 直接生成视频。从广告素材到社媒内容,一个平台全部搞定。

电影级镜头,一键生成

运镜、转场、节奏控制,AI 自动处理。你只管描述想要的效果,专业级画面质感交给它。

支持讲故事,不只是单镜头

自动串联多个场景,生成有剧情、有节奏的完整短片。品牌故事、产品介绍、创意分镜,直接出片。

配音乐自动卡点

上传一段音乐,AI 自动对齐节拍和画面切换。做抖音爆款、广告节奏片、音乐 MV 都超省心。

手机电脑都能用

随时随地打开浏览器就能生成视频,手机、平板、电脑全适配,碎片时间也能高效出片。

喂参考素材,精准出片

传图片定风格、传视频定运镜、传音频定节奏。参考什么就出什么,减少反复修改的痛苦。

FAQ

常见问题

关于FireRed Image Edit的常见问题

由小红书智能创作核心技术团队开发的通用图像编辑模型,基于 Diffusion Transformer 架构,使用 Qwen2.5-VL 作为视觉语言编码器。

10+ 类别:物体添加/删除/替换、属性调整、背景编辑、风格迁移、文字编辑、照片修复、多图编辑、虚拟试穿、人像妆容、多元素融合。

30GB 显存,经过优化推理(蒸馏 + 量化 + 静态编译),每张图约 4.5 秒。

开源 SOTA:ImgEdit (4.56)、GEdit EN (7.943)、GEdit CN (7.887)、REDEdit EN (4.26)、REDEdit CN (4.33),超越部分闭源模型。

是的,原生支持中文和英文编辑指令。

自动多图处理流程:ROI 检测 → 裁剪拼接 → 重新描述。原生支持 1-3 张输入图像,3 张以上通过 Agent 处理。

可以,已开源完整的 LoRA 训练代码。同时提供 LoRA Zoo,包含预训练风格(妆容、Covercraft 文字风格等)。

Apache 2.0,完全开源。可在 HuggingFace、ModelScope 和 GitHub 上获取。

Testimonials

用户反馈

研究者与创作者对FireRed Image Edit的评价

FireRed的指令跟随能力在开源模型中处于领先水平,物体编辑和背景替换的效果令人惊喜。

用户头像

陈思雨

AI研究员

陈思雨: “FireRed的指令跟随能力在开源模型中处于领先水平,物体编辑和背景替换的效果令人惊喜。

李明轩: “文字渲染功能非常实用,中英文都能精准渲染,字体样式保持得很好,做海报设计效率翻倍。

王芳: “老照片修复效果超出预期,划痕去除和色彩还原都很自然,帮我修复了很多珍贵的家庭照片。

张伟: “虚拟试穿功能太好用了,多图编辑灵活度高,做电商内容再也不用反复拍摄了。

刘洋: “v1.1的身份一致性增强效果显著,面部特征在多次编辑后依然保持稳定,学术价值很高。

赵雪: “全面人像妆容功能从专业美颜到创意妆容都有覆盖,数十种风格一键切换,内容产出效率大幅提升。

孙浩: “多元素融合能力很强,Agent驱动的自动裁剪拼接支持10+元素组合,创意合成变得简单高效。

周琳: “开源模型部署方便,Lightning版本8步推理速度很快,30GB显存就能跑,集成到产品中非常顺畅。

立即体验 FireRed

体验 FireRed 图像编辑

使用最先进的AI技术编辑您的图像

用户 1
用户 2
用户 3
用户 4
用户 5

10,000+ 用户

极速免费试用无需信用卡