AI 视频生成到底能干什么?可灵、即梦、Runway、LTX 怎么选
AI 视频已经从"玩具"走到"能用的生产工具"。本篇把常见玩法摊开:文生、图生、换脸/对口型、补帧/扩图,以及一条片子的真实工作流。
四种核心能力
① 文生视频:一句话出片段;② 图生视频:给首图让画面动;③ 对口型/换脸:让角色说话;④ 补帧/扩图/运镜:把素材变长变稳变好。一个成片往往是这几样拼出来的,比如图生主体 + 文生转场 + 对口型配音。
真实工作流
先把脚本拆成分镜提示词 → 逐镜出视频 → 用 TTS 或声音克隆配旁白 → 进剪映/PR 合成、加字幕转场 → 导出。AI 负责"生",人负责"剪"和"审"。把机械生成交给模型,把审美判断留给自己,分工最清晰。
避坑
手部、文字、多人对话最容易翻车;长视频一致性难保。复杂镜头拆短、关键帧锁定主体,比一条硬撑到底稳。还有"抽卡"问题——同一条提示词出三五遍挑最好的,是常态,时间预算要算进去。
工具搭配
出片用可灵/即梦/海螺,配音用克隆人声,剪辑用剪映/PR,字幕用自动转写。把这些串成你自己的流水线,单人周更几条高质量短视频完全可行。先固定一套,再谈优化。
提示词怎么写出生视频
文生视频的 prompt 骨架是"主体 + 动作 + 场景 + 镜头 + 风格 + 时长"。比如"一个穿红裙的女孩在雨中慢慢转身,镜头缓慢推近,电影感,暖色调,4 秒",六要素都给到,出来的画面才有导演感。只写"好看的视频",模型只能给你一段最平庸的默认动画。
运镜词很关键:"slow push in(缓慢推近)""pan left(向左摇)""drone shot(航拍)"能决定镜头语言。中文模型直接写中文运镜也行,但混合英文专业词(tracking shot、low angle)往往更准。先模仿平台上"爆款"视频的提示词结构,比凭空瞎写进步快。
出片翻车怎么办
最常见的肢体扭曲、多只手,优先用"图生视频"——先出一张姿势正确的静帧,再让它"动起来",比纯文生稳得多。复杂动作(跳舞、打球)容易糊,拆成"小幅运镜"分多次生成再剪辑拼接,比一次硬刚长镜头靠谱。
另一个隐性坑是"首尾不一致":生成 5 秒和生成 10 秒可能是两个故事。要连续叙事就分段、每段锁参考帧。负向提示词(不稳定运动、变形)也能从源头压住翻车。出视频本质是"和模型讨价还价",多跑几版挑最好的那帧当种子,质量立刻上来。
