胡泽贤 律师RULES & BEYONDAI VIDEO 00 / 2026

AI VIDEO / 零基础课程 00

AI 视频,不是一句话生成一部电影。

先不选工具,也不背提示词。把 AI 视频看成一组短镜头的生成与组装问题,你会立刻知道它擅长什么、为什么会漂,以及人还要负责哪些工作。

静态参考帧沿胶片分解为连续运动镜头并与声音轨汇合的编辑视觉
VISUAL METAPHOR / 主题隐喻时间轴 · 从一张画面到一段可核验的运动

第一次看 AI 视频演示,很容易产生一个错觉:输入一句描述,几十秒后,一条完整广告或短片就从无到有。真正的创作过程通常更像拍电影——先确定画面,再分别生成几个短镜头,最后通过剪辑、声音和字幕把它们组织起来。

理解这一点,能避免两种常见挫败:一是把所有情节塞进一个提示词,得到人物变形、动作打架的片段;二是只盯着最惊艳的一秒,却忽略整条视频能否连续观看。

可靠的 AI 视频流程不是“写一句话等成片”,而是“设计镜头—生成候选—挑选可用片段—剪辑与核验”。

01 / FRAMES模型生成的不是“故事”,而是一段随时间变化的画面。

视频可以粗略理解为连续播放的许多画面帧。图像模型只需要让一张图成立;视频模型还要让相邻帧之间的主体、位置、光线、动作和镜头变化看起来连续。

因此,视频生成多了一个很难的维度:时间。人物的脸第一帧正确并不够,转身后也要像同一个人;杯子不能凭空多一只,汽车转弯时轮子也不能突然改变形状。

评价视频时,不只看“这一帧好不好看”,还要看“前后是否还是同一个世界”。

02 / MODES四种入口,解决的是四类不同问题。

很多产品都写着“生成视频”,但你交给模型的起点不同,控制力也不同。零基础最应该先分清下面四种模式,而不是先追最新模型名称。

1

文生视频

只给文字,让模型同时决定主体、构图、风格和运动。自由度最大,也最容易偏离想象。

2

图生视频

先给一张起始图,再描述运动。画面起点更稳定,适合让产品图、人物图或场景图动起来。

3

参考生成

提供人物、物体、场景或风格参考,让多个镜头尽量保持同一套视觉身份。

4

视频编辑

输入已有视频,再改变风格、背景、物体或运动;更接近“修改素材”而非从零创造。

03 / CLIP FIRST先学会做一个镜头,再考虑完整短片。

当前大多数生成任务仍以数秒级短片为基本单位。一个镜头里只安排一个主要动作,成功率通常高于连续要求人物进门、坐下、喝水、说话、起身离开。

把 15 秒成片拆成三个 5 秒镜头:建立环境、展示动作、给出结尾。每段只承担一个叙事功能,最后在剪辑软件里连接。这种做法看似多一步,实际上更省生成次数。

  • 镜头一:让观众知道人在哪里。
  • 镜头二:让主体完成一个清晰动作。
  • 镜头三:给出结果、情绪或产品信息。

04 / HUMAN ROLE模型负责候选画面,人负责意图、选择和责任。

模型可以提出构图、生成运动、补出声音,却不知道哪一个镜头最符合你的真实目的。你仍然需要决定受众、节奏、事实是否准确、人物是否获得授权,以及发布时是否需要标识为 AI 生成。

所以 AI 视频不是取消导演、摄影和剪辑,而是把“拍摄素材”的成本结构改变了。好的结果仍然依赖分镜、素材管理、挑选、剪辑、声音和审查。

05 / FIRST TRY第一次练习:只让一张图发生一个动作。

找一张你有权使用的静物或风景照片,用任一可用工具做图生视频。只写一个动作,例如“镜头缓慢向前推进,树叶被轻风吹动,其他元素保持不变”。

生成后逐项观察:主体是否变形、背景是否漂移、镜头是否真的按要求运动、哪一秒开始出错。先建立观察能力,再谈提示词技巧。

官方来源与阅读边界

  • Runway 文生视频提示指南用主体、运动、镜头和风格描述短镜头
  • Google DeepMind Veo视频、参考图、场景延展与原生音频能力说明
  • 模型版本、价格、地区和产品入口变化很快;本文按 2026 年 7 月 26 日的官方资料核验。
  • 版权、肖像、声音和平台规则部分提供通用风险教育,不替代具体项目的法律意见。

下一篇:现在有哪些 AI 视频工具,普通人怎样选。

保持“短镜头、少变量、可核验”的顺序,不急着一次生成完整电影。

查看全部文章 继续 AI 视频课程

读者评论

把这篇文章留给你的想法写下来。

0 / 300

还没有评论。你可以留下第一条。