FFRAME / AI 导演课
课程进度0 / 12

AI VISUAL DIRECTION · BEGINNER COURSE

让 AI 服从你的镜头,不是让镜头服从模型。

从第一张图,到第一支短片。先学会判断镜头任务、选择模型、定位失败层,再学习提示词和参数。

12 章 × 4 个展开课节12 份可提交作业72 道导演判断题

CHOOSE YOUR FIRST OUTCOME

你现在最想完成什么?

选择不会锁死路线,只会优先标出与你当前目标最相关的章节。

你的当前路线做一个可控镜头

建议从第 01 章开始建立判断,再重点完成带有“你的路线”标记的章节。

进入课程路线 →

12 DEEP MODULES · 72 CHECKS · 12 LABS

不是知识目录,是一套可练习的工作方法

0% 完成

MODULE 01 · 建立判断 · 45 分钟

先拆穿“看起来很强”

区分表面逼真、任务正确、物理成立、导演通过与正式交付。

01
本章完成后能用六维验收而不是“像不像大片”判断一张图或一个镜头。
HARD TRUTH / 本章先拆掉的误区视觉逼真不等于物理理解;生成成功也不等于镜头完成。
4 个展开课节1 个完整案例1 份可填写作业6 道判断题
01

DEEP LESSONS

先理解为什么,再执行怎么做

01|五种“成功”不是一回事
工具出图只是技术终态,作品能否使用还要经过任务、事实、时空、审美与交付五道门。

新手最常见的误判,是把“模型成功返回文件”直接写成“作品完成”。导演要建立证据层:文件存在只能证明生成层;主体、产品与动作正确才能通过镜头层;来源、授权和状态清楚才可能进入交付层。

执行动作
  1. 先写镜头任务,再看画面
  2. 先验 P0 事实,再谈质感
  3. 明确标记 Candidate、导演通过、客户确认三种状态

警报:“高清、电影感、很真实”都不能单独证明镜头可用。

02|把质量拆成六个维度
单一总分会掩盖致命错误,必须逐项验收。

建议学习阶段固定检查:任务可读性、主体/产品一致性、构图与空间、时间连续、动作与物理、审美与品牌。VBench 系列也把视频质量拆成一致性、运动、语义、物理、常识与人体等多个维度,而不是只看“画质”。

执行动作
  1. 每个维度只写可观察结论
  2. 任何 P0 失败都阻止继续提质
  3. 为每个失败记录最早发生的层

警报:总评“八十分”可能掩盖 Logo 错、人物漂或因果不成立。

03|随机性是生产条件,不是借口
同一输入出现不同结果是生成系统的常态,所以必须设计候选、基线与停止条件。

提示词更像创意愿望清单,不是合同。专业流程不是追求一次命中,而是先定义候选规模,再从 P0 正确的结果中选基线,之后每轮只开放一个变量。没有停止条件的“再抽一次”只会把预算变成随机漫游。

执行动作
  1. 预先限定候选数
  2. 记录为什么保留或淘汰
  3. 连续两轮同类失败就检查控制载体或路线

警报:不要因为已经花了成本,就继续没有假设的生成。

04|导演的工作是减少错误自由度
导演思维不是写更多词,而是决定哪些变量开放、哪些必须冻结。

模型擅长在开放空间里找可能性;商业影像往往要求人物、产品、品牌和剪辑接口稳定。导演要把一个大问题拆成可控的镜头单元,让参考图、参数、结构控制、动作参考和后期分别承担最适合的职责。

执行动作
  1. 给每个输入分配单一职责
  2. 一个短镜头只保留一个主要变化
  3. 把精确资产留给真实素材或合成

警报:把所有控制都压进一段 Prompt,会让冲突变得不可诊断。

02

EVIDENCE / ADAPTATION

一手资料支持什么,导演方法又做了什么转译

边界:来源证明公开能力或研究结论;本章的镜头路由、P0/P1/P2 与制作取舍是面向广告创作的导演级转译,不是来源原文或模型保证。

03

FULL CASE STUDY

案例:一条“很真实”的玻璃杯坠落镜头为什么不能用

镜头任务

4 秒广告镜头:玻璃杯从桌沿滑落,落地碎裂,碎片停在产品前方形成引导线。

失败版本

画面光影精致、慢动作漂亮,但杯子下落前已变形,碎片像液体一样回流,产品标签在冲击瞬间跳字。

DIAGNOSIS / 为什么失败
  1. 表面画质通过,但 Physics-IQ 所强调的物理理解未通过
  2. 产品标签属于 P0,跨帧变化直接阻止使用
  3. “坠落—碎裂—构图落点”一次承担三段复杂状态,事件预算过载
REPAIR / 怎么重构
  1. 先用静帧锁定产品与最终碎片构图
  2. 把坠落与碎裂拆成两个镜头,在冲击声处切
  3. 产品使用真实 Packshot 或单独合成,不让生成模型重画标签
不要用“更高清”修物理和资产错误;要拆事件、换控制载体、保护真实资产。
04

SUBMITTABLE LAB

做一张六维拆片卡

选一张 AI 图或 3—5 秒 AI 视频,不写“好看/不好看”,逐项给出证据。

建议模板任务可读性:主体/产品一致性:构图与空间:时间连续:动作与物理:审美与品牌:最早失败层与下一步:
0 / 180还需要补足具体证据与决策
05 · DECISION CHECKS

不是背术语:用 6 个情境检验你会不会做决定

当前得分0 / 6通过线 5 / 6
Q01证据层
本地成功生成 MP4,最多能直接证明什么?
Q02验收
镜头质感很好,但产品 Logo 在第 20 帧变形,应该怎样定级?
Q03物理
Physics-IQ 最重要的生产提醒是?
Q04迭代
连续两轮同类穿模没有改善,最专业的下一步是什么?
Q05导演判断
四个候选里,哪一个最适合作为下一轮基线?
Q06状态
“导演自检通过”与“客户确认”之间是什么关系?
01 作业达到最低信息量02 测验至少 5 / 6已回答 0 / 6

字数只检查信息量下限,不代表内容自动正确;请同时用本章标准自评。

TOOL 01 · MODEL ROUTER

别先问谁最强,先问要控制什么

模型名称是当前能力示例,不是永久排名。建议会随着版本、地区、账号权限与项目条件变化。

AI 导演建议 · CURRENT EXAMPLE

图生视频 → 一个主要运动 → 短镜头迭代

图片承担人物、构图和风格;文字只控制主体运动、环境运动、运镜与时间。

Runway Gen-4.5Google Veo 3.1可灵视频 3.0 / 3.0 Omni
控制策略
你选择了平衡:允许局部探索,同时保留人物、产品与镜头任务的硬约束。
执行策略
质量优先:把结构、身份和动作分层解决,最后才做高分辨率与细节修复。
主要风险
起始图里的手部、透视和细节错误可能在视频里被放大。
切换条件
先修图,再降运动幅度;两轮无改善则换动作载体。
展开:当前模型能力地图(核对日期 2026-08-22)
指令式生图与编辑

GPT Image 2

高质量生成、编辑、高保真图片输入、文字与版式、连续迭代

概念图局部编辑文字画面产品环境合成

注意:遮罩属于引导而非绝对像素边界;精确品牌资产仍应保留真实锚点

官方 / 原始来源 ↗
审美探索与参考控制

Midjourney(当前版本以账号为准)

快速视觉发散、Image Prompt、Style Reference、Omni Reference 与构图探索

Mood风格探索人物概念世界观

注意:不同参考会竞争;细小 Logo、文字和几何不应视为精确还原

官方 / 原始来源 ↗
云端图生视频镜头

Runway Gen-4.5

主体、环境、摄影机运动与时间描述,适合短镜头迭代

图生视频运镜测试短镜头动态氛围

注意:输入图里的运动模糊、扬尘、错误接触会成为冲突线索

官方 / 原始来源 ↗
多输入音画视频

Google Veo 3.1

文生/图生、首尾帧、最多三张资产参考、延长与原生音频路径

首尾帧音画镜头资产参考短镜头延长

注意:当前具体型号存在 Preview / Stable 状态差异;中间物理仍需逐镜验收

官方 / 原始来源 ↗
多模态视频创作

可灵视频 3.0 / 3.0 Omni

当前官方指南列出文生、图生、多图参考、首尾帧、动作、口型与运镜控制

人物镜头多图参考动作控制首尾帧

注意:地区、账号与具体入口仍需实时复核;能力存在不等于每个镜头都能稳定遵循

官方 / 原始来源 ↗
本地节点工作流

ComfyUI

模型、节点、参数与 JSON 流程可记录,适合模板化、批量和复现

批量生产本地隐私流程复现结构控制

注意:工作流可复现不等于视觉自动通过;还需维护模型文件、节点版本和显存

官方 / 原始来源 ↗
开源多模式视频

Wan 2.2

T2V、I2V、TI2V、S2V、Animate 与 ComfyUI FLF2V 路径

本地视频首尾帧动作/人物实验开发集成

注意:14B 与 5B 路线硬件要求差异明显,先核显存和模型许可

官方 / 原始来源 ↗
开源可修复视频管线

LTX-2.5

快速、两阶段高质、关键帧插值、V2V、特定时间段 Retake 与 HDR 管线

快速原型局部 Retake关键帧本地生产

注意:官方快速下载示例模型组件体量约 66 GiB,本地部署并非小白默认第一步

官方 / 原始来源 ↗

TOOL 02 · SHOT CONTRACT BUILDER

一次只回答一个导演问题

完成后得到一份不依赖具体模型的镜头任务书。它可以先于 Prompt 使用,也可以交给任何图像或视频工具。

问题 01 / 05

观众第一眼要看见什么,最后要记住或感受到什么?

导演提示:写可观察的结果,避免“高级、震撼、有电影感”这类抽象评价。

TOOL 03 · FAILURE LAB

坏结果不是“运气差”,是某一层没解决

先找到最早失败层,再做一次最小、可验证的修复。不要用下游 Prompt 掩盖上游导演问题。

最早失败层目标 / 创意机制
P0

漂亮,但完全没用

画面可能完成了审美,却没有完成传播、产品或叙事任务。

下一轮只做这三件事

  1. 1把镜头任务改写成观众结果
  2. 2删掉不服务核心机制的装饰
  3. 3先做黑白缩略图验证第一眼信息
什么时候换路线

重新定义后仍无法形成清晰第一读,先暂停生成并回到创意。

不要:不要先提高分辨率或继续堆风格词。

TOOL 04 · P0 / P1 / P2 REVIEW

先判断能不能用,再判断够不够美

P0 是不能错的事实与任务;P1 是决定专业度的表现;P2 是可以局部修或后期处理的细节。

CAPSTONE · 12 SECOND FILM

结课作品:用三个镜头卖出“冰爽”

主题只是练习载体。真正要交付的是:镜头合同、三镜头短片、模型路由记录和一张 P0/P1/P2 验收卡。

SHOT 010—4 秒
建立渴感

建立渴感

镜头任务
近距离看到盛夏热感与冷罐之间的反差。
控制重点
静机位或轻微推进;人物只做一个伸手动作。
剪辑接口
手指触到罐身的瞬间切。
SHOT 024—8 秒
释放冰爽

释放冰爽

镜头任务
用一个可见变化把“冰爽”变成画面事件。
控制重点
拉环开启,冷雾与冰霜沿罐身生长;产品结构必须锁定。
剪辑接口
冷雾冲满画面,用声音完成连接。
SHOT 038—12 秒
产品收束

产品收束

镜头任务
回到完整产品、品牌和最终情绪。
控制重点
Packshot 真实锚定;生成只承担冷凝、背景光与微运动。
剪辑接口
Logo 清晰,声音落点后停留至少 12 帧。
01镜头合同

五问完整,可复制。

02三镜头成片

10—15 秒,有声音落点。

03生成记录

模型、输入、参考与选择理由。

04验收卡

P0/P1/P2 与未验证项分开。

SOURCES & EVIDENCE BOUNDARY

工具会变,判断方法要留下

模型能力来自官方文档与官方 GitHub,质量判断同时参考原始研究论文,核对日期为 2026-08-22。 站内建议是面向学习的导演路由,不是绝对排名,也不替代所在地区、账号与具体版本的实时验证。