第 3 篇 · CH07
从电影镜头意图出发,以分层提示、受控实验和局部编辑,把探索图收敛为可追溯、可连续、能进入视频阶段的批准资产。
- 当前状态
- 完整章
- 预计学习时间
- 12 小时
- 关键概念
- 提示编译 · 约束层级 · 随机种子 · 单变量实验 · 局部编辑 · 蒙版 · 构图余量 · 接触表 · 关键帧批准 · 资产谱系
- 案例文件
- `demo/echo-cabin/prompts/image/PR-IMG-0001-v001.md`、`demo/echo-cabin/prompts/image/PR-IMG-0002-v001.md`、`demo/echo-cabin/production/prompt_experiments.csv`、`demo/echo-cabin/production/asset_manifest.csv`、`demo/echo-cabin/production/image_route_guide.md`
- 本章产出
- 把镜头意图编译为分层图片提示、区分探索图参考图关键帧和视频输入帧
- 最后核验
- 2026-09-05
第7章 图片提示、局部编辑、实验比较与资产定稿¶
写作状态
本章为完整章节。正文讲模型无关的图片生产方法;具体模型能力只出现在适配卡,并以官方资料与核验日期为准。《回声舱》的提示和表格是教学参考,不代表媒体已经生成或获得人工批准。
导读¶
图片生成最容易给初学者一种错觉:输入一段描述,挑一张最好看的图,工作就完成了。对于独立插画,这种方法有时够用;对于微电影,它会在下一步立即暴露问题。人物换一个景别便不像同一人,舱门在反打镜头中移动,手里的道具改变尺寸,首帧把角色挤在画面边缘,视频模型没有动作余量。单张图的魅力不能代替一组镜头的连续性。
本章把图片阶段定义为一次“生产资产收敛”:先把剧本、镜头表和视觉圣经翻译成图片可见的约束,再用受控实验辨认哪些语言和参考真正有效,最后把候选图修正、比较、记录并批准。生成只是其中一个动作;更重要的工作是提出可判定的问题、保存对照、诊断失败和知道何时停止。
这套方法专门照顾第一次做AI微电影的读者。你不需要预先理解扩散模型的数学,也不需要背诵某个模型的“神词”。你需要先分清四件事:你要制作哪一种图片;这张图片必须传递什么;哪些条件必须保持;你准备根据什么证据接受或拒绝结果。只要这四件事明确,更换模型只是在更换实现工具。
第6章已经建立视觉圣经、角色锚点、场景拓扑和参考职责。本章承接这些批准规则,不重新发明世界。读完后,你应能把“我想要一张电影感的太空舱图片”改写成一个可执行、可比较、可复现的镜头资产任务,并能解释为什么某张漂亮图片仍不该进入视频生产。
知识地图¶
四张图对应本章四个问题:提示如何分层;实验如何只回答一个问题;局部编辑与重生成怎样分流;图片如何从探索候选成为可追溯的生产资产。遇到模型结果不稳定时,先回到这些结构,而不是继续堆形容词。
学习目标¶
完成本章后,你应该能够:
- 区分角色设定图、场景母版、构图草图、镜头关键帧、视频首帧和尾帧的不同职责。
- 从镜头意图写出“主体与动作、空间关系、摄影、光线材质、保持与禁止”的分层图片提示。
- 理解随机性、种子、模型版本、尺寸和参考图为何都是实验条件,并在参数不可见时诚实记录。
- 设计一次只改变一个主要变量的A/B/C实验,用统一量表比较结果,而不是凭第一印象选图。
- 按错误层级判断应重写提示、重生成基线、改变参考、局部编辑还是接受边界。
- 为蒙版编辑写清“改什么、保持什么、不能改变什么、怎样输出”,并检查接缝、身份和空间副作用。
- 用接触表检查角色、空间、服装、道具和镜头连续性,建立图片资产谱系。
- 完成《回声舱》SH-001首帧与原创短片关键帧的候选比较和人工批准记录。
核心概念¶
- 提示编译:把上游创作决定转换成可见、可比较的生成约束,不是寻找万能关键词。
- 图片职责:一张图进入下游时承担的主要任务,例如身份、空间、构图、关键时刻或视频起点。
- 单变量实验:固定已知实现条件,一轮只研究一个主要创作问题。
- 局部编辑:保护大部分已批准关系,只在可界定区域修正低耦合问题。
- 动作势能与构图余量:关键帧中尚未完成的动作,以及为人物和摄影机运动保留的空间。
- 接触表:把一组候选或镜头并排,从集合层面检查身份、空间、状态和摄影连续性。
- 关键帧批准:人基于实际图像,为明确用途冻结一个版本并记录已知限制。
- 资产谱系:从上游文本、提示、参考和模型到编辑父版本、输出与派生文件的可追溯关系。
本章理论命题¶
图片生产的核心不是反复请求模型给出更好看的结果,而是把电影意图转换成可见约束,通过受控比较逐步减少不确定性,直到得到适合下一工序的资产。
这个命题包含三个判断。第一,图片的价值由用途决定;角色板、海报和视频首帧的成功标准不同。第二,模型输出具有随机性,单张结果不能证明一条方法可靠;必须保存条件和对照。第三,“批准”是创作者承担责任的决定,不是工具自动给出的分数。模型可以生成,脚本可以检查字段,只有人能判断它是否表达了这部片的意图。1
理论模块一:先定义图片职责,再讨论画面好坏¶
提出创作问题¶
假设你得到一张岑遥站在太空舱中的精美图片。她的脸很清楚,灯光有层次,服装细节丰富。它能否直接作为SH-001的首帧?答案不能从“好不好看”推出。当前 SH-001 的教学计划是她在通讯台前用右手食指缓慢校准圆环,随后把视线移向圆窗,摄影机短距离慢推;首帧必须给手部校准、视线转移和轻微推近留下余量。一张正面半身海报即使精美,也无法承担这个动作。
生产中的图片至少有六类。角色设定图负责身份结构;场景母版负责空间拓扑;道具图负责形状、尺度和可操作部分;构图草图负责景别、位置与视线;镜头关键帧负责某一时刻的叙事状态;视频输入帧还必须负责后续运动。把六种职责塞进一张图,会让每个职责都含糊。
理论解释与边界¶
电影画面不是孤立对象,而是时间链条中的一个状态。镜头开始前发生过什么,结束后要发生什么,决定当前画面的姿势、视线、持物和空间余量。静帧可以省略时间,但用于视频生成时必须蕴含可发展的动作势能。构图太封闭、动作已到极限、人物贴边或道具被遮住,都会减少模型可用的路径。
“用途优先”不等于每张图都朴素。海报可以追求凝缩和视觉冲击,角色板可以采用中性光与清楚轮廓,镜头关键帧可以有戏剧光。重要的是先写用途,再按用途判断。只有在探索早期,图片可以暂时没有明确生产职责;一旦进入定稿阶段,所有保留文件都应说明将被谁使用。
经典案例:《堤》的静止图像与时间¶
《堤》主要由静止影像组织,却通过画面顺序、持续时间、声音和少量关键变化建立强烈的时间感。单张图片的意义来自它在前后关系中的位置,而不只是图片内部内容。2 对AI微电影的启示不是仿制该片形式,而是:关键帧选择必须结合上一镜、下一动作和声音节点。两张单独优秀的图如果在人物朝向、空间方向或动作阶段上无法连接,放到时间线上便会失败。
《回声舱》深度推演一:一张岑遥图的六种用途¶
角色身份板中的岑遥应采用较中性的光线和姿势,展示脸型、下唇右侧小痣、左耳后短发、工作服版型和全身比例。场景母版应暂时无人,以免人物遮挡圆窗、气闸和控制台关系。SH-001构图草图只需要明确岑遥、控制台与圆窗的位置,不必生成皮肤毛孔。SH-001正式首帧则要同时满足身份、服装状态、空间方向、起始动作和镜头运动余量。
如果把身份板的白色背景三视图投入视频,它没有场景和光线;把有强烈侧光的近景当身份母版,后续正面或远景可能误读脸型;把最终动作姿态当首帧,视频没有发展空间。正确做法是让每张图只承担主要职责,其他信息通过有明确职责的参考补充。
转换成AI制作方法¶
每次生成前写一张“图片任务卡”:资产ID、所属镜头、图片类型、主要职责、必须可见、允许变化、不得出现、下一工序、接受标准。初学者只要能填完这九项,就已经避免了大量盲目生成。
例如:“类型:视频首帧;主要职责:建立岑遥在通讯台前校准圆环、尚未移开视线的起始状态;必须可见:控制台、圆窗与气闸的空间关系、右手食指的胶带;允许变化:背景小型管线细节;不得出现:第二个人、头盔、可读文字;下一工序:I2VA;接受标准:身份可辨、校准动作未完成、慢推仍有构图余量。”
成功、失败与边界(一)¶
成功:任务卡只设一个主要用途,构图和细节围绕下一工序;候选虽然不一定像海报,却能进入时间生产。失败:先生成“好看的图”,再临时寻找用途;所有图片都使用正面人物、极致细节和戏剧光。边界:一张图可以兼任多个相容职责,例如场景母版也可作为某个固定机位的关键帧,但必须分别检查每项标准,不能因为一个职责通过就默认全部通过。
理论模块二:提示不是咒语,而是把意图编译成可见关系¶
提出创作问题¶
“电影感、压抑、未来、8K、杰作”为什么常得到表面华丽却叙事含糊的图片?因为这些词表达评价,却没有告诉模型画面中哪些对象以什么关系存在。人类导演能从故事补全“压抑”,模型只接收到一组可能与训练图像相关的语言线索,可能用暗角、青橙、雾、霓虹或夸张构图来猜。
理论解释与边界¶
可执行提示应从可见事实开始。人物在哪里、面向哪里、正在动作的哪个阶段;场景中的固定物怎样排列;摄影机距离和高度如何;主要光源从哪里来;什么材质反射什么;哪些身份和结构必须保持。情绪词可以保留,但应由这些可见关系承载。
这种写法也延续了电影视觉结构以空间、线条、形状、明暗、色彩、运动与节奏组织观众经验的思路,而不是把风格缩成滤镜名称。9
提示可以分为五层。第一层是任务与画面类型;第二层是叙事内容和动作状态;第三层是空间与构图关系;第四层是摄影、光线、色彩和材质;第五层是保持、禁止和输出规格。顺序不是所有模型的语法要求,而是创作者检查遗漏的清单。
形容词不是越多越好。两个词如果要求相反的空间、光线或材质,模型只能折中或随机选择。“极简舱室、密集复杂管线、开阔空间、幽闭压迫、明亮高调、深黑阴影”同时出现,不叫丰富,而叫没有做决定。提示编译首先删除冲突,再补足关系。
经典案例:《异形》的环境叙事¶
《异形》的飞船空间并非用“恐怖科幻”一个标签建立。工业结构、狭窄通道、功能照明、湿润表面和人物尺度共同制造环境压力;不同区域又有明确功能和质地差异。3 若只复制“异形风”,既可能侵犯具体设计表达,也无法控制自己的世界。真正可迁移的是把抽象情绪拆成空间尺度、材质、光源和人物关系。
从视觉圣经到提示的编译表¶
先从第6章批准资料抽取,不要凭本轮灵感重写:
| 来源 | 提取内容 | 在提示中的位置 | 检查方式 |
|---|---|---|---|
| 角色圣经 | 强身份锚点、服装状态 | 主体、保持 | 跨候选接触表 |
| 场景圣经 | 拓扑、固定物、材质 | 空间、环境 | 与母版对照 |
| 镜头表 | 景别、机位、动作阶段 | 构图、摄影 | 与前后镜连续性对照 |
| 色彩脚本 | 本场明暗与功能色 | 光线、色彩 | 直方感受与主次检查 |
| 资产清单 | ID、版本、许可 | 记录层 | 路径与元数据检查 |
然后写“肯定关系”,再写少量真正重要的禁止项。负面列表若无限增长,通常说明正面设计还没有决定。禁止项应针对高概率且高损失错误,如多余人物、左右翻转的身份痣、错误舱门位置、可读品牌文字、多余手指或与剧情冲突的头盔。
《回声舱》提示编译示范¶
模糊需求:“岑遥在未来太空舱里,孤独,电影感,蓝色,细节丰富。”
第一轮编译:写明这是 SH-001 的 16:9 视频首帧;岑遥在通讯台前,右手食指正在缓慢校准圆环,视线尚未从控制台移向圆窗;圆窗在她左后,气闸在画面右,空间关系继承母版;宽景、正常视平高度与短距离慢推;低饱和冷灰舱壁,青绿仅来自控制台,人物肤色微暖;保持身份锚点和维修服结构;禁止第二人、头盔、霓虹城市、可读字样;为视线转移和轻微推近保留构图余量。
第二轮压缩:删掉不影响判断的“杰作、获奖、史诗、超高细节”;确认“固定中远景”没有同时要求“极端浅景深特写”;把“孤独”落实为人物与大面积冷硬空间的比例、视线没有回应对象、背景没有其他人。此时提示的每一部分都能在输出中指认。
转换成可复制模板¶
[任务] 生成/编辑哪一类图片,资产ID与镜头用途。
[主体与状态] 谁、身份锚点、服装状态、动作进行到哪一步、视线与持物。
[空间与构图] 场景固定物关系、主体位置、前中后景、负空间和画幅。
[摄影] 景别、机位高度、角度、镜头感、焦点与景深用途。
[光色材质] 主光来源、明暗层级、功能色、关键材质与反射边界。
[保持] 来自已批准参考且本轮不能改变的项目。
[禁止] 高概率高损失错误,保持短而具体。
[输出] 比例、用途、是否需要透明背景/中性光/动作余量。
这不是要求所有供应商理解方括号,而是帮助你先完成导演决策。输入工具时可按模型建议改写语序,但不要丢掉责任边界。
三种图片任务的完整改写示范¶
角色身份板。 任务不是“画一个美女宇航员”,而是建立后续镜头共同读取的身份母版。主体段应写年龄区间、脸型比例、发型轮廓、少量局部强锚点、体态和基础服装;构图段要求正面、侧面或四分之三视角之间留白,人物比例可比较;摄影段使用较中性视角与清楚光线;保持段列出左右位置敏感的特征;禁止段排除头盔遮脸、夸张妆容、戏剧烟雾、文字和多余人物。身份板不承担正片情绪,所以“极端背光、泪流满面、激烈奔跑”会妨碍职责。
无人场景母版。 任务不是“宏伟太空基地”,而是固定LOC-001中圆窗、气闸、控制台、入口和主要光源的关系。主体其实是空间本身;构图应能同时看见至少三个强固定物,摄影机高度接近后续常用机位;材质段区分舱壁、地面、防护玻璃和控制台,而不是统一写“金属”;保持段锁定拓扑和功能色;禁止段排除人物、漂浮杂物、巨幅品牌文字和无法解释的外部城市。母版通过的标准是能帮助设计反打,不是像建筑宣传海报。
视频首帧。 任务必须带镜头ID、预计动作和视频模式。主体段写动作起点而非结果;空间段写移动方向和负空间;摄影段写镜头是固定、推近还是轻微跟随,以便构图预留边缘;光色段继承场次状态;保持段引用已批准身份和场景;禁止段针对连续性与高风险生成错误。首帧还要说明“哪些信息可以在运动中出现”,避免强迫第一帧塞完全部叙事。
三种示范表面都包含人物、空间和摄影词,区别却在优先级。身份板若背景不够戏剧化不算失败;场景母版没有人物表演不算失败;首帧没有展示角色全身细节也不算失败。初学者的第一道判断题永远是:“这个缺点是否破坏它的主要职责?”
从自然语言到可判定句子的四次追问¶
第一问“在哪里看得见?”把抽象词落到画面。例如“紧张”可能表现为手停在按钮上方、肩部僵住、视线偏向画外,而不是再写一次“焦虑”。第二问“与谁或什么形成关系?”把孤立对象变成构图,例如人物比控制台小、眼睛朝向闪烁指示灯。第三问“发生到哪一步?”把静态姿势变成动作阶段,例如手已经抬起但尚未接触。第四问“如果模型做反了,我怎样识别?”形成接受标准,例如气闸必须在画面右侧且与母版透视可解释。
每一句都不必包含数字。可判定不等于伪精确;“人物占画面高度约一半”是构图范围,“焦虑度73%”通常没有可复查含义。使用大约、轻微、明显等词时,要补一个观察对象:轻微转头表现为鼻尖尚未越过肩线;明显背光表现为轮廓亮但面部仍保留可读层次。
提示冲突的逐句审稿¶
完成提示后,给每句标记职责:身份I、动作A、空间S、摄影C、光色L、材质M、禁止N、输出O。没有标记的句子可能只是评价噪声;同一职责中出现相反要求就是冲突。再检查跨层冲突:动作要求人物快速奔跑,摄影却要求极端浅景深中眼睛完全锐利;空间要求狭小舱室,构图又要求超远景展示广阔地平线;身份要求中性正面,光线却遮住半张脸。
解决冲突不是找一个更强的关键词,而是重新决定优先级。如果本图是身份板,牺牲戏剧光;如果是情绪关键帧,可允许部分脸落入阴影,但必须依靠发型、服装和体态维持身份;如果是动作首帧,降低精细手部展示要求或改变景别。提示审稿其实是微型导演会议,只是所有角色由一个人承担。
中文、英文与模型语言偏好的边界¶
不同模型与版本对中文、英文、长句、结构化指令和图像参考的响应会变化。不要先入为主地认为英文必然更好,也不要为了“专业”把中文意图交给未经检查的翻译。先用你能准确判断的语言写导演版提示,再根据官方建议制作模型版;两版一同保存。
翻译时最需要保护的是空间方向、动作阶段、否定范围和身份特征。若工具对复杂长句表现不稳,可拆为短句或节点字段,但不能把“刚开始回头”简化成“looking back”,后者可能把动作终点当当前状态。双语实验也应作为一个独立变量,保持其他条件后再比较。
负面提示与禁止项怎样写才有用¶
禁止项只应处理三类内容:会破坏叙事的错误、模型在当前任务中的高频错误、涉及权利或安全的内容。SH-001中的“不要第二个人”保护独角戏结构;“不要头盔”保护脸部身份;“不要可读品牌文字”保护后期和权利边界。把“低质量、最差质量、丑陋、糟糕、坏手、坏脸”等评价词无限复制,既没有说明正确关系,也会使实验难以解释。
正面结构能解决的问题优先用正面写法。例如,与其只写“不要广角畸变”,不如明确“正常视平高度、中远景、人物身体比例自然、控制台边缘保持平直可解释”;与其写“不要杂乱”,不如规定背景管线只作低对比次级纹理。禁止项是护栏,不是方向盘。
还要确认否定范围。编辑腕带时写“不要改变人物”,可能过于笼统,工具无法判断哪些像素属于人物;拆成脸型、发型、姿势、手的数量、袖口和背景构图更可检查。但保持项也不应达到几十条:若一次小编辑需要保护整幅图中大量脆弱关系,说明该模式风险过高,应缩小任务、选择更强控制方式或接受原瑕疵。
最后把高风险禁止项转成检查表。提示中写过“无第二人”,审核时就数主体;写过“痣不左右翻转”,就按角色视角核对;写过“无可读文字”,就放大检查界面。只有进入验收动作的禁止项,才真正成为生产控制。
提示的完成标准不是读起来华丽,而是另一名创作者能据此制作、比较和拒绝候选,并理解每一项约束来自哪一个上游决定。
理论模块三:参考图的价值在职责,而不是数量¶
提出创作问题¶
为什么加入更多参考有时反而更不像?因为参考之间可能在身份、服装、姿势、构图和光线方面互相冲突。模型未必知道你只想从A取脸、从B取衣服、从C取姿势;若不声明职责,它可能混合年龄、复制背景或把构图参考中的陌生人当主角。
理论解释与适用边界¶
参考是一种条件输入,但“条件”不等于“绝对服从”。不同模型和模式对身份、布局、风格、边缘、深度和蒙版的接受方式不同。创作者能做的是减少歧义:每张参考只分配一个主要职责;优先使用清楚、无冲突、来源可追溯的图;先建立无参考或单参考基线,再逐步增加控制。
常见职责包括:身份、服装、场景几何、道具结构、姿势、构图、光线、色彩和材质。身份参考应尽量减少强戏剧光与遮挡;构图参考不应被误当成角色或具体美术复制对象;风格参考只提炼关系,不复制受保护作品中的独特角色和设计。
多参考还会遇到信息预算。模型不一定同时精确保留八张图的所有细节。重要度必须排序:如果身份比姿势更重要,提示和筛选标准都应体现;姿势参考使身份严重漂移时,应撤掉姿势参考或改用更轻的结构控制,而不是继续加入第九张脸图。
参考职责卡¶
| 参考ID | 唯一主要职责 | 可继承 | 不得继承 | 冲突时优先级 |
|---|---|---|---|---|
| REF-CHR-001 | 岑遥身份 | 脸型、发型、痣 | 白背景、三视图排版 | 最高 |
| REF-CST-001 | 工作服 | 版型、材质、腕带 | 模特面孔、姿势 | 次高 |
| REF-LOC-001 | 舱室拓扑 | 圆窗、气闸、控制台关系 | 母版无人状态 | 高 |
| REF-COMP-001 | SH-001构图 | 人物占比、负空间 | 其中人物身份与色彩 | 中 |
若工具不能逐图设置强度,职责卡仍有用:它告诉你该减少哪些参考、怎样写提示、结果漂移时首先怀疑谁。不要伪造工具没有暴露的控制数值。
成功、失败与边界(二)¶
成功:先用身份图得到稳定基线,再加入场景;每加一张参考就比较新增收益和副作用。失败:一次上传十张不同风格图,要求“全部融合但保持一致”,失败后不知道是哪张造成冲突。边界:有些模型擅长多图语义编辑,仍不代表参考职责可以省略;能力更强只会扩大可选空间,不会替你决定哪种继承符合故事。
理论模块四:随机性必须被记录,实验才能产生知识¶
提出创作问题¶
你把“柔和侧光”改成“硬侧光”,第二张图更好。能否断言硬侧光更合适?如果第二次同时改变了随机种子、模型版本、尺寸、参考图顺序和编辑模式,答案是否定的。改善可能来自任何一项,甚至只是随机抽样。
理论解释与边界¶
生成模型从概率分布中取样。种子通常用于初始化随机过程,在同一实现、模型、工作流和参数下有助于复现或比较;但不同软件版本、硬件路径、节点实现或模型文件可能仍导致差异。种子不是图像的永久身份证,更不能跨所有工具保证相同画面。4
实验有三类变量。创作变量是构图、表情、光线、材质等你想研究的因素;实现变量是模型、版本、工作流、参数、尺寸、种子和参考;环境变量是软件提交、节点版本、硬件和精度。一次解释性实验只改变一个主要变量,其余尽量固定并记录。探索阶段可以宽松随机,收敛阶段必须控制。
“单变量”不是说整张图只有一个差异。改变机位自然会引起透视和遮挡联动;改变主光方向会改变阴影。它要求一次只提出一个创作问题,并接受该问题必然带来的从属变化。若同时改变机位、服装、表情和时间,比较就无法指导下一轮。
经典案例:《十二怒汉》的镜头策略递进¶
《十二怒汉》常被讨论为有限空间中通过景别、机位与镜头感变化增强压力的案例。变化不是每镜随意炫技,而是在同一房间和人物关系中逐步调整观众感受。5 图片实验可借鉴这种思维:保持角色、空间和剧情状态,只比较镜头距离或机位高度,观察哪种变化最清楚地支持场面命题。
实验矩阵的最小字段¶
每一行至少记录:实验ID、资产或镜头ID、提示版本、模型显示名与版本、生成/编辑模式、参考ID、尺寸、种子或not_exposed、唯一变量、输出相对路径、观察、评分、决策和日期。云端界面不显示种子时写not_exposed,不能凭空编一个数字;此时可保持同一会话、输入、参考和模型显示名,并承认复现能力较弱。
评分应与用途对应。角色板重点看身份、比例和可用视角;场景母版看拓扑与材质;首帧看身份、构图、连续性和动作余量。统一的五分制只为减少语言含糊,不应把审美伪装成科学测量。每个分数后写一句可观察理由,比分数本身更重要。
《回声舱》深度推演二:SH-001的三轮单变量实验¶
基线A固定岑遥身份、工作服、舱室母版、16:9、中远景和模型版本。唯一问题是“人物在画面中占多少比例才能同时表达孤独与可辨身份”。A1占画面高度约三分之一,空间压力强但脸部锚点弱;A2约二分之一,身份与环境平衡;A3约三分之二,人物清楚但像人物海报,右侧移动空间不足。选择A2,不是因为最华丽,而是因为它服务镜头用途。
第二轮固定A2全部条件,只比较头部动作阶段。B1完全背向声音来源,下一步回头路径清楚但观众读不到警觉;B2刚开始转头,颈肩有轻微扭转,既有起始状态又有动作势能;B3已经正对声源,动作完成。选择B2。
第三轮固定B2,只比较控制台青绿功能光强度。C1几乎没有,设备状态不清;C2局部发光,脸部仍由中性微暖光分离;C3青光覆盖全舱和皮肤,破坏人—系统色彩对立。选择C2。三轮合成的不是“最美参数”,而是一条可解释的导演决策链。
成功、失败与边界(三)¶
成功:每轮有问题、有保持项、有唯一变量、有观察和下一步;失败结果也保留缩略图与记录。失败:连点二十次,从中挑一张,事后编造“经过系统实验”。边界:灵感探索允许多变量跳跃,但一旦发现有价值方向,应回到可记录基线复测;否则经验无法迁移到第二个镜头。
理论模块五:局部编辑是保护已批准关系的修正手术¶
提出创作问题¶
一张候选图的构图、身份和空间都合格,只有腕带颜色错误。重新生成整张,可能修好腕带却改变脸、气闸和光线;局部编辑更合理。另一张图把气闸和圆窗位置颠倒,人物身体比例也错误,只修一块蒙版则会在错误结构上反复打补丁。何时编辑、何时重建,是图片生产的关键成本判断。
理论解释与边界¶
局部编辑适合“局部、可界定、与全局结构低耦合”的问题,例如去除多余标记、修正道具颜色、增加剧情污渍、替换小范围背景。重生成适合身份结构、姿势力学、透视、空间拓扑、主体数量和整体光线根本错误。介于两者之间的问题可以先做低成本编辑试验,但必须设停止条件。
局部修正仍应服从镜头设计和空间连续性:它不能把一个错误的场面调度变成正确镜头,只能在正确结构上减少可见缺陷。10
蒙版决定允许变化的区域,提示决定区域应变成什么,模型仍可能通过光线、纹理或边缘影响蒙版之外。蒙版不是绝对防火墙。编辑后要检查四圈:编辑区内部是否正确;边缘是否有接缝;邻近区域是否受污染;整图的身份、透视、光线和噪声是否仍统一。
编辑指令可用四段式:修改、保持、不得改变、输出。比如:“修改:将右腕带由红色改为磨损的低饱和橙色;保持:人物脸型、痣、发型、手指胶带、身体姿势、工作服版型、背景构图和光线完全不变;不得改变:手的数量、手腕比例、道具位置、画幅;输出:与原图同尺寸、同构图、无新增文字。”
蒙版的三个尺度¶
紧蒙版贴近目标边缘,保护性强,但容易产生接缝或无法重建必要阴影。宽蒙版包含目标及周边光影,更自然,却增加副作用。结构蒙版覆盖完整部件,例如整只袖口与手腕,适合版型修正,但可能改变姿势。先根据问题选择尺度,不要总用最大画笔涂一圈。
编辑次数也应受控。连续五次编辑会累积纹理、锐度、色彩和解剖差异。建议保留原始批准候选,每次从最接近基线的上游版本分支;若两至三次仍无法局部收敛,回到提示或重生成。不要覆盖原文件,否则你无法判断退化从哪一步开始。
成功、失败与边界(四)¶
成功:问题局部且接受标准清楚;蒙版包含合理上下文;编辑后全图复查并另存版本。失败:用小蒙版修复错误透视或整张脸;每次编辑都从上次失败图继续;最后找不到原基线。边界:换装看似局部,实则影响身体轮廓、褶皱、遮挡和光线,通常应覆盖完整服装区域或重生成角色状态变体,而不是只涂衣服中央。
理论模块六:关键帧必须同时满足静态叙事与动态可达性¶
提出创作问题¶
视频首帧不是“镜头最高潮截图”。如果人物已经倒地、门已经打开、表情已经达到峰值,接下来的生成只能维持、倒退或制造新动作。首帧应该位于可读的起始状态;尾帧应该在给定时长和动作强度下可达。
动作势能与构图余量¶
动作势能来自未完成的意图:重心刚移动、目光将转、手尚未触到拉杆、门缝刚出现。构图余量包括主体前方的行动空间、摄影机移动可能暴露的边缘、需要进入画面的道具和背景连续区域。首帧四边都塞满细节,推拉摇移很容易暴露未定义空间或裁掉关键动作。
首尾帧成对时,要估算变化是否与时长匹配。五秒内从站立到跨越舱室、拉下开关、灯光改变再回头,动作过载;首尾差异即使各自合理,中间也不可达。可以减少动作、延长镜头或拆镜。图片阶段发现不可达,比视频生成十次后才发现便宜。
经典案例:《后窗》的空间可读性¶
《后窗》通过稳定的院落关系、视线和观察位置,让观众逐渐认识空间。镜头变化建立在可理解的拓扑上,观众能判断人物在看哪里。6 对生成关键帧而言,空间母版与视线关系先于局部美感;若首帧和尾帧像来自两间不同房间,视频插值或生成无法替代场面调度设计。
SH-005关键帧诊断¶
SH-005 当前计划是岑遥按住通讯键问出一句短问句、松键后看向气闸;首帧应让按键动作刚刚开始而非已经结束,并给短横移、侧脸显露和松键后的安静把手留下余量。它是中景过肩,不应把下唇痣当成必然可见的近景门槛;应核对当前构图能看见的发型、维修服、右手食指胶带、控制台方向和功能光。
失败版本一把脸做成极端特写,手和设备消失,无法表现“身体被声音打断”;失败版本二让她张口大喊、手已离开设备,表演达到终点;失败版本三手指数量异常,设备按钮位置变化。修订顺序应是先恢复景别和手—设备关系,再修表演阶段,最后处理局部解剖。优先级反过来会在错误构图上精修。
理论模块七:接触表把单张审美转换成跨镜头连续性判断¶
提出创作问题¶
逐张全屏查看时,每张都可能不错;缩小并排后,人物忽胖忽瘦、发型忽长忽短、舱室忽宽忽窄、色温跳动立即可见。这是因为连续性是集合属性,无法只看一张图判断。
接触表的读法¶
第一遍只看身份轮廓:脸型、发型、体态和服装色块。第二遍看空间:固定物位置、视线方向、人物进出方向。第三遍看状态:污渍、伤痕、道具、灯光和剧情进度。第四遍看摄影:景别节奏、机位是否无意重复、色彩是否按脚本发展。每遍只处理一类问题,避免被局部细节分散。
接触表应标出镜头ID、资产版本和状态,不能只放无名缩略图。被拒绝候选可以进入失败表,但不得混在批准表中。图片尚未生成时使用明确的媒体位和状态标签,不能用空框冒充结果。
连续性不要求每张曝光和角度完全一致。剧情允许警示灯变化、角色移动和景别推进;接触表检查的是变化是否有原因。若两镜之间剧情没有换装,服装版型却变了,这是漂移;若断电后功能光熄灭,这是叙事变化。
《回声舱》八镜头的四遍检查¶
第一遍确认岑遥在 SH-001、003、005、006、007、008 中仍由同一组跨景别锚点识别。第二遍确认圆窗在人物左后、气闸在画面右、控制台在人物前方的关系能在不同机位中解释。第三遍按镜头表检查腕带、右手食指胶带、通讯台、机械锁和断电拉杆的出现与接触。第四遍查看冷灰—青绿系统色与琥珀警示是否按剧情发展,不让某一候选随机变成紫色霓虹。
任何一遍发现问题,都要回到对应上游:身份漂移回角色参考或提示;空间漂移回场景母版和构图;状态错误回连续性表;摄影节奏问题回镜头设计。接触表不是最后打分页面,而是定位责任层的工具。
理论模块八:批准是有条件的冻结,不是“永远最好”¶
提出创作问题¶
什么时候停止生成?如果目标是“还能不能更好”,答案永远是还能。生产需要在质量、成本、连续性和进度之间决定一个足够可靠的版本。批准不是宣称图像完美,而是确认它在当前用途、版本和已知限制下可以进入下一工序。
批准门槛¶
建议分六类检查。叙事:这一帧表达正确时刻吗?身份:角色、服装和状态一致吗?空间:拓扑、视线和持物连续吗?摄影:景别、焦点和余量适合镜头吗?技术:尺寸、色彩、压缩、边缘和明显生成错误合格吗?权利:来源、许可、同意和隐私记录完整吗?任何高风险项失败,不能由平均分掩盖。
批准状态可用candidate、needs-revision、approved-for-image-reference、approved-for-video-input、rejected。同一张图可能被批准作气氛参考,却不被批准作视频首帧。状态必须带用途,避免“approved”被所有下游误读。
自动工具只能检查路径、字段、尺寸、哈希和引用关系,不能代替观看。Codex可以列出冲突和缺项,不应自行把approval_status改为已批准。批准人应查看实际图像,并记录日期、用途、已知限制与替代版本。
资产谱系与版本¶
谱系回答“它从哪里来”:脚本版本、视觉圣经版本、提示ID与版本、参考资产ID、模型与模式、工作流、种子或不可见说明、编辑父版本、输出文件、哈希、许可和批准。它让你能够复现、回滚、替换模型并证明没有把失败候选误当成最终资产。
文件名建议包含镜头/资产ID、用途、版本,而不写“最终最终2”。例如SC-001-SH-001_first_v003.png,编辑分支可记v003-e01。哈希不是美学质量证明,它只证明文件内容是否与记录时一致。
成功、失败与边界(五)¶
成功:批准针对明确用途,关键门槛逐项通过,有已知限制和父版本;失败:因为已经花很多钱而批准,或把文件名改成final就认为完成。边界:预演阶段可以批准低分辨率构图草图进入分镜,不代表它能进入视频;阶段批准能节约成本,但状态名称必须防止越级使用。
理论模块九:模型适配层应可替换,主方法保持稳定¶
正文方法不依赖某一品牌:任务卡、提示分层、参考职责、单变量实验、编辑分流、接触表和批准谱系在不同工具中都成立。易变化的是输入模式、支持尺寸、计费、参数、模型文件和工作流节点。这些信息放在适配卡,并定期核验。
适配卡A:对话式/托管图片生成与编辑
适用任务: 快速自然语言探索、多轮语义修改、多参考组合。记录要点: 服务显示的模型名、日期、会话、输入图片、提示版本、输出原文件;若界面不暴露种子,明确写not_exposed。生产边界: 多轮对话可能引入未察觉的上下文;重要候选应另开清晰基线复测。服务能力、条款和数据处理规则可能变化,正式生产前核对其官方说明。
适配卡B:ComfyUI节点式本地工作流
适用任务: 需要明确工作流、模型文件、种子、参数和可回滚对照。ComfyUI官方文档说明工作流可用JSON保存,生成图片也可包含工作流元数据;模型文件通常放入相应models子目录。7 记录要点: ComfyUI提交、节点版本、模型文件哈希、工作流JSON、精度、尺寸、种子、耗时和峰值显存。生产边界: 工作流能运行不等于结果适合影片;第三方节点和社区量化必须单独审计来源与兼容性。
适配卡C:Qwen-Image/Edit教学候选
Qwen官方将Qwen-Image描述为20B MMDiT图像模型,强调文字渲染与图像编辑;官方模型卡与ComfyUI教程提供当前模型和工作流入口。8 本教材只把它作为可替换候选,不预设本机显存、速度或特定量化一定可用。先用官方基线验证,再测试编辑;记录准确版本和许可证。旧归档中的FP8路线标注为“教学参考/未实机验证”,不能因文件存在就写成GPU实测。
小白执行路线:第一次图片生产¶
- 只选一项低风险资产,例如岑遥中性身份板或无人舱室母版。
- 填图片任务卡和接受标准,不启动付费资源。
- 选一个工具和一个模式,保存基线提示为
v001。 - 生成少量候选,保存原文件,不覆盖。
- 建接触表,只比较一个问题;记录模型显示名和不可见参数。
- 选最接近用途的候选,不选“最炫”的候选。
- 若问题局部,分支编辑;若结构错误,回到基线重生成。
- 通过身份、空间、技术和权利检查后,由本人批准具体用途。
- 再进入下一个资产,复用已批准参考,不重新发明角色。
理论模块十:失败诊断应沿责任层向上追溯¶
看到坏图时,初学者常在提示末尾加入更多词。更可靠的诊断从最高层开始:任务是否错误?构图和动作阶段是否矛盾?参考是否冲突?提示是否漏掉关系?模式是否选错?参数和种子是否失控?最后才是局部瑕疵。
常见故障树¶
身份漂移: 先检查强锚点是否跨景别可见、身份参考是否清楚、服装或姿势参考是否带入陌生脸、提示是否同时要求年龄和脸型变化。若只有眼睛颜色略偏,可局部编辑;若脸型、年龄和体态同时变化,应重建身份基线。
空间漂移: 检查场景母版和拓扑关系是否进入任务、反打是否正确理解左右、构图参考是否来自另一空间。气闸位置根本错误时,不要只在墙上涂一个门;先恢复空间结构。
手与道具错误: 检查动作是否过于复杂、手被遮挡、道具结构是否有参考、接触状态是否明确。可以将动作拆到更简单阶段,先得到清楚的手—道具关系,再局部修正。局部编辑仍不能稳定时,应考虑改景别、遮挡或拆镜,这属于导演解决而非模型失败。
画面像海报: 通常是人物正面居中、光线过度戏剧化、细节和氛围词占据提示,缺少动作阶段、空间关系和镜头前后。删除评价词,恢复镜头任务和负空间。
局部编辑污染全图: 缩小蒙版或改变蒙版上下文,从原基线重新分支;明确保持项;检查模式是否真支持局部控制。不要继续在污染版本上叠加。
实验无法解释: 若没有记录模型、参考、提示版本和唯一变量,这轮只能算探索,不能伪装成对照。选择一个候选作为新基线,重新做可解释实验。
边界案例:模型始终做不到怎么办¶
创作者有五种合法选择:降低细节要求;改变景别或遮挡;拆分资产或镜头;换用更适合的模式;接受限制并在剪辑中规避。第六种错误选择是无限生成,希望概率自动替你解决设计矛盾。模型边界也是制片边界,承认它能帮助作品完成。
理论模块十一:技术合格不是审美附属,而是下游可用性的前提¶
提出创作问题¶
同一张图在聊天窗口里看起来很好,下载后却只有较小尺寸;人物脸在缩略图中自然,放到视频首帧后眼睛边缘出现重影;画面构图为方形,硬裁成16:9后手和气闸被切掉。为什么审美选择已经完成,资产仍不能交付?因为创作判断与技术载体是两个同时存在的层面。
图片进入视频前,至少要核对像素尺寸、画幅比例、色彩表现、压缩痕迹、透明通道、文件格式、方向信息、边缘完整性和文件可读性。这里不预设一个永恒正确的分辨率:不同视频模型、剪辑时间线和发布平台会变化。正确流程是先查当前下游输入要求,再决定生成和导出规格;不要把某个工具今天支持的数字写成通用电影理论。
画幅应在构图前决定¶
画幅比例不只是裁切模板,它决定横向与纵向空间如何分配。16:9横幅可以容纳人物与舱室关系,9:16竖幅更强调人物上下结构并压缩左右行动空间。若最终是横屏微电影,却一直用方图探索,模型会把关键信息聚集在中央;后期扩图或裁切未必能补回有意义的两侧空间。
建立基线时就按目标画幅构图。工具只提供接近比例时,应标注后续安全裁切框,把身份锚点、手部动作、关键道具和视线终点放在安全区域。扩图可以补足边缘,但新增空间必须遵循场景拓扑、光源和透视;扩出的墙面不是无责任的填充。
分辨率、细节与实际观看距离¶
像素更多不自动带来更多有效信息。低质量生成放大后可能只是更清楚地暴露伪纹理;强锐化会让皮肤、发丝和金属边缘在视频运动中闪烁。先在目标展示尺寸检查叙事和连续性,再以100%检查局部错误,最后缩回目标尺寸确认修复没有制造新噪声。
身份参考需要足够清楚地表达强锚点,但视频首帧还要考虑后续运动稳定性。细密网格、重复小字、极细管线、密集发丝和高反差纹理容易在时序生成中抖动。若某个细节既不服务身份、剧情或空间,又会增加不稳定,应在视觉设计阶段减掉,而不是指望视频后处理全部解决。
色彩与明暗的最低检查¶
不同查看器、浏览器和剪辑软件可能对色彩配置、HDR/SDR或透明度显示不同。小白不必先成为色彩工程师,但应坚持三步:在同一受控查看环境比较候选;保留原始下载文件;进入剪辑软件后再确认肤色、黑位、功能灯和高光没有明显改变。截图、聊天预览和社交平台压缩图不应成为唯一母版。
过暗画面在高亮显示器上可能可见,在普通手机上却糊成黑块;过亮功能灯可能遮掉界面和手部。用视觉圣经规定的相对层级检查,而不是追求某个没有上下文的数值。若项目建立了色彩管理方案,则记录色彩空间和转换;若尚未建立,至少避免在不明环境中反复另存。
文件完整性与派生关系¶
每个批准文件应能实际打开,尺寸与记录一致,文件名和内容匹配。将文件哈希写入资产清单,可以发现后续静默覆盖;它不能判断图片好坏,但能确认“今天交给视频的文件”是否仍是昨天批准的内容。
保留三层文件:原始生成输出、经过批准的编辑母版、为特定下游导出的派生文件。派生文件可裁切、缩放或转换格式,但要指向母版,不能反过来覆盖母版。若视频模型需要一种尺寸,剪辑需要另一种尺寸,两者可来自同一批准母版并各自记录用途。
成功、失败与边界(六)¶
成功:目标画幅从构图开始;原始、母版和派生文件分开;在实际视频输入与剪辑环境各检查一次。失败:下载预览截图后改名为母版;方图硬裁导致动作空间消失;用放大工具掩盖身份或结构错误。边界:构图草图可以低分辨率,只要状态明确且不越级投入视频;技术门槛必须与阶段用途匹配。
理论模块十二:版权、同意与数据边界必须进入图片工作流¶
提出创作问题¶
一张图由AI生成,是否天然可以公开、商用或用作他人面孔的替代?不能这样推断。模型服务条款、模型许可证、输入素材权利、人物肖像与隐私、商标和最终作品的司法管辖都可能影响使用。技术生成成功只说明文件产生,不说明你拥有所有需要的权利。
四层来源记录¶
第一层是模型或服务:准确名称、版本、访问方式、当日条款或许可证入口。第二层是输入参考:自己创作、已授权、公共领域、许可素材或仅供分析;记录作者、来源、许可范围和日期。第三层是人物与声音:真实人物是否同意其肖像、身体或身份被用作生成参考;不得把私人照片默认当生产素材。第四层是输出用途:内部学习、公开非商业展示、比赛、平台发布或商业交付,对应风险不同。
“参考某种电影感”与直接复制一个受保护角色、独特服装或具体画面不是同一回事。教材中的经典影片只用于文字分析,我们提炼构图、空间、光线和节奏关系,不提供版权剧照,也不鼓励提示直接要求模仿在世艺术家或复制特定作品。原创性不是简单避开名字,而是从主题与自己的视觉圣经建立一套关系系统。
肖像、隐私与敏感输入¶
使用自己的照片也要考虑平台数据处理和未来用途;使用朋友、演员、同学或网络人物的图像应取得适合用途的明确同意。身份证件、家庭地址、医疗信息、未成年人照片、未公开工作资料和带位置元数据的私人图片,不应为了“参考更准确”随意上传云端服务。
本地运行减少了上传到第三方服务的环节,但不自动解决模型许可证、参考素材权利或设备安全。云端服务方便,也不自动拥有你输入的一切。选择路线时记录数据会去哪里、保留多久、谁能访问;条款不清时,使用去身份化或原创参考,或暂停投入敏感数据。
商标、文字和虚构界面¶
生成图可能无意出现品牌标志、可读文字或酷似现有产品的界面。科幻舱室中的乱码不仅是美术瑕疵,也可能在后续编辑中变成看似真实的品牌或警告。生产提示应禁止不必要的可读品牌文字;需要剧情文字时,优先在后期以可控设计添加,并记录字体许可。
如果画面必须呈现通信记录、编号或界面,先生成没有可读内容的结构底图,再在后期排版。这样可以保持语言正确、跨镜一致,也避免反复生成文字导致构图和身份变化。模型擅长文字渲染与否,是适配层能力,不改变“关键叙事文字应可校对、可修改、可授权”的原则。
发布前复核¶
许可证和服务条款会变化,模型卡中写明的许可也不必然覆盖全部输入与输出法律问题。因此资产清单中的license字段不是一次填写永久有效。正式发布、参赛或商业交付前,按当日用途重新核对官方来源;不确定时向合格专业人士咨询。本教材提供的是生产记录方法,不构成法律意见。
成功、失败与边界(七)¶
成功:每个关键参考可追溯,人物同意与用途对应,敏感素材不进入不明服务,发布前复核条款。失败:写“AI生成”便认为无版权问题;从搜索结果保存图片却不记来源;把同学照片上传后再询问同意。边界:内部构图草图也应记录来源,但风险和正式商业海报不同;记录应与实际用途成比例,不能因为是学习项目就完全忽略。
完整失败诊断表:从现象回到责任层¶
| 可见现象 | 最可能责任层 | 先检查 | 不建议的第一反应 | 合理下一步 |
|---|---|---|---|---|
| 人物不像同一人 | 身份/参考 | 强锚点、身份图、参考冲突 | 加十个“same person” | 单参考复测身份基线 |
| 人物正确但像证件照 | 任务/构图 | 图片类型、动作阶段、空间关系 | 增加更多风格词 | 重写镜头任务和负空间 |
| 舱门位置改变 | 场景/拓扑 | 母版、反打方向、构图参考 | 局部画一扇新门 | 回到场景构图基线 |
| 手指或持物异常 | 动作/局部 | 遮挡、接触状态、动作复杂度 | 无限重抽同提示 | 简化动作或结构编辑 |
| 光线漂亮但不连戏 | 色彩脚本 | 前后镜、光源动机、状态变化 | 用调色完全补救 | 固定光源关系再生成 |
| 编辑后脸也变化 | 编辑边界 | 蒙版、保持项、父版本 | 从污染版继续编辑 | 从原基线重分支 |
| 首帧没有动作余量 | 镜头设计 | 动作起点、主体位置、画外空间 | 让视频“自由发挥” | 前移动作阶段或重构图 |
| 结果无法复现 | 实验记录 | 模型、版本、种子、工作流、参考 | 编造缺失参数 | 标为探索并重建基线 |
| 文件能看但下游拒绝 | 技术规格 | 格式、尺寸、通道、路径 | 随机转码覆盖母版 | 从母版导出合规派生文件 |
| 画面可用但权利不明 | 来源/许可 | 模型条款、参考来源、人物同意 | 先公开再处理 | 暂停发布并补权利审计 |
诊断表不是自动判决。它的作用是把“图片不好”拆成可行动的上游责任。若现象同时涉及多层,按影响范围从上到下处理:任务和结构先于局部;身份和空间先于纹理;叙事与连续性先于像素级完美。
案例推演¶
以下纵向案例把前述理论串成一条真实可执行的收敛路径。所有步骤都区分“已有文本”“教学推演”和“实际媒体”;没有生成文件时不填写输出和批准。
《回声舱》图片资产纵向收敛¶
第一步:从批准文本建立基线¶
读取character_bible.md、world_bible.md、visual_bible.md和镜头表,提取岑遥强锚点、舱室拓扑、色彩关系与SH-001动作。不要直接复制整篇文档给模型;把与本图相关的内容编译成任务卡。角色永久身份与本镜状态分开,避免把剧情污渍永久写进角色身份。
第二步:制作三种母版¶
身份母版用中性光和清楚视角,优先脸型、发型、痣、体态与服装版型;场景母版无人,优先圆窗、气闸、控制台、入口与材质;道具母版优先尺寸、正反面、操作点。母版不是正片画面,不需要故意加大雾、眩光或极端景深。
第三步:编译SH-001提示¶
仓库中的prompts/image/PR-IMG-0003-v001.md是 SH-001 首帧的教学参考。使用前检查它是否与当前镜头表、空间和视频模式一致。提示ID不等于结果文件;若尚未实际生成,资产清单仍应保持text-approved或pending,不能填图片哈希或approved-for-video-input。
第四步:执行三轮单变量实验¶
按本章前述人物占比、动作阶段和功能光强度顺序,每轮保留上一轮选定条件。将真实输出相对路径写入prompt_experiments.csv;没有输出时保持表格空,不编造评分。失败图放入本地非Git媒体目录或合规精选媒体目录,按项目规则处理。
第五步:局部修正与全图复查¶
若B2/C2的腕带颜色错误而其余通过,从该候选建立编辑分支;记录父版本、蒙版与四段式指令。编辑后先看腕带,再看手腕边缘、手指数、袖口褶皱、脸部身份、背景气闸和整体色温。任何非目标项退化都要记录。
第六步:接触表与批准¶
把SH-001与相邻镜头关键帧并排,按身份、空间、状态、摄影四遍检查。批准记录写清“仅批准作为SH-001 I2VA首帧”或其他实际用途,列出已知边界。人工没有看过图片前,任何工具都不得代填批准。
第七步:把提示演进写成可审查记录¶
v001可能只有角色、舱室和“电影感”,结果像宣传海报。诊断不是“模型不懂”,而是任务、动作阶段和空间关系缺失。v002加入SH-001用途、人物左中位置、刚开始回头、固定中远景和右侧行动余量;若身份开始漂移,说明镜头约束加入后身份参考不足或发生冲突。v003固定身份参考,只调整人物占比;v004固定选中的占比,只调整功能光。
每个版本都写“为什么改”和“预期观察”。若v004反而更差,退回v003不是失败,而是实验结论:该功能光写法或强度不适合当前基线。不要把所有历史版本合并成一条巨长提示;最终生产提示应保留经过验证的必要约束,同时让版本史解释被删除的尝试。
提示演进记录可以这样写:
| 版本 | 唯一主要改动 | 预期 | 实际 | 决策 |
|---|---|---|---|---|
| v001 | 建立无镜头约束探索 | 看角色与世界大方向 | 像海报,空间关系弱 | 不作生产基线 |
| v002 | 加入用途、动作起点与构图余量 | 获得可运动首帧 | 方向正确,脸部略漂 | 保留构图 |
| v003 | 固定身份参考 | 恢复岑遥锚点 | 身份通过 | 新基线 |
| v004 | 控制台青光由弱到中 | 建立系统存在感 | 中等强度通过 | 候选待全片比较 |
这张表描述教学推演,不等于仓库已经有真实输出。只有执行后,才把实际文件路径、模型和评分写入项目CSV。
原创短片迁移:从第一个关键帧扩展到全片¶
不要一开始生成所有镜头。先选一个“高信息、不过载”的代表镜头:主要角色出现、核心场景可见、关键光色存在,但动作相对简单。它能同时检验身份、空间和视觉方向。代表镜头通过后,才制作身份母版、场景母版与相邻镜头;若代表镜头暴露视觉圣经矛盾,修订成本仍低。
第二步选择一个压力镜头。压力镜头应挑战不同条件,例如极近景、背面、强遮挡、复杂持物或警示光。它不是为了炫难度,而是测试当前身份锚点和场景规则是否跨条件成立。代表镜头与压力镜头都通过,才说明视觉体系具有一定韧性。
第三步制作全片接触表的低成本版本。可以用构图草图或较低分辨率候选先检查景别节奏、视线、方向和色彩脚本,不必每张都精修。若第六镜才发现前五镜全是同一正面半身,应该回镜头设计;此时继续超分只会放大错误。
第四步按镜头风险排序。身份近景、复杂手部、重要道具、首尾帧跨度大、强空间连续性的镜头先做;过场空镜、可被剪辑缩短或替换的镜头后做。风险排序让有限预算先回答“影片能不能成立”,而不是先完成最容易的图片数量。
第五步冻结一批,而不是逐张孤立批准。每批应至少包含一个角色集合或一段连续镜头。批次批准后,下游才能稳定工作;任何上游变化都要列出受影响镜头,避免悄悄用新版脸替换一张后破坏全片。
原创项目的范围削减示范¶
若角色一致性始终不稳,可把双主角八地点方案缩成单主角两地点;用声音建立画外角色;减少无叙事功能的换装;让高风险手部动作分镜化或藏在合理遮挡中。若空间漂移严重,可围绕一个可识别的固定物设计机位,而不是每镜展示全新房间。若预算不足,优先批准叙事关键帧,次要过场用剪辑、声音和现有空间重组。
范围削减不是让作品“变差”,而是把有限控制力集中到观众真正需要相信的关系上。一部角色可信、空间连贯、声音有意图的短片,通常比每镜奇观但彼此无关的样片更接近电影。
制作方法¶
一套从零可执行的十二步流程¶
- 读上游。 确认脚本、镜头、视觉圣经和资产状态是当前版本。
- 定类型。 明确是身份板、母版、草图、关键帧、首帧还是尾帧。
- 写职责。 用一句话说明它进入哪个下游、解决哪个问题。
- 列门槛。 必须可见、允许变化、禁止项和可接受边界各列三至五项。
- 编译提示。 按五层结构写可见关系,删除互相冲突的形容词。
- 分配参考。 每张图一个主要职责,记录来源与许可。
- 冻结基线。 记录模型、模式、版本、尺寸、种子/不可见、参考和提示版本。
- 少量探索。 先获得基线,不直接批量生成几十张。
- 单变量比较。 一轮一个创作问题,统一尺度观察。
- 选择修订路径。 结构错则重建,局部错则编辑,工具边界则改设计。
- 集合检查。 用接触表检查身份、空间、状态和摄影连续性。
- 人工批准。 填用途、版本、哈希、权利、已知限制和批准日期。
常见误区¶
误区一:把提示写得越长越专业¶
长度不能替代决定。长提示若充满重复风格词、冲突摄影要求和不可见细节,只会增加歧义。专业提示的标准是每一段有职责,结果能按段检查。
误区二:把种子当成跨平台永久复现码¶
种子只有在模型、实现、工作流、参数和环境足够一致时才有比较价值。工具未暴露种子时如实记录;不同系统结果不同不等于有人操作错误。
误区三:失败图立即删除¶
失败图与记录能告诉你哪些组合不工作。可保留低分辨率接触表或合规本地文件,不必把所有大图提交Git;但至少记录失败类别、条件与修订决策。
误区四:用局部编辑挽救所有问题¶
透视、身份、姿势和空间结构是高耦合问题。过度编辑会积累接缝和风格差异。为局部编辑设置次数和退回基线的条件。
误区五:只在100%放大看细节¶
电影观众按实际画幅和持续时间观看。先按接近交付尺寸看注意力、身份和构图,再放大检查手、边缘和纹理。微小瑕疵若在最终尺寸不可见,优先级可能低于动作余量。
误区六:一张漂亮图自动成为批准资产¶
候选图必须通过用途、连续性、技术和权利检查。批准状态由人基于实际文件填写,不能从提示文件、空路径或脚本“通过”推断。
误区七:模型更新就自动替换生产基线¶
新版本可能更强,也可能改变脸、构图、参数、显存与许可条件。先在独立分支复测已知镜头,再决定迁移;不要在影片中途无记录换模型。
正文练习¶
以下练习均为可选,不阻塞阅读进度。
练习一:把情绪词改写为可见关系¶
选择“孤独、温暖、危险”之一,写出人物占比、空间、视线、主光、功能色和材质关系。不得只用同义形容词。然后说明其中哪一项如果反转,会改变叙事判断。
参考判断
以“孤独”为例:单人占画面较小比例;人物视线指向画外但没有回应主体;环境固定物尺度大;主光只覆盖人物局部;背景功能光重复且冷;材质硬而缺少生活痕迹。孤独并不必然等于暗,明亮、空旷且没有回应也可成立。关键是关系,不是固定配方。
练习二:图片区分职责¶
为同一角色分别写身份板和视频首帧任务卡。比较两者在光线、姿势、背景、身份可见性和动作余量上的不同。
参考判断
身份板优先中性可辨和多视角,动作与背景应减少干扰;首帧优先特定镜头状态,需要场景、光线、视线和可发展动作。首帧可只显露部分身份锚点,但必须与批准身份一致。
练习三:设计三条单变量实验¶
保持模型、版本、模式、参考、尺寸、种子和提示其他部分不变,只比较主光方向:左侧、正面、背后。为每个版本写预期观察和同一接受标准。
参考判断
标准不应是“哪个更好看”,而应是脸部是否可读、人物是否与环境分离、光源是否能由场景解释、是否支持该时刻情绪。改变主光会连带改变阴影,这是该变量的自然结果,不算偷偷改第二变量。
练习四:判断编辑还是重生成¶
候选图A只有腕带色错;B人物年龄与脸型错;C门的位置错但人物通过;D袖口有小接缝。为每项选择局部编辑、重生成或接受,并说明风险。
参考判断
A通常局部编辑;B重建身份基线;C若门是空间强锚点,通常回场景/构图重建,局部画门可能破坏透视;D先按交付尺寸判断,可见且影响连续性才编辑。决定取决于问题耦合度和用途,不是固定按钮。
练习五:原创片迁移¶
从你的短片挑一个镜头,写出图片任务卡、五层提示、三张参考职责卡和一轮实验矩阵。假设模型不暴露种子,说明你还能保持哪些条件,哪些结论必须降低置信度。
参考判断
可保持同一会话、模型显示名、模式、输入参考、提示其他部分、尺寸和操作顺序,并保存时间与原文件。仍不能保证精确复现,因此结论应写“在当前会话样本中更符合标准”,而不是宣称变量具有普遍因果效果。
章节小结¶
图片阶段是电影生产的一环,不是作品墙。先定义图片类型和下游职责,再把电影意图编译成可见关系;参考图按唯一主要职责使用;探索发现方向,单变量实验解释方向;局部编辑保护已批准关系,结构错误则回到上游;关键帧既要静态成立,也要为时间和动作留余量;接触表把单张审美转换成集合连续性;最终批准必须针对具体用途,并保留完整谱系。
对初学者而言,最重要的进步不是第一次就写出“完美提示”,而是每次都知道自己在解决哪个问题。只要能保存基线、一次改变一件事、说清接受标准、诚实记录工具没有暴露的信息,你就在积累可迁移的导演与制片知识,而不是依赖偶然好运。
章末工作簿¶
打开第7章工作簿。工作簿提供图片任务卡、提示编译表、参考职责卡、实验矩阵、局部编辑决策树、接触表审核和批准记录的可复制模板。
注释与书目¶
延伸阅读¶
- ComfyUI文生图官方教程:核对工作流、节点与当前界面。
- ComfyUI Qwen-Image官方工作流:核对当前模型文件与工作流入口。
- Qwen-Image-Edit官方模型卡:核对版本、许可证与示例代码。
- 《回声舱》图片路线指南(私有案例资料,公开版不提供下载):项目内教学参考,使用前确认状态。
- Bruce Block, The Visual Story, 3rd ed., Routledge, 2020。
- Blain Brown, Cinematography: Theory and Practice, 4th ed., Routledge, 2021。
-
本章关于“职责—约束—实验—批准”的流程、五层提示结构与四圈编辑复查,为教材针对单人AI微电影生产提出的原创综合框架。 ↩
-
Chris Marker, La Jetée, Argos Films, 1962。本文仅概述其静止图像、声音与时间组织的形式,不复制剧照、剧本或对白。 ↩
-
Ridley Scott, Alien, 20th Century Fox, 1979。本文只分析工业空间、功能照明与人物尺度的组织,不复刻具体美术设计。 ↩
-
Jonathan Ho, Ajay Jain, Pieter Abbeel, “Denoising Diffusion Probabilistic Models,” NeurIPS 2020;Robin Rombach et al., “High-Resolution Image Synthesis with Latent Diffusion Models,” CVPR 2022。用于理解概率采样与潜空间生成的技术背景。 ↩
-
Sidney Lumet, 12 Angry Men, United Artists, 1957;Sidney Lumet, Making Movies, Vintage, 1996。本文将有限空间内的镜头递进作为文字化创作分析。 ↩
-
Alfred Hitchcock, Rear Window, Paramount Pictures, 1954。本文只分析稳定空间、视线和观察关系,不收录版权画面。 ↩
-
ComfyUI, “Getting Started with AI Image Generation”与“Text to Image Workflow”,2026-09-05核验。官方文档说明默认文生图流程、模型目录、工作流JSON以及从含元数据图片载入工作流的方法。 ↩
-
Qwen Team, “Qwen-Image: Crafting with Native Text Rendering,” 2025-08-04;Qwen/Qwen-Image-Edit官方模型卡;ComfyUI官方Qwen-Image工作流教程,均于2026-09-05核验。版本、文件与支持模式可能变化,使用时应再次核对。 ↩
-
Bruce Block, The Visual Story, 3rd ed., Routledge, 2020。用于视觉结构、对比与连续性关系的进一步学习。 ↩
-
Steven D. Katz, Film Directing Shot by Shot, Michael Wiese Productions, 1991。用于镜头设计、空间和连续性基础;本章将这些原则迁移到生成关键帧任务。 ↩