跳转至

第 2 篇 · CH05

把远程GPU视为有成本、有边界、可重建的临时片场,建立从连接、生成、监控、回传到停机的完整会话。

当前状态
完整章
预计学习时间
12 小时
关键概念
远程实例 · SSH · 主机指纹 · 端口转发 · GPU显存 · 进程 · 持久化 · 环境清单 · comfy-prod · comfy-lab
案例文件
`demo/echo-cabin/environment_manifest.md`、`demo/echo-cabin/README.md`
本章产出
区分Windows本地与AutoDL远程环境、安全建立SSH与端口转发
最后核验
2026-09-05

第5章 AutoDL、SSH、ComfyUI与最小生成环境

写作状态

本章为完整章节。平台界面、计费和软件能力会变化;稳定方法写在正文,AutoDL 与 ComfyUI 的当前操作写在技术适配段,并以 2026-09-05 为核验日期。所有命令块明确标注 Windows PowerShell 或 AutoDL SSH / Linux。

导读

本地电脑负责写剧本、管理项目和审查结果,远程 GPU 负责高负荷生成。这个分工看似简单,新手却很容易在第一天遇到一连串问题:到底在哪个窗口输入命令;为什么关闭浏览器后任务还在、关闭 SSH 后任务却停了;端口为什么不能直接公开;模型明明下载了却不出现在下拉框;显存不足该换 GPU 还是先缩小工作流;生成成功后文件在哪里;实例关机后数据、GPU 与费用分别发生什么。

这些问题共同指向一个误解:把云 GPU 当成“更强的个人电脑”。更准确的理解是,它是一间按规则租用的临时摄影棚。你必须知道门禁如何工作、设备属于谁、布景放在哪里、拍摄何时开始计费、停机前带走哪些底片,以及下次能否恢复同一套机位。SSH 是通往这间摄影棚的受控通道,ComfyUI 是把生成过程画成节点图的工作台,环境清单则是设备与布景记录。

本章不会要求你背 Linux 命令,也不假定你用过服务器。我们从辨认两台机器开始,再解释连接、进程、端口、磁盘、显存和工作流。所有操作都围绕一个最小目标:让《回声舱》的一张低成本测试图能够在远程环境中被提交、观察、定位、回传和记录;尚未真实生成的媒体仍保持“待生成”。

本章也不把“装得最多”当成能力。每增加一个自定义节点、模型或启动脚本,就增加一个版本、许可、依赖与故障来源。最小生成环境不是节点数量绝对最少,而是完成当前镜头所需的依赖足够少、来源清楚、状态可观察、结果可带走、环境可重建。

知识地图

Windows到AutoDL的最小生成链路

远程GPU会话的六个阶段

生产环境与实验环境的晋升路径

第一张图展示本地项目、SSH 隧道、远程 ComfyUI 与媒体回传的空间关系;第二张图把一次会话分为租用、连接、体检、生成、回收与停机;第三张图说明新节点和升级必须先在 comfy-lab验证,再有条件地进入 comfy-prod

学习目标

完成本章后,你应该能够:

  1. 看到一条命令时,先判断它应在 Windows PowerShell 还是 AutoDL SSH / Linux 中执行,并解释执行对象。
  2. 从平台控制台读取实例状态、SSH 主机、端口、计费模式和数据保留条件,而不是依赖旧截图。
  3. 第一次连接时核对主机指纹,理解密码、密钥与端口转发分别解决什么问题。
  4. 用只读命令检查 GPU、显存、磁盘、内存、Python、PyTorch、ComfyUI 和监听端口。
  5. 建立 comfy-prodcomfy-lab边界,冻结可工作的生产环境,在实验环境测试更新。
  6. 理解 ComfyUI 节点图中的模型、条件、潜空间、采样、解码和保存,以及可视工作流与 API 工作流的差别。
  7. 让长任务在 SSH 短暂断开后仍可观察,区分任务被接受、正在执行、生成完成和创作通过。
  8. 用明确路径传输输入与输出,核对大小或哈希,写入环境与生成日志。
  9. 在会话结束前确认结果已回传、日志已保存、实例已按当前计费规则停止。

核心概念

1. 远程实例与持久化

实例是平台分配的运行环境,包含计算、内存、磁盘、网络和生命周期状态。关机、释放、删除、迁移和无卡启动的含义可能不同。所谓持久化,是某类数据在某个状态变化后仍保留;它必须指定范围与期限,不能理解为永久安全。

2. SSH、主机指纹与密钥

SSH 是远程控制通道。主机指纹帮助客户端辨认服务器身份;账户密码或用户密钥用于认证。私钥保留在受保护的本地位置,公钥才上传授权。连接目标、端口、用户名与指纹应来自可信渠道。

3. 端口、监听地址与转发

端口是服务在主机上的逻辑入口。监听 127.0.0.1通常只接受该主机本地连接;监听所有接口扩大暴露面。本地端口转发把本地入口经SSH带到远程指定入口,使浏览器无需直接访问远程公网端口。

4. 进程、会话与服务

进程是正在运行的程序;SSH 会话是一次远程交互连接;tmux会话可以容纳持续运行的终端;ComfyUI 服务进程负责加载节点、监听端口和执行队列。四者相关但不能互相替代。

5. GPU、显存与利用率

GPU执行并行计算,显存保存模型、中间张量和输入输出。显存容量限制可同时容纳的工作量,利用率描述某时刻计算忙碌程度。利用率低不一定故障,高也不等于任务正确。

6. 环境清单

环境清单是可重建生产环境的最小事实集,包括硬件、系统、解释器、框架、应用、节点、模型、启动方式和标准测试。它要标明数据来自实际检查还是计划。

7. comfy-prodcomfy-lab

comfy-prod追求稳定完成生产镜头,更新受控;comfy-lab承载安装、升级、故障试验。实验结果只有通过晋升合同才进入生产,不应直接覆盖生产目录。

8. 工作流、API格式与任务状态

工作流是节点与连接形成的计算图。可视格式服务编辑,API格式服务程序提交,具体结构以当前官方规范为准。任务状态至少区分已提交、排队、运行、成功/失败、输出可读和创作批准。

本章理论命题

远程生成的核心不是获得一块 GPU,而是把不稳定、计费且可能变化的计算资源变成可观察、可停止、可重建的制片环节。

这意味着技术选择要服从电影生产:先定义测试镜头,再选择足够的环境;先建立证据链,再宣布成功;先带走不可替代结果,再释放算力。云平台、GPU 型号和节点生态都会变化,生产流程必须把这些变化隔离在环境清单与适配卡中,使镜头意图不依赖某一个临时实例。本章的六阶段会话与五级生产状态是面向单人 AI 制片的原创工作模型。10

理论模块一:本地与远程是两个不同的物理世界

SSH 窗口看起来仍在你的屏幕上,但命令实际由远程 Linux 执行。pwd显示远程目录,ls列出远程文件,python调用远程解释器;Windows PowerShell 中的 Get-Location、盘符和本地文件不会自动出现在远端。反过来,远程输出也不会因为浏览器能看到就自动保存到本地项目。

最简单的判断是看提示符与路径。PowerShell 常显示 PS D:\...>;Linux 常见 /root/...user@host:~$或类似形式。界面主题可以改变,所以还应运行只读位置命令。若把 D:\film\frame.png写进 Linux 命令,远端通常找不到;若把 /root/autodl-tmp/output粘到资源管理器,也不是本地路径。

本地与远程之间有三类连接。控制连接让你执行命令;端口转发让本地浏览器通过 SSH 隧道访问远端服务;文件传输把具体文件复制到另一端。三者共享 SSH 基础,却不是同一动作。看到 ComfyUI 页面,不等于输入图已上传;能用 scp复制文件,也不等于远程 Web 端口安全公开。

经典案例:《阿波罗13号》的任务控制边界

《阿波罗13号》不断在航天器与地面控制之间切换。两处人员拥有不同设备、数据和行动能力,信息必须经过通信转换为对方可执行的步骤。远程生成同样要求“位置意识”:本地决定创作与保存母版,远程执行计算;日志、路径和端口是两端对齐的语言。1

影片中的故障处理也提醒我们,远端状态不能靠想象。地面团队需要遥测,创作者需要日志、进程、GPU 占用和输出文件。只有“页面看起来卡住”不足以判断任务失败;只有“SSH 断开”也不足以判断进程停止。先确认可观察事实,才能选择动作。

《回声舱》深度推演一:一张测试帧经过哪几层

为 SH-001 做 768 像素低成本测试时,本地仓库保存镜头意图、提示、工作流登记和生成日志模板;本地媒体区保存准备上传的参考图。通过明确的传输命令,参考图进入远程输入目录。ComfyUI 读取远程文件和模型,输出到远程输出目录。生成结束后,选定结果被复制回本地媒体区,文件大小与哈希被核对,日志记录远程环境与输出身份。

这条链上任何一段缺失都会制造假成功。工作流排队成功但输出节点失败,不算完成;远端文件存在但未回传,不能抵御实例丢失;本地文件回传但没有镜头 ID,无法进入生产;有镜头 ID但未观看,只能算技术产出;教学仓库没有实际媒体时,则应保留待生成状态。

成功、失败与边界(一)

成功方案:两端目录写入会话清单;上传前后核对文件;浏览器只经 SSH 隧道访问;日志记录任务与输出;关机前确认本地副本。

失败方案:在远程下载目录里直接改提示,输出只留在实例,浏览器书签承担访问方式。数日后实例不可用,创作者同时失去结果和决策。

边界情况:平台可能提供持久数据盘,关机后保留数据。它降低即时丢失风险,却不等于独立备份;数据保留期限、欠费与释放规则会变化,仍应以当前平台说明和实际副本为准。AutoDL 当前文档说明关机后数据会保留一段时间,但连续关机后的释放条件必须查阅最新规则。3

理论模块二:临时算力必须有生命周期

一次 GPU 会话可以分为六段:租用前决策、开机与计费、连接与体检、生成与监控、回收与验证、关机与复盘。每一段有不同的停止条件。租用前不清楚镜头和模型,不应开机;体检发现磁盘不足或 GPU 不符,不应急着下载大模型;生成日志出现错误,不应无限重复;结果未回传,不应关机;控制台仍显示运行中,不应认为关闭终端已经停费。

生命周期思维把成本变成制片参数。按量实例的核心成本通常与开机时长和单价相关,而不是只在 GPU 满载时产生。AutoDL 当前计费说明明确区分按量与包年包月,并提醒计费以实例开关机时间为准;实际价格与模式应在每次会话前重新确认。4

把两小时会话写成预算:前十五分钟体检和上传,接下来二十分钟跑最小基线,六十分钟执行有限实验,最后二十五分钟选择、回传、记录和停机。计划不是要求每分钟精确,而是给“继续试一次”设置边界。如果最小基线都没有通过,就不应把剩余时间用在批量生成。

经典案例:《火星救援》的资源账本

《火星救援》把生存问题转化为氧气、食物、能源、距离和时间的资源计算。主人公的创造力并没有脱离约束,反而因为每项资源被量化而获得方向。GPU 会话也需要资源账本:显存决定并行规模与分辨率边界,磁盘决定模型和输出余量,带宽决定传输时间,余额与计费决定会话上限。2

电影案例的边界也很重要:个人生成不是生死工程,不需要把所有风险变成沉重流程。资源表只应覆盖会改变镜头策略的项目。若一次测试图只需几分钟,就不必建立复杂调度;但视频生成耗时长、输出大时,提前设置停止点可以直接避免费用与数据损失。

理论模块三:SSH安全来自身份、通道与暴露面的共同控制

SSH 让客户端在不可信网络上与服务器建立加密连接。第一次连接出现主机真实性提示,是因为本机尚未保存该主机的公钥指纹。正确做法是从可信的 AutoDL 控制台或官方说明核对主机与端口;不能只因为“yes 能继续”就接受。主机信息变化可能来自实例迁移,也可能意味着连接目标不同,需要重新核查。关于SSH身份、加密通道与转发的系统背景可参阅专门著作。9

密码登录证明你知道账户密码;密钥登录使用本地私钥与远端公钥配对。私钥不得上传到仓库、聊天或远程共享目录,公钥才用于授权。设置密钥不会自动让端口安全,也不会自动限制远端账户权限。Windows 自带或可选的 OpenSSH 客户端能够提供 sshscp等命令,具体安装与语法以 Microsoft 文档为准。6

端口转发解决“本地浏览器怎样访问只监听远端本机的服务”。例如让 ComfyUI 只监听远端 127.0.0.1:8188,再将本地 127.0.0.1:8188通过 SSH 转发过去。这样无需把 Web 服务直接暴露到公网。若本地端口被占用,可以选择另一个本地端口,例如 8189,对应的远端端口仍是 8188。

端口转发不是应用级身份验证。能够使用 SSH 隧道的人通常已经通过 SSH 授权,但若你另外把服务绑定到所有网卡并开放公网端口,任何能到达该端口的人都可能访问。默认从最小暴露开始;确需共享时再增加平台防火墙、认证、反向代理和明确的访问范围。

理论模块四:环境清单把“这台机器能跑”变成可重建说明

一句“Python 3.11、CUDA 12”不足以重建环境,因为实际执行链还包括驱动可见性、PyTorch构建、ComfyUI提交、Python环境、自定义节点版本、模型文件、启动参数和工作流。环境清单的作用不是收集所有版本号,而是定位哪些变化会改变结果或导致无法启动。

清单至少记录:平台与GPU型号、显存、镜像或系统、Python路径与版本、PyTorch版本及 CUDA 可用性、ComfyUI提交、生产环境依赖、自定义节点来源与提交、模型名称与校验或来源、启动命令、监听地址、输出根、标准工作流和验证日期。私人主机、密码和令牌不写入共享清单。

版本记录也要说明获取方式。pip freeze能列出 Python 包,却不能证明系统驱动、自定义节点源码和模型一致;截图能保存界面,却不便比较;Git 提交适合记录源码版本,但通过压缩包安装的节点可能没有提交信息。缺失项应标为“未知,待核验”,不要猜测一个版本来让表格完整。

《回声舱》深度推演二:为什么一份环境清单仍不能制造工作流

项目中的 environment_manifest.md可以登记预计 GPU、Python、ComfyUI、节点和模型,但如果仓库没有真实工作流 JSON,就不能宣称环境可直接复现 H3。清单描述依赖,工作流描述节点图,模型文件提供能力,输入资产提供控制,生成日志证明执行;五者缺一,结论就要降低一级。

SH-001 当前登记为 I2VA,工作流 ID 为 WF-H3-I2VA-v001。这能让镜头表与提示一致,却不等于对应 JSON 已存在。完整实训应在真实 H3 环境导出工作流,检查节点与输入,再把经过许可且不含密钥的结构文件纳入项目。在这之前,教材只能提供适配卡与准备步骤。

成功、失败与边界(二)

成功方案:清单区分“已在本实例读取”和“计划版本”;标准测试工作流实际运行;输出与日志可定位;未知项保留待核验。

失败方案:从教程抄一组版本号,看到 ComfyUI 页面打开就宣布环境一致,缺失节点时不断随机安装插件。最终页面能开,生产工作流却不可复现。

边界情况:完全字节一致的环境也可能因 GPU、驱动或非确定性算子产生差异。生产复现通常追求“相同输入与控制条件能稳定落在可接受结果域”,不是每个像素绝对相同。种子是实验控制项,不是跨全部硬件的质量保证。

理论模块五:生产与实验环境必须隔离

comfy-prod是已能稳定完成当前生产任务的环境,comfy-lab是允许安装、升级和排错的环境。二者不一定要租两台实例,可以是不同目录、Python环境、分支或快照;关键是实验失败不会破坏生产恢复点。

生产环境遵守冻结原则:任务进行中不追求最新;新增节点要有明确需求;升级前记录基线;升级后用同一标准镜头比较;只有通过启动、节点加载、工作流载入、最小生成和结果对比,才允许晋升。实验环境可以快速,但仍需记录试验和退出条件,否则它会变成无法解释的长期环境。

ComfyUI 官方当前提供 comfy-cli来安装、启动、更新、快照和管理环境,也提供内置或相关 Manager 路径;这些界面与命令会变化,所以本章把它们当适配工具,不把特定按钮作为稳定理论。7 不论用何种安装方法,晋升合同都应保持一致。

更新回退不能只保存 requirements.txt。自定义节点可能包含前端代码、系统依赖和版本约束;模型路径可能被改;工作流节点类型可能变化。至少保存生产环境的源码提交、Python依赖、节点列表、启动参数、标准工作流和已知输出。平台镜像或磁盘快照可以加快恢复,但仍要验证能否启动。

理论模块六:ComfyUI工作流是有类型的数据流,不是神秘配方

节点接收输入、执行特定变换并产生输出;连线把一个节点的输出交给另一个兼容输入。以最小扩散图片工作流为例:模型加载器提供模型组件,文本编码器把提示转成条件,潜空间提供初始表示,采样器在条件约束下迭代,解码器把潜空间变为像素,保存节点写出文件。

理解数据流比记住节点位置更重要。工作流报错时,从缺失输入、类型不匹配、模型不可用、尺寸不合适、运行资源不足和输出路径逐层判断。盲目拖动连线可能让图变绿,却不说明语义正确。节点名字因扩展不同而变化,输入—处理—输出的推理方式更稳定。

可视工作流保存画布位置、分组、节点与连线,适合人继续编辑;API 格式更强调节点 ID、类型和输入,适合程序提交。ComfyUI 官方为工作流 JSON 提供 schema,版本字段和结构可能演进。8 保存一种格式不能默认替代另一种;生产包应说明用途和导出来源。

最小工作流的第一目标是验证环境,不是出精品。选择低成本尺寸、一个已知模型、固定提示、明确 seed 和单张输出;确认模型加载、显存、采样、解码与保存链全部成立。随后才把角色参考、控制节点、视频模型或声音输入逐项加入。一次增加一个变量,失败时才知道边界在哪里。

理论模块七:可观察性决定你能否判断“卡住”

远程生成有多个观察面:SSH 中的服务日志、系统进程、GPU占用、任务队列、历史记录和输出目录。任何一个面都不完整。GPU占用为零可能意味着模型尚在CPU加载、任务等待输入或服务失败;GPU占用很高可能是别的进程;页面转圈可能只是浏览器断线;输出文件出现可能仍在写入。

正确诊断先建立时间线:何时提交、获得什么任务标识、队列位置怎样变化、日志最后一条是什么、进程是否存在、显存与利用率如何、输出文件大小是否稳定。然后把故障归类为连接、服务、工作流、模型、资源、输出或传输。一次只验证一个假设。

长任务不应只依赖一条脆弱 SSH 会话。tmux等终端复用器可以在网络断开后保留远程 shell 会话,但它不是任务管理与备份的全部。必须先学会创建有名字的会话、分离、列出和重新附着;服务日志仍应写入文件,关键输出仍要回传。若平台提供守护方式,也要记录启动与停止入口。

成功、失败与边界(三)

成功方案:任务有标识,服务日志可读,GPU和磁盘有基线,输出通过历史和文件双重确认;断线后可重新连接观察。

失败方案:连续点击 Queue,希望页面恢复;同一提示产生多个重任务,显存与磁盘压力叠加;后来不知道哪个输出属于哪次点击。

边界情况:任务被后端接受并返回无节点错误,只能证明提交阶段通过。还需等历史完成、检查输出文件与元数据,再进行内容观看。队列接受不等于生成完成,更不等于镜头批准。

理论模块八:传输必须同时验证身份与完整性

SFTP 提供交互式浏览与传输,scp适合复制明确文件或目录,rsync适合增量同步并可先预演。Windows环境不一定自带 rsync,本章基础流程以 scp和 SFTP为主。无论使用哪种工具,最危险的不是速度慢,而是源与目标颠倒、覆盖错误文件或遗漏依赖。

传输前写出一句自然语言:“把本地 SH-001_ref_v001.png复制到远程 /root/.../input/,不删除目标其他文件。”确认两端路径后执行。传输后至少核对文件名和大小,关键资产可在两端计算 SHA-256。相同哈希证明字节一致,不证明你选对了图片,因此仍需打开检查。

大量文件优先先生成清单或压缩包,避免逐个拖动后无法确认遗漏。压缩不会自动保存 Linux权限、符号链接或所有扩展属性,具体格式要与恢复需求匹配。输出回传后不要立刻删除远端,先让本地软件实际打开;若本地副本损坏,仍有一次补救机会。

理论模块九:停机是一次制片交付动作

关掉本地浏览器只关闭查看窗口,退出 SSH 只结束连接,停止 ComfyUI 只停止服务,它们通常都不等于平台实例关机。实例状态和计费应在 AutoDL 控制台或官方认可方式确认。AutoDL 当前按量计费说明是开机开始、关机结束;包年包月规则不同,不能套用同一节省结论。4

关机前执行回收清单:队列是否为空;重要输出是否完成写入;选择结果、日志、工作流和环境差异是否回传;本地是否能打开;临时密钥是否清理;下次入口是否记录;平台是否有额外数据盘费用或保留限制。然后停止服务、在平台关机并刷新状态。余额变化可以辅助观察,但控制台状态与计费记录才是直接证据。

定时自动关机可以降低忘记风险,但命令必须理解成功与失败条件。训练完成即关机、无论失败都关机、保留调试现场三种需求不同。新手不应直接复制带命令连接符的自动关机示例到重要任务;先在无重要数据的短任务验证,并确保日志写入持久位置。AutoDL官方提供了相应节费说明,但每次仍应查最新平台规则。5

理论模块十:故障诊断必须按层,不按焦虑程度

连接失败时先查实例是否运行、主机与端口是否来自当前控制台、本地网络和凭据是否正确;不要先重装 ComfyUI。页面打不开时先查 SSH 隧道、远程服务进程和监听地址;不要先换模型。工作流加载失败时查缺失节点和版本;生成失败时再查模型、输入、显存和磁盘。输出找不到时查保存节点、服务工作目录和日志;不要因为资源管理器没有文件就认为远端生成失败。

故障树的价值在于减少同时变化。若为了解决页面打不开,同时升级 Python、重装节点、换端口和更改防火墙,即使恢复也不知道原因,并可能破坏生产基线。每次只改变一个假设,记录前后证据;失败则回到已知状态。

显存不足不是单一错误。可能是分辨率、帧数、批量、模型组合、注意力实现、残留进程或碎片共同导致。先看实际GPU型号和占用进程,再降低一个变量;不要默认“更大GPU”是唯一答案。磁盘不足也要区分模型、缓存、临时文件和输出,删除前确认路径、可重建性与引用。

案例推演

《回声舱》的一次两小时远程会话

会话前,本地准备:SH-001 的低成本测试目标(当前仍是教学计划,而非已批准媒体);不含私人内容的参考图;提示版本;环境清单空白项;本地回传目录;最高费用和结束时间。控制台确认 GPU、显存、计费模式、实例状态、SSH信息和数据规则后才开机。

连接后不立即下载模型。先检查GPU、磁盘、内存、Python和既有环境;确认生产目录是否存在、上次任务是否仍运行。启动 comfy-prod后用端口转发访问,载入标准测试工作流。若基础工作流失败,就停止进入 H3 复杂工作流。

第一轮只生成一份低成本基线,记录提交时间、seed、尺寸、工作流与输出。若基线通过,再做预先限定的单变量实验。最后二十五分钟停止新增任务,等待写入完成,选择需要回传的文件,核对本地读取,更新日志与清单,确认控制台关机。

环境清单怎样写才不制造假确定性

demo/echo-cabin/environment_manifest.md中的每一项应带来源。例如“GPU型号——由 nvidia-smi于本次实例读取”;“ComfyUI提交——由生产目录Git记录读取”;“H3工作流——仅登记ID,真实JSON待导出”;“模型——计划使用,尚未核对哈希”。这样读者能区分事实、计划和缺口。

若发现生产环境是从社区镜像继承且提交未知,不要为了整洁而填“最新版”。先记录镜像名称和日期,保存当前能运行的基线,再在实验环境逐步识别依赖。可工作的未知环境需要被驯化,而不是用一次大升级“洗成干净”。

三种接入策略

策略A是最小 SSH 隧道:ComfyUI仅远端本机监听,本地手动连接与传输。它适合个人学习,暴露面小,但要求理解会话与路径。策略B是平台提供的代理或受控Web入口,操作更方便,安全与生命周期取决于平台实现。策略C是公开服务加认证、TLS和访问控制,适合明确的协作需求,配置与维护成本最高。

本教材默认策略A,因为它把关键概念显示得最清楚。若平台官方推荐受控代理,可以采用策略B,但仍需知道输入、输出、认证和费用在哪里。不要为“像正式网站”而过早采用策略C。

零基础补课:Linux路径与命令如何阅读

Linux 路径用正斜杠 /,根目录也写作 //root/ComfyUI表示从整个文件系统根开始的绝对路径;ComfyUI/output是相对当前目录的路径;.表示当前目录,..表示上一级;以点开头的名称通常是隐藏项。Windows 的 D:盘符概念不能直接套用。

远程提示符中的 ~常代表当前用户的家目录,但脚本与平台可能改变实际用户。生产说明优先记录通过 pwd读取到的真实绝对路径,而不是假设所有实例都相同。命令中的空格分隔程序和参数,因此带空格路径需要正确引用;不要通过删除空格、随便移动目录来躲避不理解的错误。

基础只读命令可以按问题记忆,而不是按字母记忆。问“我在哪”用 pwd;问“这里有什么”用 ls -la;问“文件内容开头是什么”用 head;问“磁盘还有多少”用 df -h;问“哪个目录很大”可以在明确范围内用 du;问“进程是否运行”用 ps;问“端口是否监听”用系统提供的套接字检查工具。先问问题,再选择命令。

管道符、重定向符和命令连接符会改变行为。|把前一程序输出交给后一程序;>通常覆盖文件,>>追加;;常表示无论前一命令成功与否都继续;&&通常只在前一命令成功时继续。它们不只是标点。小白复制长命令前,要把每一段拆开理解,尤其警惕下载后立即执行、递归删除、覆盖配置和自动关机。

Linux 权限说明谁能读取、写入或执行。遇到 Permission denied先确认当前用户、目标路径所有者和操作必要性,不要把 sudo当成万能前缀。过度提升权限可能让生成文件归属错误,后续普通用户无法修改;也可能扩大错误命令的影响范围。AutoDL镜像的默认用户与权限以当前实例为准。

环境激活会改变当前 shell 查找 python与包的位置。看到提示符前出现环境名只是线索,仍应用 which python和版本输出确认。退出 SSH、另开窗口或进入 tmux后,激活状态可能不同。把激活命令写进启动说明,不要依赖“上次已经激活”。

从空实例到最小基线:不要一次装成最终环境

假设实例只有合适的基础镜像,没有 ComfyUI。第一阶段不是下载 H3 和所有自定义节点,而是核对平台镜像、GPU、磁盘和 Python,并决定安装位置。安装目录与模型目录要避开容量不足或生命周期不明的分区。若平台提供数据盘,先查官方路径和保留规则。

第二阶段建立隔离 Python 环境,安装官方推荐的 ComfyUI 方式,并保存安装来源与版本。ComfyUI 官方当前文档提供 comfy-cli路径,也可能有手动或镜像路径。选择一种,不要混合多套命令。安装完成后只启动核心环境,观察是否有导入错误。

第三阶段载入官方最小工作流。如果缺少基础模型,只下载来源明确、许可允许且足以验证的一个模型。记录名称、文件大小、来源和可用校验信息。把模型放进当前安装实际扫描的目录,重启或刷新后检查加载器是否识别。下拉框出现名称只是路径识别成功,还要真正加载并生成。

第四阶段生成一张低尺寸测试图。测试提示可以非常简单,因为目标不是艺术质量,而是走通文本编码、潜空间、采样、解码和保存。记录耗时、峰值显存、输出路径和日志。若失败,保留错误并按层处理;不要在同一轮加入控制网络、LoRA、放大器和视频节点。

第五阶段把这条工作流冻结为 BASE-IMG-v001,保存可视格式、必要的API格式、环境清单和一张真实输出。冻结不代表永不更新,而是给后续变化提供比较基线。只有这一步稳定,才在 comfy-lab加入项目所需节点。

H3等视频模型的依赖更重,不能因为图片基线成功就宣布视频环境完成。视频适配层应单独核对模型文件、节点来源、输入模式、帧数或时长限制、分辨率、显存策略和输出封装。先用最短、最低成本、无隐私的测试镜头验证,再进入《回声舱》正式镜头。

读懂GPU与磁盘体检,不做数字崇拜

nvidia-smi通常显示驱动可见的GPU、显存占用、利用率和进程。型号与总显存决定硬件上限,已用显存说明当前占用,利用率是瞬时活动。采样阶段利用率可能高,模型加载或保存阶段可能低。一次截图无法代表完整任务,应结合时间和日志。

如果还没启动任务,显存已经大量占用,先查进程和用户;可能是上次服务、别的任务或平台共享行为。不要直接终止不认识的进程。确认PID、启动命令、用户和项目后,才决定是否属于自己。生产环境中的旧服务可能正为另一个会话提供工作。

磁盘检查需要看挂载点而非只看总容量。同一实例可能有系统盘、数据盘和临时盘,某个目录满了并不代表其他盘也满。模型下载还可能先写缓存再移动,短时需要接近两倍空间。视频生成会产生中间帧和临时文件,输出MP4很小也不代表过程占用小。

清理应从清单和可重建性开始。优先识别明确缓存、失败临时输出和已回传的可重建代理;模型、选定媒体、日志和未知目录不应盲删。删除前记录路径与大小,确认当前工作目录,避免变量或通配符展开到意外范围。重要清理最好在任务结束、已有副本且没有进程写入时进行。

显存优化按变量处理:批量从多张降为一张,分辨率或帧数降低,关闭非必要分支,确认没有重复加载模型,使用项目验证过的卸载或低显存机制。每次改变一个变量并记录结果。若最小配置仍超出硬件,才说明需要更大显存或不同模型路线。

ComfyUI页面第一次打开时应该看什么

第一眼不要被节点数量吓住。先找四类对象:输入从哪里进入,模型在哪里加载,核心处理发生在哪里,输出在哪里保存。沿连线从左到右或从上游到下游追踪。节点位置只是排版,连线和输入值才决定执行关系。

检查是否有红色或缺失节点、模型下拉是否为空、保存节点文件名前缀是什么、队列按钮与历史区域在哪里。导入外部工作流时,先截图或保存原文件,再列出缺失组件;不要点击一键安装全部未知节点。工作流可能含第三方代码和外部API节点,需要来源、许可和密钥边界审查。

提交后观察三处:前端队列显示、SSH服务日志、GPU/系统状态。若立刻返回结构错误,问题在工作流输入或节点;若长时间加载模型,日志与磁盘读写会提供线索;若采样开始,GPU通常出现占用;若完成,历史应列出结果,保存节点应在远程输出目录产生文件。

取消队列与中断当前任务是不同动作。清除未执行队列可以防止后续重复生成,中断当前任务可能需要后端协作并释放资源。界面按钮随版本变化,操作前确认对象。遇到失控批量任务,先停止继续提交,再保留日志并逐层处理。

保存工作流时,命名包含用途、模型适配层和版本,例如 BASE-IMG-v001WF-H3-I2VA-v001。画布工作流便于人检查,API工作流便于自动化,二者都不应包含真实密钥。导出后重新载入一次,检查节点、模型选择和输入没有丢失。

四类真实故障的分层诊断

故障一:SSH超时。先在控制台确认实例确实运行,复制当前主机与端口,检查本地网络;超时常表示网络路径不可达。若是认证失败,连接已经到达服务器,应检查用户名、密码或密钥。若主机指纹改变,停止并核对实例迁移或目标变化,不要直接删除记录继续。

故障二:SSH可用但页面打不开。检查ComfyUI进程是否存在、日志是否启动成功、端口是否监听于 127.0.0.1:8188、本地转发命令是否仍运行、本地端口是否冲突、浏览器是否打开对应本地地址。这里无需先动模型,因为模型不影响Web服务能否建立基础监听。

故障三:页面可用但工作流缺节点。记录节点类型和工作流来源,在 comfy-lab查找可信来源与兼容版本。不要让Manager直接改变生产环境。若节点只用于可选美化,考虑先旁路它完成最小基线;若是核心H3节点,则停止该工作流,完成依赖登记后再测试。

故障四:任务接受后没有可用输出。查历史状态和节点错误,查服务日志最后阶段,查输出节点与远程目录,查文件大小是否仍增长。若后端显示完成而找不到文件,可能输出路径、文件名前缀或不同用户工作目录有误;若文件存在但无法播放,属于封装或写入问题,不能标记技术通过。

每类故障都应记录“观察—假设—单一变化—结果—回退”。例如“观察:本地8188连接拒绝;假设:转发未建立;变化:在新窗口按控制台信息重建转发;结果:页面可访问;环境未修改”。这比“折腾半小时好了”更能支持未来恢复。

从标准测试到《回声舱》镜头的晋升门

环境晋升分三层。L0只要求核心ComfyUI与最小图片工作流成功,证明基础链。L1加入《回声舱》图片资产所需节点,证明参考图、尺寸和保存规范。L2才加入H3视频节点和对应模型,按I2VA、FL2VA等实际模式分别验证。每层都有独立恢复点。

标准测试输入必须无隐私、体积小、许可清晰,并长期保持不变。输出不是审美标杆,而是环境健康标志。如果升级后同一工作流无法加载、显存显著异常或输出结构改变,先在实验环境解决,不晋升。若输出像素不同但结构、性能和可接受质量一致,记录差异,不必追求不可能的绝对相同。

进入SH-001前,还要核对镜头的模式与工作流ID。I2VA至少需要正确的图像输入职责;如果工作流实际要求首尾帧,却登记为I2VA,技术能运行也可能违背生产设计。模式校验不仅是字段检查,它决定上传资产、提示结构和连续性策略。

每个正式生成先做单个take。确认镜头ID进入文件名前缀,日志能关联任务,输出进入预期目录,回传路径有效。之后才运行实验矩阵。不要为了利用GPU而一次排满所有组合;如果第一组已暴露工作流错误,后续队列只会放大费用。

环境通过并不意味着镜头通过。环境审核看服务、依赖、工作流、资源和输出;镜头审核看身份、动作、摄影、声音、连续性和叙事功能。两份检查表分开,失败原因才不会被混成一句“模型不行”。

一段连接会话的逐行解释

下面不用真实主机举例,因为连接信息属于当前实例。假设控制台给出用户名 root、主机 example.autodl.invalid和端口 12345。域名特意使用无效示例后缀,避免读者误连。你在 Windows PowerShell 输入SSH命令,客户端先解析主机并尝试到指定端口建立连接。如果网络不可达,会超时;如果端口没有服务,会被拒绝;如果服务器到达但认证不通过,会提示权限失败。三种错误处于不同层。

第一次到达服务器时,客户端展示主机密钥指纹。你需要把它和控制台可信信息核对。接受后,本机会在用户 SSH 配置区域记录该主机身份。以后同一目标返回不同密钥时出现警告,并不自动代表攻击,也可能是实例重建或地址复用;正确动作仍是从平台重新确认,而不是为了消除警告随意删记录。

认证通过后看到Linux提示符,此时键盘仍在本地,命令却在远端运行。输入 pwd是请远端shell报告工作目录;输入 nvidia-smi是请远端系统查询GPU;按下浏览器快捷键不会改变远端任务。你可以开两个PowerShell窗口:一个保持端口转发,一个进行普通SSH操作,给窗口标题或在会话单中注明职责,避免误关。

端口转发命令中的三个关键位置也可用自然语言读出:-L 本地端口:远程视角下的目标地址:远程端口8189:127.0.0.1:8188表示“本地浏览器访问8189时,经SSH让远端连接它自己的127.0.0.1:8188”。-N表示这条连接只做转发、不启动交互命令。转发窗口安静地停着通常是正常状态,不是卡死。

关闭转发窗口后,本地页面会断开,但远程ComfyUI服务可能继续;关闭服务窗口可能终止前台进程,但实例仍可能运行和计费;在控制台关机才改变平台生命周期。把三种关闭区分开,可以解释很多“我都关了为什么还在收费”或“页面关了任务为什么还跑”的困惑。

隐私、版权与第三方节点的生产边界

远程上传意味着文件离开本机,进入平台、实例或相关服务的处理范围。上传真人参考、私人声音、未公开剧本或授权不清的电影截图前,应核对平台条款、项目授权与最小必要性。本教材案例不要求使用真实个人隐私素材;学习阶段优先使用自制、明确授权或合成测试资产。

自定义节点是可执行代码,不只是画布积木。安装节点可能运行Python依赖、前端脚本或下载模型;工作流也可能包含调用外部API的节点。来源不明、长期不维护或要求粘贴密钥的组件,不应直接进入生产环境。先阅读官方仓库、许可证、安装说明、更新记录和依赖,再在 comfy-lab中测试。

模型许可决定权重与输出如何使用,不能因为文件能下载就假设可以商用、再分发或提交Git。环境清单应记录模型名称、来源、版本/校验和许可入口;项目商业归档还需保存核验日期和适用范围。许可证可能更新,重大交付前重新检查。

日志和截图也可能泄露信息。终端提示符含用户名与主机,命令历史含路径,错误栈可能含token,ComfyUI工作流可能保留输入文件名或API配置。发布教材截图前做裁剪或重绘,发布日志前审查敏感字段。最安全的教程示例使用显式占位符,而不是把真实值打码后仍保留可恢复片段。

第三方云节点与本机GPU节点的成本模型不同。前者可能按调用、积分或订阅收费,并把资产传往另一服务;后者使用实例GPU与本地权重。工作流图看起来相似,费用、隐私和可复现性却不同。每个远程调用节点都应在适配卡中标出服务商、输入去向、认证、价格核验日和失败处理。

会话结束后的复盘如何改进下一次生成

复盘不需要写长日记,只要回答计划与事实的差异。原计划两小时,实际哪一段超时;是上传慢、模型加载慢、节点故障、生成失败还是挑选犹豫?哪些时间属于可复用的首次安装,哪些会在每次会话重复?这些信息能决定下次应预热、压缩输入、冻结环境还是先在本地完成选择。

费用也要按原因拆分。GPU生成本身的有效时间、环境修复时间、闲置等待时间和回传时间不应混成总金额。若大部分费用花在下载与调试,考虑在无卡模式或更低成本环境准备;若生成占主导,优化批次与分辨率;若选择耗时,把预览带回本地后关机再判断。具体功能与价格仍以平台当前说明为准。

把一次故障转成知识需要留下最小案例:触发条件、可见症状、错误原文、环境、根因证据、最小修复、回退和预防。不要只记录“重启解决”。如果重启后恢复而根因未知,应写“临时恢复,根因未证实”,并保留再现条件。

《回声舱》的复盘还应回写生产决策。例如 H3 试验显示复杂摄影运动造成身份漂移,解决方案可能不是继续调环境,而是回到第8章简化镜头运动;某GPU显存不足,可能降低测试帧数而不改变最终镜头意图。技术限制应反馈制片设计,但不能悄悄改写主题和批准镜头。

一次会话真正结束的标志是:远端不再产生未登记变化;重要文件已在本地可读;环境与镜头日志已更新;费用状态已确认;下一步不依赖短期记忆。完成这些动作后,即使下次获得不同GPU或全新实例,你仍知道先恢复哪一层、用什么基线判断环境健康。

制作方法

第一步:在本地建立会话单

镜头ID与目标:
本次只验证:
输入文件与本地路径:
远程目标目录:
GPU与显存最低要求:
最高费用/最长时长:
停止条件:
回传目录:

没有具体镜头目标时先不开机。把“学习ComfyUI”改成可观察目标,例如“载入官方最小图片工作流,生成一张512像素测试图并记录环境”。

第二步:从控制台读取当前连接信息

在 AutoDL 控制台查看实例状态、计费模式、GPU、SSH主机、端口和用户名。不要把教程里的主机或端口当成自己的。密码与私钥不写入会话单。

第三步:在Windows PowerShell建立连接

执行环境:Windows PowerShell

ssh -p <控制台端口> <用户名>@<控制台主机>

尖括号表示必须替换的占位符,不能原样输入。第一次出现指纹提示时先核对。若连接失败,保留完整错误,区分超时、拒绝、认证失败和主机密钥变化。

第四步:确认远程身份与资源

执行环境:AutoDL SSH / Linux

pwd
whoami
hostname
nvidia-smi
df -h
free -h
python --version

执行环境:AutoDL SSH / Linux。依次确认目录、用户、主机、GPU、磁盘、内存和Python。nvidia-smi不存在或无GPU时,先核对实例模式;不要立刻安装驱动。

第五步:定位生产环境而不是重复安装

执行环境:AutoDL SSH / Linux

find "$HOME" -maxdepth 3 -type d -name 'ComfyUI' 2>/dev/null
ps -ef | grep -i '[p]ython.*main.py'

执行环境:AutoDL SSH / Linux。$HOME表示当前远程用户的家目录,不等于 Windows 的用户目录;第一条只在有限深度查找目录,第二条观察现有服务。找到多个环境时,用清单和启动脚本判断,不要随便选择“修改时间最新”的目录。

第六步:记录Python与PyTorch链

执行环境:AutoDL SSH / Linux

which python
python --version
python -c "import torch; print(torch.__version__); print(torch.cuda.is_available()); print(torch.cuda.get_device_name(0) if torch.cuda.is_available() else 'NO CUDA')"

执行环境:AutoDL SSH / Linux。输出要与环境清单对应。系统CUDA工具显示一个版本而 PyTorch不可用时,问题可能在当前Python环境或框架构建,不应只看驱动版本。

第七步:启动生产服务并保留日志

真实启动命令应来自项目清单。通用形态如下:

执行环境:AutoDL SSH / Linux

cd '<ComfyUI目录>'
python main.py --listen 127.0.0.1 --port 8188 2>&1 | tee -a '<已确认的日志文件路径>'

执行环境:AutoDL SSH / Linux。两个尖括号路径都必须从当次环境清单替换,且日志父目录要先确认存在、空间足够并会保留;不要把示例中的尖括号原样输入。命令占用当前终端属正常;生产长会话可在已理解的 tmux中运行。

第八步:从本地建立端口转发

另开一个 Windows PowerShell:

执行环境:Windows PowerShell

ssh -N -L 8188:127.0.0.1:8188 -p <控制台端口> <用户名>@<控制台主机>

保持窗口运行,在本地浏览器打开 http://127.0.0.1:8188。若本地端口占用,可把第一个8188改为8189,再打开 http://127.0.0.1:8189;第二个8188仍对应远程服务。

第九步:先跑最小基线

载入来源清楚的官方或项目标准工作流,检查缺失节点,不要一次安装全部推荐扩展。使用低成本尺寸与单张输出,记录提示、seed、steps、模型和时间。提交后观察队列、终端日志与GPU,直到历史显示完成并找到文件。

第十步:传输明确文件

从 Windows PowerShell 上传单个参考图:

执行环境:Windows PowerShell

scp -P <控制台端口> '<本地参考图完整路径>' <用户名>@<控制台主机>:<远程ComfyUI输入目录>/

从远程回传单个输出:

执行环境:Windows PowerShell

scp -P <控制台端口> <用户名>@<控制台主机>:<远程输出文件完整路径> '<本地回传目录完整路径>'

四个尖括号路径都必须替换为当次两端清单中的真实路径。传输前确认目标目录,传输后在两端核对大小;关键文件可用 Get-FileHash与 Linux sha256sum比较。

第十一步:记录生成而不夸大状态

生成日志至少写镜头ID、输入版本、提示版本、工作流ID、环境版本、模型、seed、尺寸、提交时间、完成状态、远程输出、本地回传、技术检查、创作判断和后续动作。接口接受任务时只记“已提交”;真实文件回传可读后再记“技术产出”;观看决定后才记“选择”。

第十二步:关机前回收

停止新增任务,检查队列和文件写入,回传重要输出、工作流与日志。本地打开抽样文件,更新清单。停止服务后,在 AutoDL 控制台执行适用于当前计费模式的关机,并刷新页面确认实例状态。关闭浏览器、SSH或本地电脑都不能替代这一步。

常见误区

误区一:命令出现在我的屏幕上,所以在我的电脑执行

执行位置由 shell 决定,不由屏幕物理位置决定。看到路径和提示符先辨认环境。

误区二:关闭SSH会停止计费

SSH只是连接,实例生命周期由平台控制。按量计费要以当前平台状态和规则确认。

误区三:关机后数据保留,所以不用备份

保留是平台服务条件,不是独立副本。重要输出必须回传并另备份。

误区四:把ComfyUI直接监听公网最省事

这会扩大暴露面。个人使用优先远端本机监听加SSH转发;共享需求另做认证和访问控制。

误区五:节点越多,环境越专业

每个节点增加版本与依赖。生产环境只保留完成当前工作流所需且已验证的节点。

误区六:页面打开就说明GPU可用

前端能打开只说明Web服务可访问。还要检查PyTorch、GPU、模型和最小生成链。

误区七:nvidia-smi有利用率就说明我的任务在跑

占用可能来自其他进程,任务也可能停在非GPU阶段。结合PID、日志、队列和输出判断。

误区八:固定seed就会跨设备得到相同像素

seed有助于控制实验,但硬件、实现、依赖和非确定性仍可能产生差异。关注可接受结果域。

误区九:工作流JSON就是全部环境

它不包含全部节点代码、模型权重、系统依赖和许可。必须结合环境清单与来源。

误区十:下载完成代表模型正确

还要核对路径、大小、校验或来源、加载日志与实际工作流。下载到错误目录等于环境仍不可用。

误区十一:文件回传后可以立刻删远端

先在本地打开并核对,避免传输中断或源目标混淆。确认备份后再按保留策略清理。

误区十二:遇到显存错误就换最大GPU

先识别工作流规模、分辨率、帧数、批量、残留进程和模型组合。更大GPU可能只是昂贵地掩盖配置问题。

正文练习

练习一:给命令分配位置

Get-FileHashnvidia-smiscppwdGet-Locationsha256sum分别放入“Windows本地”“远程Linux”或“两端通信”三栏,并解释对象。

判断过程

Get-FileHashGet-Location是本章Windows PowerShell示例;nvidia-smipwdsha256sum在远程Linux执行;scp通常从本地PowerShell发起,但同时引用本地和远程路径,所以属于两端通信。判断关键是进程在哪运行、路径指向哪台机器。

练习二:诊断“页面打不开”

列出至少五个逐层检查,不允许第一步重装。

判断过程

可依次确认实例运行、SSH能连接、ComfyUI进程存在、日志无启动错误、端口监听于预期地址、本地转发窗口仍运行、本地端口未冲突、浏览器URL正确。每一步只缩小一层问题。

练习三:设计两小时会话

为一个图片或视频测试分配体检、基线、实验、回传和停机时间,写出停止条件。

判断过程

合理方案会为回传与关机保留独立时间,并规定基线失败后不进入批量实验。停止条件可以是费用、时间、连续失败次数、磁盘余量或基础工作流异常。

练习四:判断四种“成功”

分别为“返回任务ID”“历史显示完成”“本地文件可打开”“导演决定采用”命名状态,并说明还缺什么。

判断过程

它们可命名为已提交、技术执行完成、结果已回传并可读、创作选择。每一级都不能越级替代下一层;最终交付还需进入剪辑并通过整体技术检查。

章末工作簿

打开第5章工作簿。工作簿包含会话任务书、两端路径表、环境清单、生产/实验晋升合同、故障树、传输核对与停机复盘。练习为可选,不设置开课阻塞或自动完成。

章节小结

AutoDL、SSH 与 ComfyUI 不是三个需要分别背诵的工具,而是一个远程生成环节的不同层:AutoDL提供有生命周期与计费规则的实例,SSH提供受控连接和转发,ComfyUI把生成依赖组织为可观察工作流。电影项目为它们规定输入、输出、状态和停止条件。

小白最重要的能力是位置感与状态感。每次先问当前在哪台机器、哪个目录、哪个环境;再问服务、队列、任务和文件分别处于什么状态。返回任务ID不等于完成,文件存在不等于回传,回传不等于选择,选择不等于交付。只有把层级写清,技术过程才能支持创作判断。

最小可靠会话是:本地先定义镜头与预算;控制台核对实例;SSH连接并体检;生产环境跑低成本基线;有限实验;日志与输出回传;本地读取验证;更新环境清单;按当前规则确认停机。生产环境保持冻结,更新先在实验环境验证。平台与节点会变化,这条证据链不应随之消失。

对零基础读者,本章真正要求记住的不是一串端口和路径,而是五个问题:命令在哪台机器执行;当前事实由什么证据确认;这一步会不会写入或收费;生成结果是否已经离开临时实例;失败时能否回到已知基线。每当界面或教程与实际环境不一致,就回到这五问。能够暂停、定位和记录未知,比凭感觉继续安装更接近专业制作。远程GPU只是片场,电影项目与创作者的判断才是贯穿所有设备的主线。

当你能够用自己的语言解释一次连接、一次生成、一次回传和一次停机,并能指出每一步的证据与失败边界,就已经掌握本章。以后更换平台、GPU或模型,只需更新适配卡和环境清单,而不必重新发明整条生产流程。

最重要的是保持事实诚实:不知道就记录待核验,没有真实媒体就记录待生成,没有观看就不写批准。这样的环境记录才能在下一次会话中真正节省时间与费用。

注释与书目

延伸阅读

先阅读 AutoDL快速开始当前计费说明,在每次租用前重新核对实例状态、数据规则和价格。ComfyUI安装与管理参见官方CLI入门,工作流结构参见Workflow JSON规范。Windows SSH能力参见Microsoft OpenSSH说明

延伸学习建议按“能解释再扩展”的顺序:先从一张官方最小工作流图中指出每条数据流,再学习自定义节点;先手动完成一次安全回传和停机,再考虑批处理;先在 comfy-lab复现一次升级和回退,再改变生产环境。工具熟练度不由安装数量证明,而由你能否在异常时说清哪一层出了问题、如何保存现场和怎样回到可用状态证明。


  1. Ron Howard, dir., Apollo 13, Universal Pictures, 1995. 本章只以文字概述任务控制、资源约束与故障协作,不使用剧照或对白。 

  2. Ridley Scott, dir., The Martian, 20th Century Fox, 2015. 用于分析资源量化如何服务行动决策,不把影片情境等同于普通云计算风险。 

  3. AutoDL, “快速开始”, accessed 2026-09-05. 用于核验实例、数据保留提示与运行中计费入口;规则可能变化。 

  4. AutoDL, “计费说明”, accessed 2026-09-05. 用于区分按量与包年包月,并说明按量模式以实例开关机时长计费;价格以控制台现价为准。 

  5. AutoDL, “省钱绝招”, accessed 2026-09-05. 用于说明无卡模式与自动关机存在,但本教材不建议在未验证任务中盲目拼接关机命令。 

  6. Microsoft, “OpenSSH overview for Windows”, Microsoft Learn, accessed 2026-09-05. 用于Windows OpenSSH客户端、SSH与SCP的基础边界。 

  7. Comfy Org, “Comfy CLI: Getting Started”, accessed 2026-09-05. 当前文档将CLI描述为安装、启动、更新、快照和管理ComfyUI的工具;具体命令可能迭代。 

  8. Comfy Org, “Workflow JSON”, accessed 2026-09-05. 用于工作流schema、版本与节点结构的技术依据。 

  9. Daniel J. Barrett, Richard E. Silverman, and Robert G. Byrnes, SSH, The Secure Shell: The Definitive Guide, 2nd ed., O’Reilly, 2005. 用于SSH身份、通道与端口转发的概念背景。 

  10. 本章关于“临时GPU片场”“五级生产状态”“生产/实验晋升合同”与“会话六阶段”的表述为教材结合AI微电影生产所作的原创总结。