AI短剧制作全流程教程:从角色一致性到ComfyUI工作流实战

📅 发布时间:2026/9/7 12:45:49
AI短剧制作全流程教程:从角色一致性到ComfyUI工作流实战 最近一年AI 短剧几乎成了内容创作圈最热的关键词之一。无论是短视频平台上刷到的“AI 真人感短剧”还是以动态漫、漫剧形式出现的 AI 动漫内容背后其实都有一套固定的生产管线剧本拆解、角色图生成、分镜图生成、图生视频、配音配乐、剪辑合成。很多人以为做 AI 短剧需要懂绘画、会后期、能训练模型实际上当前主流工具已经把门槛压得很低真正拉开差距的是你对这整条流水线的理解深度。这篇文章会从一个零基础创作者的角度把 AI 真人短剧、AI 动漫、AI 动态漫、AI 漫剧制作的完整流程拆开讲清楚。全文会围绕“即梦 ComfyUI 剪映”这套低成本工具链展开也会讲 ComfyUI 环境搭建、工作流节点组成、角色一致性控制、常见报错排查。不管你是想尝试第一条 AI 短视频还是准备批量做 AI 漫剧账号这篇教程都能给你一条可以直接照做的路径。1. 先搞清楚AI 短剧、AI 动漫、AI 动态漫到底是什么1.1 AI 真人短剧的概念边界AI 真人短剧指的是用 AI 生成接近真人实拍画面效果的短视频剧集内容。它和传统短剧最大的区别是不需要真实的演员、摄影棚、服化道和外景团队而是靠大模型生成角色形象和场景画面再用图生视频或文生视频技术把静态画面变成连续动态镜头。目前市面上的 AI 真人短剧主要分为两种全 AI 生成型角色、场景、镜头全由 AI 生成适合没有实拍条件的创作者。AI 辅助型真人实拍后用 AI 做换脸、换装、特效处理这种类型涉及肖像权和平台规则普通创作者不建议碰。这里需要特别提醒那种“AI 一键卸甲”“AI 换脸明星”之类的内容存在严重的肖像权和合规风险平台治理也会不断收紧并不适合作为长期创作方向。本文讲的 AI 真人短剧是完全原创、可商用、符合平台规则的 AI 生成内容。1.2 AI 动漫、动态漫、漫剧的区别这几个概念经常被混用我按创作习惯给它们做一个简单区分AI 动漫用 AI 生成动漫风格画面再做成动态视频视觉风格接近日本动画或国漫。动态漫介于静态漫画和动画之间画面主体基本不动但通过镜头推拉摇移、局部动效眼睛眨动、头发飘动、衣角摆动、光斑闪烁让画面“活”起来。AI 漫剧动态漫的视频化内容形态通常带配音、字幕、音效和剧情节奏是抖音、B 站上常见的一类内容。从制作流程上看AI 真人短剧和 AI 动态漫有 80% 的环节是重合的差异主要在画面风格控制和动态化策略上。所以这篇文章不会把它们当成两件完全独立的事来写而是共用一套方法再分别讲各自的侧重点。1.3 为什么 AI 短剧值得系统学习从成本角度看传统短剧单集制作成本少则几万多则几十万。AI 短剧的单集成本可以压缩到几十到几百元核心成本变成了创作者的时间成本。从效率角度看熟练之后一两天做出一集 1 到 3 分钟的短剧并不是夸张事。从能力角度看AI 短剧涉及文本生成、图像生成、视频生成、配音剪辑四个方向掌握这条管线等于同时掌握了未来内容创作的底层能力。2. AI 短剧制作全流程与工具矩阵2.1 标准生产流水线我习惯把 AI 短剧制作拆成八个环节。无论做什么题材都建议按这条线走剧本创作 → 分镜拆解 → 角色资产设定 → 分镜画面生成 → 画面动态化 → 配音配乐 → 剪辑合成 → 发布复盘2.2 每个环节的工具选型生产环节推荐工具定位说明剧本创作Kimi、ChatGPT、文心一言AI 辅助生成故事短剧需要每集留钩子分镜拆解自己手动拆用文档列出分镜号、景别、画面描述、台词、时长角色资产设定即梦、Midjourney、Stable Diffusion生成角色正面、侧面、表情图确定角色形象分镜画面生成即梦、Stable Diffusion、ComfyUI批量生成场景分镜图画面动态化即梦、可灵、Runway、海螺文生视频 / 图生视频配音配乐剪映、魔音工坊、Fish AudioAI 配音、背景音乐、音效剪辑合成剪映、Premiere画面、字幕、配音、音效合成封面和包装即梦、稿定设计生成短剧封面决定点击率2.3 工具策略先在线后用本地如果你是零基础第一周不需要碰任何本地安装的 AI 工具先用“即梦 剪映”跑通一条完整流程。即梦负责生图和图生视频剪映负责声音和剪辑这两步能让你在完全不接触代码、不碰显卡配置的情况下先做出第一条 AI 短剧。当你开始遇到两个瓶颈时再去学 ComfyUI即梦单张出图太慢或者一次需要生成大量分镜图效率跟不上。角色形象不稳定需要精确控制角色在不同分镜里保持一致。ComfyUI 是 Stable Diffusion 的节点式工作流界面看起来像一张流程图每个节点负责一个功能模块节点之间连线传递数据。它的优势是灵活、可控、适合批量生产尤其是做动态漫、漫剧这种需要大量出图和角色一致性的内容ComfyUI 几乎是绕不开的。3. 环境准备ComfyUI 安装与基础建模先声明以下安装步骤以当前版本为例不同时期下载的整合包界面可能略有差异但整体思路不变。3.1 安装方式一秋叶整合包新手推荐秋叶整合包是目前国内使用人数最多的 Stable Diffusion / ComfyUI 一键整合包它把 Python 环境、依赖库、常用模型管理、启动器都打包好了不需要手动配环境。在相关社区搜索“秋叶 ComfyUI 整合包”可以找到下载地址。解压后目录结构大致是ComfyUI-秋叶整合包/ ├── ComfyUI/ │ ├── models/ # 模型目录 │ │ ├── checkpoints/ # 主模型 │ │ ├── loras/ # LoRA 模型 │ │ ├── controlnet/ # ControlNet 模型 │ │ └── vae/ # VAE 模型 │ ├── custom_nodes/ # 插件目录 │ ├── input/ # 输入图片 │ └── output/ # 输出图片 ├── python/ # 内置 Python 环境 ├──启动 ComfyUI.bat # 一键启动脚本 └── ComfyUI-管理器.exe # 模型和插件管理工具启动时双击启动脚本浏览器会自动打开 ComfyUI 的 Web 界面默认地址一般是http://127.0.0.1:8188。如果浏览器没自动打开手动访问这个地址即可。3.2 安装方式二手动安装适合已有基础如果你已经具备 Python 基础或者更希望从原生版本开始手动安装也很简单。以 Windows 为例# 1. 克隆 ComfyUI 官方仓库 git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI # 2. 创建虚拟环境建议 python -m venv venv venv\Scripts\activate # 3. 安装 PyTorch 和依赖 # 这一步建议去 PyTorch 官网选择与你显卡 CUDA 版本匹配的命令 pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121 # 4. 安装 ComfyUI 依赖 pip install -r requirements.txt # 5. 启动 python main.py手动安装的好处是环境干净升级方便但对新手的坑也比较多尤其是 PyTorch 版本和显卡驱动之间的匹配问题。所以我个人的建议是零基础用户直接用整合包等理解了目录结构之后再决定要不要切换成手动安装。3.3 下载必要模型ComfyUI 本身不带有任何绘画能力它只是一个工作界面。真正决定画风的是模型文件。做 AI 真人短剧和 AI 漫剧通常需要准备这几类模型类型作用放置目录主模型决定整体画风和质量例如写实风、动漫风models/checkpointsLoRA控制角色特征、服装、特定风格是角色一致性核心models/lorasControlNet控制动作姿态、构图线稿models/controlnetVAE改善画面色彩和细节models/vae模型文件较大一般 2GB 到 7GB 不等下载后放到对应目录刷新 ComfyUI 即可看到。不要一边下载一边用容易出加载错误。3.4 手机用即梦虽然方便但本地 ComfyUI 的价值体现在哪即梦这类在线工具适合生成单张高质量图片但做漫剧时动辄几百张分镜图如果全部使用在线工具等待时间长、成本高而且角色形象往往跑偏。本地 ComfyUI 一次配置好工作流之后可以批量出图、批量换背景、批量控制角色姿势。这才是做“批量短剧账号”的核心竞争力。4. 实战一从零制作一条 AI 真人短剧片段这一节会完整走一遍 AI 真人短剧的最小闭环目标是产出一条 15 到 30 秒、包含完整剧情钩子的短剧片段。4.1 生成剧本我用一个古装复仇题材做示例这类题材在短剧平台上验证度很高。用 AI 生成剧本时不能只丢一句“帮我写个短剧”要有明确的结构化要求。你是一名短剧编剧。请写一部古装复仇题材短剧的第一集开头片段。 要求 1. 时长 30 秒左右 2. 包含一个强冲突开场 3. 台词简洁适合 AI 配音 4. 结尾留钩子吸引观众看下一集 5. 输出格式场景描述 对白 表演提示AI 给出的结果可能比较散需要人工整理。我在这里把最终版剧本做简化处理场景雨夜破败庭院。 女主 林晚秋 跪在泥地上面前的将军 顾长风 拿着密旨。 顾长风“圣意已定林家通敌满门抄斩念在你我旧情给你留一具全尸。” 林晚秋抬头眼中全是恨意。 林晚秋“顾长风你欠林家的我总有一天会亲手拿回来。” 顾长风冷笑“你拿什么拿” 林晚秋从袖中掏出一块令牌顾长风脸色大变。 【钩子】画外音“三个月后新帝登基没人知道那位权倾朝野的摄政王就是当年的林家孤女。”这个剧本虽然短但具备了冲突、情绪反转、时间跳跃三个短剧核心要素。4.2 拆解分镜表分镜表是整条流水线的“施工图纸”。分镜写得越细后面生成画面时越省力。每个分镜至少要有分镜号、景别、画面内容、角色状态、镜头运动。分镜号景别画面内容台词/配音镜头运动01远景雨夜破败庭院闪电照亮牌匾“林府”雨声缓慢推近02中景林晚秋跪在泥地衣衫湿透顾长风台词固定03近景顾长风俯视林晚秋眼神冷酷后续台词轻微下摇04特写林晚秋抬头眼睛含泪但充满恨意林晚秋台词推近05中景林晚秋掏令牌顾长风脸色大变无台词快速推近06空镜令牌落地特写雨滴打在令牌上画外音钩子环绕07转场黑屏字幕三个月后画外音无分镜表不仅是给自己看的也是后续生成提示词、控制视频时长的依据。建议用表格或文档管理一个项目一个文件夹避免后期混乱。4.3 确定角色形象并生成角色资产角色形象是短剧的脸面也是 AI 短剧制作中最容易翻车的一环。如果你用即梦建议先做角色设定图不要上来就生成分镜。对林晚秋这个角色我给出一份可直接修改的提示词模板古装年轻女子全身设定图约25岁清冷倔强穿浅青色素衣汉服头发湿漉漉贴在脸颊 眼神中带着隐忍与恨意站在雨夜庭院中背景灯笼微光电影质感写实风格 面部细节清晰浅景深竖屏构图生成角色图后你等于获得了一个“角色锚点”。后面所有分镜图都要基于这一版形象去生成。在即梦里可以上传这张角色图做参考图再结合场景描述生成分镜这样同一角色在不同分镜里才不会“换脸”。4.4 用即梦批量生成分镜画面即梦支持文生图和图生图。做分镜图时我建议采用“参考图 场景描述”的方式。对分镜 01提示词可以这样写参考图中女子的形象生成一张古装剧场景图雨夜破败庭院牌匾写着林府 闪电照亮天空一名古装女子跪在泥地上身穿浅青色素衣汉服背影带悲壮感 电影级光影写实风格竖屏中景对分镜 03也就是顾长风的画面古装将军男子约35岁身穿黑色战甲撑伞站在雨中俯视镜头眼神冷酷 面部棱角分明背景是燃烧的府邸电影级光影写实风格竖屏近景生成时需要检查几个点画面比例是否统一。短剧建议统一用 9:16 竖屏比例。角色的服装、发型、五官是否和角色设定一致。画面中不要出现乱码文字、奇怪的手部、多根手指。4.5 图生视频让静态画面变成镜头有了分镜图后把每一张静态图导入即梦的“图生视频”功能并在提示词里描述动态内容。分镜动态描述01镜头缓慢推近雨丝飘落闪电忽明忽暗03雨滴从伞沿滑落将军面部冷酷披风被风吹动04女子眼神变化从隐忍到坚定泪水滑落06令牌落地溅起水花镜头轻微晃动需要注意图生视频不是万能的画面元素越复杂动作幅度越大越容易出现变形。你只需要让画面“微动”即可真正的节奏感交给剪辑。4.6 配音、字幕与剪辑合成最后一步是把所有片段拖进剪映按分镜顺序排列视频片段。用 AI 配音功能分别生成顾长风和林晚秋的声音。建议男声用低沉音色女声用清冷音色。根据配音时长微调视频片段长度。添加雨声、闪电音效和背景音乐。识别字幕或手动添加字幕注意一句台词最多不要超过 12 个字否则观众读不完。添加转场效果比如用“闪白”转场表现回忆用“黑幕”转场表现时间跳跃。到这一步一条 AI 真人短剧的最小闭环就完成了。你不需要一次性做出一整集先做一条 15 秒的片段确认整个流程能跑通再逐步扩大制作规模。5. 实战二AI 动态漫 / 漫剧的 ComfyUI 工作流动态漫和真人短剧的核心区别在于画面风格是动漫插画风同时动态化方式更加依赖局部动效。动态漫的受众习惯是“一张好看到炸的图 轻微动效 强配音”对视频流畅度的要求反而比真人短剧低。这也是为什么动态漫非常适合用 ComfyUI 批量产出。5.1 动态漫制作流程与真人短剧的差异动态漫的标准流程是剧本 → 分镜 → 角色设定 → 用 ComfyUI 批量出图 → 局部动态化 → 配音 → 剪辑差异主要在两方面画面生成环节动态漫需要更高的一致性控制因为观众会对动漫角色的长相更敏感。一个角色换个发色、换个脸型立刻就会出戏。动态化环节动态漫很少做大幅动作更多是分层动效。比如背景静止、头发飘动、眼睛眨动、光效流动这需要后期工具支持。5.2 认识 ComfyUI 工作流的基本节点ComfyUI 的工作流本质是一张节点图。下面是一个最基础的文生图工作流节点结构Load Checkpoint加载主模型 ↓ CLIP Text Encode正向提示词 ↓ CLIP Text Encode负向提示词 ↓ KSampler采样器 → VAE Decode解码 → Save Image保存图像在 ComfyUI 界面里你可以用鼠标拖拽节点、连接端口。正向提示词就是你希望画面里出现的内容负向提示词是你不希望出现的内容。负向提示词通常填一些常见劣质元素低分辨率、模糊、多手指、变形等。5.3 通过固定提示词模板保证角色一致性动态漫生产中最让人头疼的就是角色一致性。同一个角色第一张图是瓜子脸第二张图变成圆脸剧情就没法看了。解决思路是“拆碎提示词”。不要每次都重新写一长串描述而是把角色描述固定下来。角色描述模板shenqi girl, long black hair, amber eyes, pale skin, wearing dark purple hanfu, slight smile, elegant, fantasy style场景描述模板ancient Chinese palace, night, candlelight, moonlit courtyard, cherry blossom petals, cinematic lighting, detailed background每次出图时把两份描述拼在一起顺序是角色 场景 镜头 画质后缀。优点是角色部分完全不变场景部分按需调整。这种方式比每次重新写提示词稳定得多。如果想进一步提升一致性可以用 LoRA 模型。LoRA 可以理解为一个小型“角色特征包”你可以在本地用一些图片训练特定角色的 LoRA训练完成后把它加载到工作流里出图时角色面容会明显更稳定。不过训练 LoRA 对显卡和数据集有要求新手可以先把提示词模板法用熟。5.4 一个可落地的 ComfyUI 工作流结构下面用文字描述一个适合动态漫批量出图的工作流。节点连接关系如下Load Checkpoint动漫主模型 ↓ Load LoRA角色LoRA可选 ↓ CLIP Text Encode角色提示词 CLIP Text Encode场景提示词 ↓ CLIP Text Encode负向提示词 ↓ Empty Latent Image设置 512x768batch_size4 ↓ KSampler种子固定步数25CFG 7采样器 Euler a ↓ VAE Decode ↓ Save Image这里的Empty Latent Image设置 batch_size4表示一次生成 4 张同系列图适合快速批量出分镜草稿。固定随机种子后同一提示词生成的多张图片会趋近一致这也是做连续性画面时的常用手段。5.5 动态漫的动态化技巧ComfyUI 主要负责出静态图动态化一般交给视频生成工具或剪辑软件完成。动态漫制作中有一个成本很低的动态化思路分层动效。在剪辑软件中导入静态分镜图。对图片做“缩放 平移”动画模拟镜头推拉摇移。在局部位置叠加粒子素材比如飘落的樱花、火光、光斑。用文字转语音生成配音加上音效和背景音乐。这种方式不需要任何图生视频功能单靠剪映就能完成效果在手机端看完全够用。当你需要更细腻的动态再配合即梦的图生视频生成头发飘动、眼神变化等小幅度动势。6. 常见问题与排查思路做 AI 短剧过程中90% 的问题其实是固定那几种。下面这张表是我整理的高频问题清单建议收藏备查。问题现象常见原因解决思路ComfyUI 启动报错界面打不开端口被占用、依赖缺失换个端口启动更新依赖ComfyUI 节点执行过程中发生错误模型格式不对、节点缺少依赖、显存不足查看错误日志定位具体节点确认模型路径降低分辨率或 batch生成图片黑屏或灰屏VAE 缺失或模型加载失败检查 VAE 是否正确加载换一个 VAE 文件手部、面部崩坏模型分辨率不够、提示词缺少细节提高分辨率使用更高精度模型增加负面提示词同一角色不同分镜长相不一致提示词不稳定、没有使用参考图/LoRA使用角色提示词模板配合参考图或 LoRA图生视频时人物变形严重动态幅度过大、原图细节不足减少提示词里的动作幅度优先处理局部动态生成图片比例不统一忘记设定固定分辨率在 Empty Latent Image 节点统一分辨率不要随意改在线工具生成的内容审核不过提示词触发了敏感词或画面违规调整提示词采用含蓄表达避免暴力、色情、真实人物肖像注意ComfyUI 报错时不要只看红色报错文字关键是看触发报错的节点名。比如上图你看到了“node”和你实际加载的工作流节点对应一般可以在控制台日志里找到类似“Error occurred when executing KSampler”这样的信息它已经告诉你是采样环节出了问题。排查顺序建议先把出错的节点截图。检查节点上的模型路径是否存在。检查模型是不是放错目录。检查显存占用降低 batch_size。更新所有插件。如果还不行换回默认工作流测试判断是不是自定义节点冲突。这套流程能解决 ComfyUI 95% 的本地报错。7. 效率提升与工程化建议7.1 建立可复用的项目文件夹结构做单条视频时怎么放文件都无所谓。但当你开始做系列短剧比如每周更新 3 集漫剧文件夹规划就非常重要。我建议按剧集维度组织project/ ├── 01_剧本/ │ └── 剧情大纲.md ├── 02_分镜/ │ └── 分镜表.csv ├── 03_角色/ │ ├── 林晚秋_设定图.png │ └── 顾长风_设定图.png ├── 04_分镜图/ │ ├── 第01集/ │ └── 第02集/ ├── 05_视频片段/ │ ├── 第01集/ │ └── 第02集/ ├── 06_音频/ │ ├── 配音/ │ ├── 音效/ │ └── BGM/ └── 07_成片/ └── 第01集_final.mp4这样的好处是无论隔多久回来继续制作都能快速找到素材不会出现“我记得那个图在哪来着”的尴尬。7.2 沉淀提示词模板库提示词是你最大的资产。很多 AI 短剧创作者每天都要改提示词但实际上大部分内容是重复的。我建议用表格或文档维护一份模板角色模板不同性别、不同服装、不同气质的固定描述。场景模板古装庭院、现代都市、玄幻森林、雨夜街道等。镜头模板近景、特写、远景、俯拍、仰拍、环绕。画质模板电影感、浅景深、8K、细节丰富、柔光。出图时按“角色 场景 镜头 画质”四段式拼接效率提升非常明显。7.3 批量生产与版本管理在 ComfyUI 里固定随机种子seed可以帮助你生成相同的画面这是做连续分镜的关键。不同随机种子则会生成不同变体。做批量出图时建议每一种组合先设置 batch_size4快速选出最优结果再对选中的结果进行精细调整。同一套角色设定和场景提示词最好在同一个项目文件夹下保存一份“出图参数快照”记录下用的主模型、LoRA、采样器、步数、CFG、种子这些参数。否则过几天你再想复现某张图的风格很可能已经回忆不起来了。7.4 合规红线必须从一开始就关注这一点放到最后但反而最重要不要使用真实明星、素人照片做换脸和 AI 生成涉及肖像权侵权。不要在短剧里使用受版权保护的歌曲、影视素材、漫画分镜。发布 AI 生成内容时留意平台关于“AI 生成内容标识”的规定。不要做虚假宣传、医疗/金融类违规内容也不要用 AI 短剧做灰产引流。AI 创作工具给了普通人很大的创作自由但不意味着可以无视法律和平台规则。守住底线这个方向才能走得远。8. 总结与学习路径建议如果读完这篇教程你只记住一件事那就是AI 短剧并不是“一句话生成一部剧”的魔法它是一条清晰的生产流水线。先会拆解流程再熟练掌握每个环节的工具最后在某个环节上做出自己的方法沉淀这才是AI短剧创作者真正的护城河。给不同基础的人一条学习路径参考零基础先下载剪映注册即梦照着实战一做一个 15 秒 AI 真人短剧片段。目标不是完美而是跑通流程。有一定短视频经验学习 ComfyUI 安装和基础工作流用固定提示词模板做角色一致性控制尝试制作第一条 AI 漫剧。想规模化运营研究批量出图、LoRA 角色训练、系列化剧情设计、矩阵账号运营。下一个建议学习的方向是 LoRA 训练。如果你能针对自己的原创角色训练一个专属 LoRA角色一致性将实现质的飞跃这也是 AI 短剧和动态漫制作中最有技术含量、也最值得投入时间的一环。工具会不断升级但分镜思维、叙事能力、审美判断力无论到什么时候都不会过时。先用最小成本跑通流程再逐步迭代质量这是做 AI 短剧最务实的路径。希望这篇教程能成为你第一条 AI 短剧的起点。