# jasonzhou1993 开源 AI UGC 视频工作流，单条成片成本不到 5 元

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-09-18 00:56
- AIHOT 分数：71
- AIHOT 链接：https://aihot.news/items/cmu5sbmdi0ia9roqoz18q727j
- 原文链接：https://x.com/AYi_AInotes/status/2100629888050888911

## AI 摘要

@jasonzhou1993 开源了全套 AI UGC 视频工作流，4 条带字幕成片仅花 2.67 美元，作者称此前找海外博主拍一条 TikTok 推广视频需 30 到 50 美元并等三四天。

## 正文

damn，把真人出镜视频的制作成本打到两块钱一条，真牛逼，

以前找海外博主拍一条 TikTok 推广视频，在平台上至少要花 30 到 50 美元，还要等三四天排期， @jasonzhou1993 刚把他的全套 AI UGC 工作流开源了：4 条带字幕的成片只花了 2.67 美元，平均一条不到五块钱。
 而且他最绝的一点，是彻底摸透了怎么干掉 AI 视频那股一眼假的塑料味。
做海外投放和软件获客的朋友如果正在被高昂的视频素材成本卡住，
 这套工作流真正值钱的不是用了什么新模型，而是它把假人感的解法彻底变成了三道标准化动作：

1️⃣ 用 14 个硬约束给 AI 造瑕疵 很多人生成的数字人一眼就能看穿是假人，核心原因是皮肤太光滑、眼睛像芭比娃娃； 这套流程完全抛弃了散文式的描述词，全部换成带物理约束的 JSON 格式： 眼裂宽度几毫米、眼球露出六成、鼻孔旁必须有一颗微小黑痣、发顶要有几根凌乱的碎发； 甚至把机位卡死在手机前置摄像头距离面部 30 厘米、仰角 6 度、带轻微广角拉伸的真实自拍视角； 用这种方式跑图，生成的角色天然带着普通人未经美颜的质感，直接跨过恐怖谷。
2️⃣ 声音别让文字去猜，直接借真人的说话节奏 这是全篇最聪明的一步。 文本转语音最大的毛病不是音色假，而是节奏太工整，缺乏真实人类的吸气、抢话和吞音； 他的解法非常粗暴有效：直接在爆款库里截取一段真人讲得最自然的音频当做节奏底模， 把这段音频作为参考流连同人像一起丢进 Seedance 2.5 里驱动对口型； 模型会自动去临摹真人的说话断句与口唇起伏，比挖空心思写提示词去调语速真实得多。
3️⃣ 昂贵的人脸只出镜前几秒，后面全切真实录屏 真正懂投放的人都知道，完播率和转化的胜负手全在前 3 秒的那个钩子； 如果整条 30 秒视频都用高阶模型去跑人像生成，成本会立刻翻倍，而且中途很容易出现手部或背景形变； 整套流水线的结构是前 10 到 18 秒由数字人出镜抛出数字冲击和反常识悬念，
 一旦把人勾住，画面立刻切成无头录屏演示，配上克隆出来的画外音和逐字高亮字幕； 既把昂贵的视频生成费用压到了最低，又符合海外短视频直奔主题的视觉逻辑。
比较克制的一点是，这种流水线只适合做结构明确的口播种草与前 3 秒 A/B 测试； 如果你需要复杂的情景剧、大幅度的全身肢体互动或者精细的手部特写，当前的生成模型依然会有明显的破绽。
过去大家做视频营销，往往把精力耗在赌一条视频能不能碰上运气的单点玄学上； 但把单条成本打到几毛钱之后，整个游戏的玩法彻底变了： 你不再需要纠结哪个点子能火，直接用同一套底座批量洗出 10 组前 3 秒钩子去跑测试； 在大规模机器量产的时代，用最低的代价把筛选漏斗的前端打穿，才是小团队出海最硬的杠杆。

开源教程与各模块 Skill 完整仓库地址见下方文章，做海外投流和独立开发的可以直接收藏抄作业 https://x.com/jasonzhou1993/status/2100179182106083695/video/1

### 引用推文

> Jason Zhou：https://x.com/i/article/2099717697009553408
