◈ AI & Automation
1个视频变20个片段:自动化系统2026
大多数创作者手动将一个长视频剪成5-8个片段就结束了。我们构建了一个自动化系统,可以从单个长视频中提取20个高性能片段,在多个平台上测试,并自动扩展表现最佳的内容,整个过程无需人工干预。
2026年2月,我们在网络中的40个账户上进行了测试。一个18分钟的播客访谈变成了23个片段。其中12个突破了10万次观看。3个超过了100万次观看。整个流程——从转录到发布——完全自动运行。
以下是确切的技术栈、逻辑,以及大多数人容易出错的地方。
为什么是20个片段,而不是5个
常规建议是”质量优于数量”。但在测试内容时这是错误的。
TikTok的2026算法会在第一小时内将你的视频展示给大约200-500个种子观众。如果30%的人观看超过3秒,15%的人看完,你就进入下一个分发层级。你无法预测哪个角度、开头或框架能达到这个阈值。所以你需要测试更多变体。
当Alex Hormozi的团队在2026年初分析他们最受欢迎的Reels时,他们发现68%的病毒式片段来自他们不会手动选择的片段。”最佳”时刻对你来说不一定是对算法来说最好的时刻。

我们使用相同的模型。一个长视频为我们提供:
- 8-12个叙事片段:完整的想法,包括铺垫和结尾(每个45-90秒)。
- 6-8个单句片段:为实现最大病毒传播潜力而提取的单个句子(15-30秒)。
- 2-4个B素材或视觉片段:视觉能够承载想法的时刻,极少说话。
这是每个视频16-24个片段。我们限制在20个以避免冗余,但范围比确切数字更重要。
四层自动化技术栈
以下是我们使用的工具。你可以替换工具,但层级保持不变。
第1层:转录 + 时间戳提取
我们使用AssemblyAI(基于API,2026年每个视频小时6美分)。它返回一个带有字级时间戳和说话人标签的JSON转录。如果你偏好图形界面,Descript也可以,但对于批量作业速度较慢。
转录内容进入一个Python脚本,该脚本按句子完成和超过1.2秒的静音间隙对内容进行分块。这给我们提供了自然的切割点。
第2层:AI片段选择
这是大多数自动化失败的地方。Opus Clip和Vizard等工具基于”病毒性”对片段进行评分——但它们的模型是用2023-2024年的数据训练的。TikTok的2026年保留优先级不同。
我们构建了一个自定义GPT-4提示(通过OpenAI API),根据四个标准对每个转录块进行评分:
- 它是以问题、数字或反常识陈述开头吗?
- 它在60秒内解决还是留下好奇心缺口?
- 是否有具体的例子,而不是抽象的理论?
- 跳到中间的人仍然能理解吗?
得分7分以上的片段会被标记。我们还使用时间戳标记为每个视频手动注入2-3个”直觉”片段。
第3层:自动化编辑
我们使用Runway Gen-2进行自动重新构图(将16:9裁剪为9:16,追踪说话者的脸部)。然后CapCut Commerce API应用字幕、移除静音,并添加我们的模板:粗体无衬线字幕、10%底部填充、角落品牌水印。
替代方案:如果你已经在他们的生态系统中,Descript的API可以端到端处理这个。我们在2026年Q1测试了两者。对于超过15个片段的批量,CapCut的渲染速度快18%。
第4层:分发
片段导出到Dropbox文件夹。当新文件到达时,Zapier工作流被触发。元数据(字幕、主题标签、发布时间)来自我们使用另一个GPT-4调用预填充的Google Sheet。
然后x20.online接管。我们将每个片段推送到每个平台的8-12个账户,在72小时内交错发布,并跟踪哪些变体在前48小时内突破1万次观看。赢家会被推送到下一个账户层级。

真正有效的编辑模板
以下是我们在测试了340多个片段后确定的:
- 字幕:黄色文字,黑色描边,80pt Montserrat Bold。每行最多三个单词。TikTok在2025年底的内部研究证实,字幕可以将平均观看时间提高23%,即使对于英语观众也是如此。
- 宽高比:9:16,但顶部和底部有12%的安全填充(某些平台在iPhone 15 Pro Max屏幕上会主动裁剪)。
- 音频:正规化为-14 LUFS。任何更安静的都会被跳过。任何更响的会触发降低音量(这被算作负面参与)。
- 开头持续时间:2.8秒。这是新的保留基准。TikTok的2026算法在60秒以下的视频中优先考虑3秒保留率而不是完成率。
我们还在1秒标记处添加了0.3秒的冻结帧。听起来很花哨,但在我们的测试中减少了11%的滑过。微观模式中断确实有效。
最好的转化系统不是制作最多片段的系统——而是最快杀死坏片段的系统。
大多数自动化工作流失败的地方
三个错误杀死了80%的DIY设置:
错误1:没有人工质量保证层。自动化有时会在句子中间剪裁、选择一个有咳嗽的片段,或选择一个在上下文中毫无意义的时刻。我们对每批进行15分钟的质量保证检查。一个人以2倍速审视缩略图并删除明显的废品。
错误2:每个片段都有相同的字幕。即使片段来自一个视频,每个都需要独特的开头。我们使用在我们前500个帖子上训练的GPT-4提示生成20个字幕。然后一个人挑选最好的12个并重写其余的。这一步需要10分钟,并且能使性能翻倍。
错误3:一次发布全部20个片段。平台会惩罚冗余。如果你用相似的内容淹没一个账户,算法会认为这是垃圾。我们在不同的账户和时区中交错片段。一个账户在一周内不会从同一源视频获得超过3个片段。
来自我们2026年2月测试的真实数据
我们将8个长视频(播客、网络研讨会、YouTube上传)转化为160个总片段。以下是发生的情况:
- 38个片段在7天内突破10万次观看。
- 9个片段达到100万+次观看。
- 71个片段获得低于5000次观看(我们在48小时后杀死这些)。
- 总观看时间:跨TikTok、Instagram、YouTube Shorts和Facebook Reels的1420万分钟。
- 手动编辑花费的时间:总共2.5小时(仅质量保证和字幕调整)。
9个爆红片段共享一个特征:它们以数字或”你”陈述开头(”你在这样做是错误的”、”3个原因是…”)。2026年算法不关心制作价值。它关心的是在1.4秒内停止滚动。
90分钟设置检查清单
如果你自己构建这个,这是最快的路径:
第1步(20分钟):设置AssemblyAI或Descript API。运行一个测试视频。确认转录包括时间戳。
第2步(30分钟):构建或调整一个GPT-4提示来评分转录块。先在OpenAI Playground中使用,一旦它有效就转移到API。
第3步(25分钟):配置你的编辑工具的模板(CapCut、Descript或Premiere的自动重新构图)。锁定字幕风格、宽高比和导出设置。保存为预设。
第4步(15分钟):连接Zapier或Make.com在新片段导出时触发。映射元数据字段(文件名→字幕,文件夹→平台)。
第一次运行将花费3小时。第二次将花费45分钟。到第五个视频,除了质量保证外,你将完全无需操作。
有关其他自动化工作流的分解,查看我们的AI自动化技巧——我们已记录了2026年有效的所有主要快捷方式。
何时扩展,何时停止
这是我们的内部规则:如果一个片段在48小时内没有达到5000次观看,我们就将其从队列中删除。没有第二次机会。TikTok算法速度很快。
如果一个片段在48小时内突破5万次,我们将其推送到另外12个账户并测试3个字幕变体。如果它突破20万次,我们将其添加到我们的常青内容库中,并在90天后用新的开头重新发布。
Gary Vee的团队自2025年中期以来一直在运行这个模型。他公开表示他90%的社交媒体覆盖现在来自转化的片段,而不是原始帖子。长视频是研究和开发。片段是产品。
常见问题
将一个视频转化为20个片段需要多长时间?
通过完全自动化,从转录到最终导出需要35-50分钟,具体取决于视频长度。加上15分钟的人工质量保证和字幕调整。一旦你的工作流调整好,每个视频的实际操作时间不到20分钟。
所有20个片段的表现都很好还是大多数会失败?
在我们的2026年测试中,大约25-30%的片段在7天内突破10万次观看,40%获得5000-5万次,30%在48小时内失败,不到5000次。目标不是完美——而是找到3-5个你永远不会猜到的赢家。数量解锁发现。
我可以使用免费工具还是需要付费API?
你可以从Descript的免费层和CapCut桌面应用开始进行手动批处理。但自动化转录、片段选择和分发需要API访问。预算每月大约40-60美元的AssemblyAI、OpenAI和Zapier,以每月处理15-20个视频。
如果运行这个技术栈听起来太过度——或者你宁愿只制作内容并跳过管道——那正是我们构建x20.online的原因。你给我们长视频。我们处理剪裁、字幕、测试和跨我们管理的网络的分发。你获得性能数据和赢家片段。如果你想要结果而不需要基础设施,请查看我们的服务。
内容的未来不是更长的视频。它是每个想法进行更多测试。自动化只是让这成为可能,而不会让你的编辑团队精疲力尽。
◈ Comments (0)