把YouTube长视频剪成爆款短视频,这个开源项目能帮你省下剪辑师的工钱
一周拿下847颗星的开源项目,主打把YouTube长视频一键转成竖屏短视频:检测高光、自动加字幕、配音翻译一条龙。本文实测它的能力边界、踩坑点和普通人能立刻上手的工作流。

适合:需要批量把YouTube长视频转成竖屏短视频、做海外内容搬运或二创的个人创作者和小团队。
先说结论
short-video-generator-AI做的事情很直接:你给它一个YouTube链接,它帮你把长视频切成竖屏短视频,顺便把高光片段、字幕和配音一起搞定。一周847颗星的速度,说明做海外短视频搬运和二创的人确实被“剪辑”这件事卡得很疼。这个项目不是黑魔法,它是一套拼装好的流水线,效果能用,但别指望它替你做创意判断。
真正的问题
做YouTube转短视频的人,长期卡在三件事上。第一,怎么从一两个小时的访谈里挑出能爆的30秒,靠人工看片太慢,靠纯算法挑出来的片段又常常是废话。第二,字幕,英文识别不难,但翻译、配音、对齐口型,每一步都掉一层质量。第三,竖屏裁剪,原视频是横屏,怎么让人脸始终在画面里,怎么避开尴尬的半身切。
short-video-generator-AI的解法是把这些环节串成一个Python流水线:高光检测找候选片段、Whisper做语音转字幕、翻译模块做多语输出、TTS做配音、最后用FFmpeg重新构图并烧录字幕。它不发明新算法,它把现成工具拼成一条能跑通的链路,这恰恰是大多数开源项目缺的东西。
怎么做更省力
别一上来就喂一整期两小时的播客。先拿一个10到15分钟、信息密度高的视频试水,比如一段产品发布会或一段采访。流程跑通后,再扩展到长视频。
| 环节 | 项目默认方案 | 想要更好效果的替换 |
|---|---|---|
| 高光检测 | 关键词与停顿分析 | 接入LLM做语义打分 |
| 字幕 | Whisper转写 | 指定语言模型提高准确率 |
| 翻译 | 通用翻译接口 | 用领域词表微调或人工校对关键句 |
| 配音 | 默认TTS | 选用更接近本人声线的克隆方案 |
表格不是教你去折腾配置,是告诉你哪里值得多花半小时,哪里用默认就行。配音和翻译是观众最先察觉差异的地方,字幕错位可以忍,声音像机器读稿会直接劝退。
哪些坑要避开
第一,高光检测不是“金句检测”。它更擅长找停顿、找关键词、找情绪波峰,但不懂你的账号定位。一段主持人念的赞助商口播,可能被算法当成高光剪出来。一定要人工过一遍候选片段,这是省不掉的步骤。
第二,竖屏裁剪会丢画面。两个人对话的场景,左右各一张脸,裁完基本没法看。这类素材要么换构图策略,要么老老实实做横屏版本。
第三,字幕和配音不同步是常见现象,特别是中文转英文再转回中文的时候。延迟通常在几百毫秒,肉眼能看出来。先跑一遍短片段,确认时间轴对齐再批量生成。
第四,版权和平台规则。YouTube视频的二次创作要尊重原作者和平台政策,纯搬运加字幕在TikTok、YouTube Shorts、小红书上都可能触发限流甚至下架。这个项目解决的是制作效率,不解决合规问题。
第五,依赖较重。Python、FFmpeg、Whisper模型、翻译接口、TTS接口,缺一个就跑不起来。新手第一次部署可能要折腾大半天,这不是工具的锅,是这类AI视频项目的常态。
现在就能动手
第一步,克隆仓库,按README装好Python依赖和FFmpeg,准备好Whisper模型权重。 第二步,找一条10分钟以内的英文视频,按默认配置跑一遍完整流水线,看看生成的竖屏短视频和高光片段长什么样。 第三步,挑出你最不满意的一段,比如字幕错位或配音违和,回到配置里只调一个参数重新跑,记录前后差异。这一步的目的不是调出完美效果,是建立你对每个模块能力的直观感觉。 第四步,确认基本可用后,把你的常用提示词、术语表和高光筛选规则写进配置,下次直接复用。 第五步,把它接入你的内容生产节奏:每周固定几条源视频,跑流水线,人工筛片,发布。工具省的是重复劳动,账号定位和选题判断还得自己来。