尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

口播视频 AI 剪辑完整实测:chengfeng-videocut-skills 从安装到成片一次跑通

口播视频 AI 剪辑完整实测:chengfeng-videocut-skills 从安装到成片一次跑通 口播视频 AI 剪辑完整实测chengfeng-videocut-skills 从安装到成片一次跑通【免费下载链接】chengfeng-videocut-skills用 Claude Code Skills 做的视频剪辑 Agent项目地址: https://gitcode.com/gh_mirrors/vi/chengfeng-videocut-skillschengfeng-videocut-skills 是一个给 Codex 用的中文口播剪辑插件AI 负责听懂人话、找出口误与重复确定性动作交给内置 Runtime 执行人工只在审核页上把关。这篇文章不讲术语只讲你怎么在一小时内用它剪出一条带字幕、带画面的成片以及它和传统剪辑的差距到底有多大。凌晨两点的剪辑台一次被口误折磨的真实经历想象这个画面凌晨两点你刚录完一条 19 分钟的口播内容讲得不错但里面有十几处说岔了的数字、三句重复的开头、两段改口重说。为了修掉它们你得盯着剪映的时间轴一句一句往回听——这句是第几遍录的来着这句删了会不会断等熬到凌晨四点你删了 8 处还拿不准剩下几处该不该动。这大概就是所有口播创作者的共同噩梦素材是新鲜的剪辑却把新鲜感耗光了。chengfeng-videocut-skills 想解决的正是这个。它把听懂人话再动手这件事拆给 AI把按清单执行留给程序把最终拍板交还给你。听起来很玄往下看你会发现它做的事其实很简单。先别急着眼花缭乱它到底替你摆平了哪三件事很多教程一上来就甩功能列表你记不住也未必用得上。我们换个顺序先说麻烦再说解法。麻烦一语音转写出来的字是错的。实测里一份 39 个含英文字母词的转录稿出现了 16 种写法——Grok被听成Clock、Glock甚至GokulCodex一会儿是CodeX一会儿是codex。同一个文件转两遍结果还不一样。字幕要是照着这个来技术口播基本没法看。解法是词典闸门项目内置一份术语词典AI 转录后先过一遍词典把字改对改完还会给你一张修字表逐条告诉你哪里的什么字改成了什么。词典里没有、又拿不准的AI 宁可报出来让你补也不瞎猜。麻烦二重复和口误不是靠关键词能抓的。传统工具抓重复靠模式匹配可人话里的重复长这样给我做一份AI日报【最近我就关心】最近我就很关心剪辑——前半句是不完整起头后半句才是完整表达该删的是前者。这种判断只能靠语义理解。AI 的做法是删前保后前一遍不完整或说错了删后一遍完整留。整个识别过程分成五轮扫描每轮只盯一类——句间句内重复、残句改口、口误重说、英文卡壳、口头禅语气词。一次只带一个判据去读稿子判断质量比一次带六个高得多。麻烦三剪错了没法撤销。传统剪辑里切一刀是不可逆的文件操作手抖一下就得重来。这个项目反着来AI 阶段根本不碰媒体文件只产出一份删词账本——哪几个词删、按什么理由删改一次账本只要几十毫秒。你确认之后物理剪切才发生。一句话总结原理AI 是判断的大脑Runtime 是执行的手账本是大脑和手之间唯一传话的文件。所有东西都绑在词的 ID 上而不是绑定秒数——剪辑一变字幕和画面层会自动跟着挪不会出现字幕过期这种说不清道不明的错。五分钟上手从装依赖到第一条成片全程七步照着做就行。前提一台 macOS 或 Windows 10/11 的机器以及一个装好 Codex 的终端。第 1 步装好四个依赖。Bun跑 Runtime、Node.js、ffmpeg剪辑与导出、Google Chrome渲染字幕和动画缺哪个装哪个# macOS brew install oven-sh/bun/bun node ffmpeg # Windows装完新开一个终端PATH 才生效 winget install Oven-sh.Bun OpenJS.NodeJS.LTS Gyan.FFmpeg Google.Chrome第 2 步挂载并安装插件。两条命令分开执行先挂市场再从市场装插件codex plugin marketplace add Agentchengfeng/chengfeng-videocut-skills --ref edb0ee81d4bb7016e20d7fbbba14035c7caffbe3 codex plugin add chengfeng-videocutchengfeng-videocut也可以先用 git clone 把项目源码拿到本地研究git clone https://gitcode.com/gh_mirrors/vi/chengfeng-videocut-skills.git第 3 步让 Codex 把剪辑环境装好。装完插件后直接对它说一句安装剪辑环境。它会检查插件和 Runtime 版本、缺什么下载什么含 SHA-256 校验、跑一遍 doctor 自检最后告诉你环境就绪。第 4 步发起第一次剪辑。准备一条你自己的口播视频然后说用剪口播处理这条视频。识别口误等我审核后再物理剪切并生成剪后字幕。AI 会依次做云端转录逐词稿 → 词典修字出修字表 → 五轮扫描找口误 → 汇总成两张表删词汇总表 重复句子表→ 把表呈给你看。第 5 步打开 Studio 亲自复核。这是整条链上唯一需要你说话的地方。在审核页里删掉的词会划线标出你可以逐条恢复误伤的句子也可以补删 AI 漏掉的。别急着全选恢复——先看那两张表重点听高风险项。第 6 步可选加字幕、配画面。复核完说加字幕或配画面。字幕直接按账本算时间不需要重新转录画面则是在录屏上盖圈重点、动画和推近。第 7 步导出成片。说导出成片。AI 会先跑--dry-run把计划念给你听——片长、帧数、字幕屏数、画面层数数字不对就回去改上游确认后一次性把剪辑、推近、字幕、画面层烧进同一个 mp4。首次跑任务时Runtime 会自动下载安装那一次可能要等几分钟之后就都是秒开。同一条视频两条路传统手工 vs 账本式剪辑用同一个 19 分钟口播做对照组差异一目了然环节传统手工剪辑chengfeng-videocut-skills听写自己听、自己记或交给识别率不稳定的通用转写云端 ASR 词典闸门 修字表专名逐条可查找口误反复回放凭耳朵和记忆五轮语义扫描每轮只找一类输出两张可核对的表改错成本每剪一刀都是不可撤销的文件操作先改账本几十毫秒确认后才物理剪切人工介入全程动手只在三处说话复核、改字、确认判断依据主观感觉绑定词 ID 播放顺序剪辑后自动重算学习能力每次从头开始复盘后把你的口味写进偏好文件越用越懂你说几个真实跑出来的数字首个复盘项目里AI 提交了 242 处删词提案用户全盘采纳、零修改一次因为提交方式不对删词数从 430 掉到 394被当场抓出来修正。这说明它不但能干干得还基本符合人的预期——而那个用户恢复的、用户补删的复盘环节就是它越用越准的秘密。三个值得深挖的场景功能不多讲挑三个真实使用者最容易踩中、也最能出彩的场景说透。场景一录屏太糊换高清源重导。录屏工具常常能对同一次录制重新导出高分辨率版本。换源前先做两道硬校验两个文件的时长精确到毫秒一致且音频流逐位相同用 ffmpeg 算 md5。满足这两条说明是同一个时间线逐词稿、账本、字幕全都不用动。然后四步走替换input/source.mp4并重建硬链接、更新project.json里的指纹、再更新workbench.json里的sourceSha256、最后用--scale 1重导。坑就在第三步——指纹不止记在一处漏改workbench.json会让预览直接报生成失败。项目宁可失败也不拿旧预览糊弄你这个设计很硬核。场景二让 AI 记住你的剪辑口味。剪完一轮AI 会做一次复盘你恢复掉的词是它删错了你补删的是它漏了。这些差异会分门别类写进三个抽屉——口味差异进cut-preferences.md专名错误进dictionary.md规则空白记入待升级判例。你告诉它静音阈值改严一点、保留适量嗯作为过渡它下次就照办。用得越久它剪出来的东西越像你亲手剪的。场景三给纯录屏口播加上会动的画面。对着干巴巴的录屏讲技术观众容易走神。画面 Skill 的四步是读字幕按语义分段 → 抽 8-12 帧真的用眼睛看 → 用逐帧像素差找出滚动和切换的窗口 → 在稳定画面上盖层。需要圈重点就圈需要解释概念就套用小黑漫画动画模板推近最多 1.6 倍、区域取 62.5% 见方居中避免把低清录屏放糊。实测里 12 个段落有 2 段被画面推翻文字预判——这地方该圈和这地方其实很清楚了什么都不用动往往只有看了帧才知道。踩过的坑说给你听与其背故障列表不如听听过来人踩坑时是什么反应。剪完播出来怎么感觉哪里怪怪的先别急着怪剪辑。多数情况是删了高风险项——比如同一句话说了三遍AI 只保留了最后一遍但你没在审核页重点听那一处。处理办法审核时优先听重复句子表里标了高风险的行那里是 AI 自己也拿不准的地方。删词数量怎么自己变少了这是真实事故第二次提交只交了新找到的两处结果上一轮的四处在重建时被挤掉删词数从 430 退到 394声音听着还一切正常。现在提交采用替换语义且强制检查本次不再删的词数——看到不为零说明你交了增量回去补全量。AI 把 Grok 听成 Gokul 了怎么办这正是词典闸门存在的意义。别在命令里打补丁把正确写法补进dictionary.md下一条视频自动就对了。补一次受益一辈子。换了高清源预览却报生成失败九成是指纹没换干净。项目里记录源片指纹的地方不止一处用搜索工具把旧指纹的前 8 位全找出来逐处更新再重导。推近的效果是不是丢了别凭整体印象判断——1.6 倍推近后的整页看起来仍像一整页。找只有裁剪才能造成的证据被切掉一半的气泡、消失的侧栏标题和源片同刻帧一对比一眼定案。它还在往前走你也可以现在就开始这个项目最不寻常的地方是它把AI 判断和程序执行焊死成了两道工序中间用一份带版本号的账本互相咬合。所以你能看到它在一路补齐真实场景的边角换源重导、跨平台Windows 自 v0.4.2 起全链可用、字幕按词锚定不绑秒、审核页里逐屏改字幕。往后的方向也很清楚更准的语义判断、更顺的人工复核、更省事的成片产出——前提是每个版本都先过一遍来源校验 人工确认。别光看。装好插件找一条三分钟的口播素材对着它说一句剪口播然后用五秒钟在审核页上划几条线。你会发现凌晨两点的剪辑台从此可以提前两个小时收工。想深入了解实现细节可以看剪口播的主流程文档 plugins/chengfeng-videocut/skills/chengfeng-cut/SKILL.md以及五轮扫描背后的判断依据 plugins/chengfeng-videocut/skills/chengfeng-cut/references/semantic-deletion.md。【免费下载链接】chengfeng-videocut-skills用 Claude Code Skills 做的视频剪辑 Agent项目地址: https://gitcode.com/gh_mirrors/vi/chengfeng-videocut-skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表