
开头如果不把这个痛点说清楚后面所有自动化方案都显得像是在炫技。我做英语学习类短视频做了大半年最开始的日更方式是早上花一小时找选题、写英文例句和中文讲解下午录音、找图、剪辑、加字幕最后再憋一段发布文案。一天两条都累得够呛更别说保持内容质量稳定。后来我把这套流程整体搬进 COZE搭了一条自动生成每日英语短视频的工作流从选题、写稿、配音、配图到视频合成全部自动跑我只需要在早上花十分钟审核成品、手动发布就行。这篇是系列第12篇我把完整实操过程写出来包括工作流怎么拆节点、提示词怎么调、定时任务怎么配以及跑了整整30天之后踩过的坑。如果你也在做英语教育类自媒体、在线英语老师想批量产出教学素材或者是想用 COZE 搭建自动化内容管线的开发者这篇可以直接当成操作手册来抄。1. 日均一条英语短视频手动做的成本到底有多高先说手动日更的时间账单这是我认为最该算清楚的一笔账。很多人觉得自己只是“做个视频”但实际拆下来一条60秒左右的英语学习短视频从零到发布差不多要两个小时打底。1.1 手工流水线各环节耗时拆解我的旧流程是这样的先花10到15分钟定当天选题比如“今天讲一个容易混淆的单词”还是“拆解一句美剧台词”然后开始写英文脚本包括主题句、中文翻译、知识点讲解、拓展例句这一步通常要30到40分钟因为不是随便写一句英文就行还得保证发音清晰、语法正确、有讲解价值写完脚本后自己录音手机录3到5遍选一遍能用的加上降噪和裁剪15到20分钟没了配图找素材又是20到30分钟还要注意版权问题最后剪辑加字幕、卡点、转场最少40分钟遇到剪映抽风直接一小时。整套下来没有两个小时根本打不住。如果只是偶尔做一两条这个成本还能接受但做账号最怕的就是“状态波动”。状态好的时候文案一气呵成状态差的时候连一个例句都憋不出来。而且每天重复同样的工作人的精力会被大量消耗在录音和剪辑这些重复操作上真正该花心思的选题策划和内容优化反而没时间做。按照这个时间算笔总账一个月30天每天2小时就是60小时。把这些时间用来运营社群、回复评论、对接商务产出会高得多。所以我才决定把重复劳动全部交给自动化管线人只保留“定调性、审稿、发布”这三个核心动作。1.2 COZE 在整个链路里到底扮演什么角色先把一个误区说清楚COZE扣子不是剪辑软件它不会像剪映那样帮你拖时间轴、加特效、调滤镜。它本质上是一个智能体与工作流的编排平台你可以把它理解成一个不睡觉的“内容生产调度中心”。它能做的事情是在每天固定时间自动唤醒调用大模型生成脚本把脚本拆成结构化数据再把这些数据依次喂给语音合成插件、图片生成插件和视频合成插件最后把一条成片和对应的发布文案一起推给你。换句话说写稿这件事它干了配音导演这件事它干了美术找图它干了剪辑排期它也干了只是最后出画的技术活要交给插件或者外部渲染服务来完成。这一点想通了后面的工作流设计就会很顺。我不是在问“COZE能不能直接一键生成视频”而是在问“COZE能不能把生成视频所需的所有素材和指令编排好让每个环节都自动跑完”。答案是可以的。1.3 这套方案适合谁照搬基于我这一个多月的实践最适合照搬这套做法的人有三类第一类是英语教育类自媒体运营者尤其是需要日更或周更5天以上的个人博主内容量大、重复度高自动化收益最明显第二类是教培机构的老师每天需要给学生产出晨读素材、课后练习视频格式比较固定用工作流批量出片非常省事第三类是想做英语学习类小程序或付费社群的产品型选手需要持续产出标准化内容但又不想雇剪辑师。如果你只是偶尔拍一条英语口播视频那没必要搞这么重的工作流直接在手机上录就行。自动化这套东西的优势在于“高频标准化”低频场景反而是给自己找麻烦。2. 方案设计一条“选题到成片”的COZE工作流包含哪些环节正式搭建之前我建议先想清楚整条流水线分几个节点、每个节点吃什么数据、吐什么数据。这一步想明白后面所有配置都是在填空。2.1 工作流六个节点的职责划分我最终跑通的工作流一共有六个节点按顺序分别是触发节点负责每天定时启动流程同时保留手动触发入口用于测试。文案生成节点调用大模型根据主题池生成一条英语学习内容的完整脚本并以 JSON 格式输出所有字段。语音合成节点把脚本中的英文句子和例句合成为一段美式发音的 MP3 音频。配图生成节点根据脚本中的画面描述生成3张16:9配图分别用于封面、正文和结尾打卡页。视频合成节点把音频、图片、字幕文本合并为一条竖屏或横屏 MP4 视频。结果推送节点把视频文件链接、标题、发布文案推送到飞书机器人或保存到文件里方便我审核后用手机直接发布。这里有一个很关键的设计原则下一个节点只依赖上一个节点的结构化输出绝不依赖自然语言文本。比如语音合成节点只需要一个audio_text字段配图节点只需要一个image_prompt字段。如果让每个节点自己去理解大段中文解释出错概率会直线上升。2.2 各环节工具选型对照选型这件事我踩过不少坑直接给出一张对照表供参考节点可选方案我用的方案选择理由大模型豆包系列、其他主流模型豆包通用模型中文讲解自然、JSON 输出稳定、上下文理解好语音合成扣子插件市场各类 TTS 插件支持美音女声的 TTS 插件发音标准、支持 MP3 输出、接口稳定图片生成扣子插件市场文生图插件支持16:9画幅的文生图插件出图快、风格可控、一次能生成多张视频合成插件市场视频合成能力 / 本地 FFmpeg先用插件不稳定时走本地插件省心本地兜底可控结果推送飞书机器人 / 微信公众号模板 / 文件飞书机器人手机消息提醒最直接审核和下载都方便选型时不要过分纠结于某一个插件的名字因为插件市场更新很快今天叫A明天可能就改名成B了。我建议你按“能力”筛选有“语音合成”能力的、有“文本生成图片”能力的、有“媒体合成”能力的把候选插件各试一次看响应速度和输出格式哪个最舒服就行。2.3 触发方式定时触发为主手动触发为辅COZE 的计划任务功能可以直接在触发节点里配置我设置的是每天早上8点整自动运行一次。之所以选8点是因为这个时间点我正好在通勤路上或者刚到公司收到飞书推送后可以在碎片时间完成审核。但自动触发只解决“按时开工”的问题调试阶段还是要靠手动触发。我在工作流搭建时会把入口做成两用一个按钮是“立即运行”方便我改完提示词后立刻测试另一个按钮是“定时任务”每天自动跑。两个入口指向同一个工作流只是参数不同。3. 分步实操在扣子平台把六个节点真正跑通下面进入正题我把每一步配置都写清楚包括可以直接复制改用的提示词模板。3.1 创建智能体并选定模型登录扣子平台后先创建一个新的智能体名字可以叫“每日英语短视频工坊”。创建时选模型我选的是豆包通用模型主要原因是它在中英混合输出时表现稳定讲解也不死板。创建后在“人设与条件”里写一段系统提示词我的写法是你是一个英语教学经验丰富的内容策划擅长把复杂的语法点和地道表达讲得通俗易懂。 你的任务是每天帮助生成一条30到50秒的英语学习短视频文案。 输出必须严格遵守用户要求的 JSON 格式不要输出任何多余说明。这段提示词的意义在于让模型提前进入“内容策划”角色并且强制它只输出 JSON避免后续节点解析失败。3.2 文案生成节点稳定输出结构化JSON文案生成是整个工作流的大脑它的输出质量直接决定后面所有节点能不能正常干活。这个节点我塞给大模型的提示词分两部分一部分是“系统人设”一部分是“每日主题与格式约束”。主题格式部分我给了一个可以复制的模板你直接替换成自己的主题池就行请生成一条30到50秒英语学习短视频的完整脚本主题为{daily_topic}。 你必须输出以下 JSON 结构字段名严格一致 { title: 一句话标题适合做视频标题, english_sentence: 今日核心英语句子尽量地道、实用不超过20个单词, translation: 核心句子的中文翻译, explanation: 80字以内中文讲解讲清知识点、使用场景或易错点, example_sentence: 一个拓展例句控制在一行以内, image_prompt: 英文配图提示词用于生成一张16:9插画风格英语学习卡片, publish_text: 发布文案包含2到3个相关话题标签 } 不要输出任何 Markdown 标记或额外字段。为什么要求 JSON 而不是让它自由发挥因为后续语音合成节点、图片生成节点、视频字幕节点全都依赖稳定的字段名。如果模型某天突然把english_sentence改成了sentence下游节点全部会拿不到数据。3.3 语音合成节点让英文句子开口说话拿到大模型输出的 JSON 之后语音合成节点实际上只关心两个字段english_sentence和example_sentence。我在 TTS 插件前加了一个“代码节点”把两个字段拼接成一段完整的朗读文本格式是“核心句。例句拓展例句。”这样语音听起来是一气呵成的不会有人工拼接的两段感。TTS 插件我推荐选择支持美音女声、输出 MP3 格式的语音合成能力。参数方面语速设置在1.0倍音量和音调保持默认。有一点要特别注意不要只朗读核心句一定要连例句一起朗读否则20秒的视频会让观众觉得信息量太单薄。语音合成的结果一般会在节点输出中返回音频文件的 URL 或 base64 编码后面视频合成节点会用到。建议你在工作流里加一步“音频时长检测”把音频时长作为一个变量传下去后面分配图片停留时间时直接用这是解决音画不同步的关键。3.4 配图生成节点给每条视频生成统一风格的视觉配图生成节点做两件事先把image_prompt传给文生图插件再把生成结果整理成视频合成节点需要的图片列表。为了视觉统一我会在提示词里固定风格后缀16:9 aspect ratio, soft lighting, illustrated style, English learning card style, pastel colors只要风格描述一致每天生成的图看起来就像同一套设计方案而不是随手拼凑的素材。图片张数我固定为3张第一张用于标题封面突出核心句第二张用于讲解内容可以加一点和主题相关的场景元素第三张是结尾打卡页干净一点方便观众截图保存。如果你用的文生图插件支持一次生成多张那就在一次调用里完成减少节点数量。如果不支持就写一个循环节点把3个不同的画面描述依次丢给它最后合并成一个图片 URL 数组。3.5 视频合成节点云端插件与本地渲染兜底视频合成是整个工作流里最容易出现变数的环节。我先说纯云端方案在扣子插件市场搜索“视频合成”或“图片视频生成”这类插件一般支持传入图片列表、音频 URL 和字幕文本返回一个 MP4 链接。优点是完全不用管服务器缺点是素材控制精细度有限。如果云端插件不稳定或者你想精确控制字幕样式就走本地兜底方案通过 Webhook 节点把图片 URL、音频 URL、字幕文本推送给你自己的服务器服务器上用 FFmpeg 渲染成片。核心指令大致是这样的ffmpeg -loop 1 -i img1.png -loop 1 -i img2.png -loop 1 -i img3.png \ -i audio.mp3 -filter_complex \ [0:v]scale1920:1080,trimduration5[bg0];\ [1:v]scale1920:1080,trimduration5[bg1];\ [2:v]scale1920:1080,trimduration5[bg2];\ [bg0][bg1][bg2]concatn3:v1[bgv];\ [bgv]drawtexttext核心句:fontsize72:fontcolorwhite:x(w-text_w)/2:y(h-text_h)/2[out] \ -map [out] -map 1:a -c:v libx264 -c:a aac output.mp4这个命令是把3张图片按顺序拼成一段视频每张图停留5秒同时把核心句子烧录在画面中央。实际运行时5秒这个值要由前面检测到的音频总时长除以3来计算才能做到音画同步。我个人现在的做法是优先用云端插件如果连续两次调用失败自动走 FFmpeg 兜底路线。工作流里加一个条件分支就行判断依据就是“视频合成节点是否返回了有效的 MP4 链接”。3.6 配置每日定时触发与通知在触发节点里选择“计划任务”配置每天08:00执行。这里有一个小坑一定要确认平台默认时区是东八区否则你预定8点它可能是凌晨4点跑的。配置完后先点一次“试运行”确认能跑通才放心。另外我强烈建议在工作流末尾加一个“失败通知”。COZE 支持在节点失败时发送飞书机器人消息这样即使某天流程崩了你也能第一时间收到手机推送而不是等到晚上复盘才发现今天的视频没出。4. 提示词调优实录让每日内容不重样、有干货工作流跑通之后最大的痛点从“能不能跑”变成了“内容质量行不行”。这一章我专门讲提示词调优因为这是决定账号调性的核心。4.1 主题轮换机制别让大模型自由选题第一次测试时我偷懒只写了一句“每天生成一个英语学习主题”结果前三天还能看第四天开始模型就疯狂往“如何提升英语听力”这个方向跑内容同质化非常严重。后来我改成固定主题池让模型按星期轮换主题池如下今天请选{daily_topic} 周一日常生活口语 周二职场常用表达 周三经典电影台词解析 周四易混淆语法点 周五英美文化背景知识 周六长难句拆解 周日本周重点表达回顾这样做的直接效果是内容维度从“一个方向”扩展成“七个方向”观众不会觉得每天都是老一套。而且主题池可以随时改比如你想蹭热点往池子里加一条“热点新闻相关表达”就行。4.2 难度分层与中英文占比控制英语学习视频最容易出的问题是“讲者自嗨观众劝退”。要么全是简单句看完感觉没收获要么全是长难句基础弱的观众直接划走。我在提示词里明确要求了结构参考难度核心句子控制在 CEFR B1-B2 水平即高中生到大学生能听懂 拓展例句控制在 B1 水平稍微简单一点用于降低认知负担 中文讲解不超过80字只讲一个核心知识点不要铺开讲三个。一个知识点讲透就够。这是我从评论区反馈里总结出来的经验观众看英文短视频通常只记一个“今天学到的表达”你塞三个知识点进去他反而一个都记不住。4.3 字幕和发布文案在生成阶段一并输出早期我犯过一个错误工作流只管生成视频发布文案我自己另写。结果就是每天多花10分钟憋文案偶尔还会漏标签。后来我在文案生成节点的 JSON 里直接增加publish_text字段让模型把字幕要点、30字种草文案、3个话题标签一起算好。实际效果不错因为我只需要在飞书里复制粘贴就能发。你要注意一条publish_text不要写太长控制在100字以内抖音和小红书这类平台短文案打开率反而更高。4.4 一周成品结构实测示例我贴一组实际跑出来的内容结构方便你直观感受这套主题池的产出形态星期主题核心句子示例讲解方向周一日常生活口语Could you run that by me again?run by 的灵活用法周二职场表达Lets circle back to this later.职场“回头再聊”的正确说法周三电影台词Im going to make him an offer he cant refuse.经典句式在口语中的借用周四易混语法If I were you, Id double-check.were 虚拟语气别再只会 was周五文化背景Lets grab a coffee and catch up.catch up 的文化语境周六长难句拆解Its not until you lose your health that you value it.not until 倒装结构拆解周日本周回顾Could you run that by me again?回顾本周5个核心表达可以看出主题池让内容天然有了节奏感。周日复盘尤其受欢迎因为它给“追更”的观众一个明确预期——今天会复习本周重点适合截图保存。5. 运行30天踩坑记录从音频报错到定时漏跑的完整排查链路再好的工作流跑一个月也总会遇到幺蛾子。这一章我把真实遇到过的4个问题连同排查过程写出来你遇到类似情况时可以直接照方抓药。5.1 偶发超时故障直接加重试逻辑别指望换插件现象每天早上8点触发后飞书迟迟没收到成品点开日志才发现 TTS 节点报了“上游调用超时”。这不是单个插件的问题而是云服务偶发波动几乎无法避免。我的处理方式是在 TTS 节点外层套一层重试逻辑如果第一次调用失败等待5秒后再试一次再失败就换一个备用的 TTS 插件两个都失败才让整个工作流终止并发送失败通知。参数上我把“最大重试次数”设为2实测一个月内 TTS 节点没有因为偶发超时丢掉过任何一条视频。小提示重试逻辑里记得排除“参数错误”这一类4xx错误——参数问题的重试一万次也没用只有5xx类超时错误才值得重试。5.2 音画不同步核心是音频时长与图片停留时长的计算现象视频里核心句还没念完画面已经从封面图切到了讲解页观感很突兀。根因视频合成插件默认每张图停留固定秒数比如3秒但音频总时长是动态的可能一段语音就要18秒。如果图片3张各3秒视频只有9秒语音根本放不完。解决思路分两步第一步在 TTS 节点输出时通过代码节点读取音频文件元数据拿到精确的音频时长第二步把“音频总时长÷图片张数”作为每张图的停留时间参数传给视频合成节点。如果是本地 FFmpeg 方案直接动态计算trimduration的值就行。调整后画面切换节奏和语音进度就完全对上了。5.3 定时任务漏跑靠日志定位、靠通知兜底现象某天早晨飞书没有任何推送打开工作流日志发现触发器根本没有生成运行记录。排查链路先看“运行历史”里有没有这次触发记录。没有记录基本可以确定是计划任务本身没触发而不是工作流内部报错。这种情况偶尔会在平台侧发生你无法完全控制只能靠兜底方案减少损失。我的兜底方案是双保险第一开启失败通知任何异常第一时间推到手机第二在中午12点再设一个“补跑”计划任务前置条件判断一下“今天是否已经成功产出过视频”如果还没有就自动重新执行一次完整流程。这样即使早上的触发漏了中午也能补上最坏情况只是晚发几个小时。5.4 内容重复率上升用知识库做“已写内容”去重现象跑到第三周周二和周五的例句开始出现重复比如“circle back”这种高频职场短语在不同主题下反复出现。原因大模型虽然每天接收同一个主题池但相似主题下容易生成相似的例句积累时间越长重复概率越高。我的解决办法是利用扣子的知识库功能每天生成成功后把title、english_sentence、explanation存进一个“已发布内容库”。文案生成节点的提示词中动态加入当天日期并要求模型先到知识库检索如果检索到今天的主题或核心句已经出现过必须换一个更具体的角度不得重复使用相同例句。增设这一步后内容重复率明显下降。注意检索关键词不要只查核心句子还要查“主题日期”因为同一句英语可能在不同主题里被反复举第一次。6. 成品落地与场景扩展从自动生成到内容矩阵工作流跑稳之后需要考虑的最后一步是“产物怎么送出去”和“这套能力还能干什么”。这两个问题想清楚这个项目的价值才算真正释放。6.1 产品输出与人工审核发布的平衡我的工作流最终输出端包括MP4 视频链接、封面图链接、标题、发布文案全部汇总到一条飞书机器人消息里。我早上看到消息后先花几分钟检查三件事核心句子有没有事实错误、中文讲解是否通顺、配图风格是否统一。确认没问题才手动下载并发布到平台。我不是没试过全自动发布后来放弃了原因是内容审核风险不可控。平台算法对机器的容忍度时好时坏而且 AI 生成的内容偶尔会有“一本正经胡说八道”的情况尤其涉及文化背景类知识点时如果没有人把关就直接发出去对账号伤害很大。所以我强烈建议自动化生产可以做到90%但最后那10%的人工审核一定要保留。6.2 把单条视频产能复制成内容矩阵跑通英语短视频之后我很快意识到这套工作流本质上是一个“标准化内容工厂”换掉提示词主题池就能产出完全不同类型的内容。目前我自己验证可行的方向有三个多语种学习视频把英文换成日语、法语TTS 换对应语种音色其他节点完全不用动。每日金句卡点视频去掉讲解字段和知识点只保留金句翻译背景图适合做读书博主。产品卖点口播短片把英语句子换成产品卖点文案配图换成产品场景图就变成了一条简易的电商短视频流水线。这套迁移能力才是 COZE 最值钱的地方。它不是帮你做某一条视频而是帮你搭了一条“内容生产线”生产线本身可以随时换产品。6.3 下一步我准备优化的方向跑了30多天我目前的流程还有两个明显的可优化空间一是视频模板比较单一目前用的是“图片轮播字幕”形式下一步打算接入更丰富的视频模板插件让画面动起来比如关键句出现时加一个放大动画二是准备给飞书推送增加数据统计比如每天记录视频的完播率和点赞率回填到知识库里让大模型根据数据反向调整选题方向和措辞风格。这两个方向做完整个系统就不仅仅是自动化而是带了一点“自我优化”的味道。等到跑出效果我再单独写一篇来复盘。