
最近社区里讨论热度比较高的一个话题就是 WorkBuddy 的双模型限免Hy4 preview 开放两周体验Hy3 直接免到 9 月底。对于平时就在用 WorkBuddy 的人这算是把最贵的算力成本直接砍掉了对于还没接触过的人这也是一个低成本入坑的窗口。我自己是从 WorkBuddy 还比较早期就开始用的用户中间经历了各种版本迭代也尝试过本地部署、对接不同模型、写自定义指令、接插件和连接器。这次限免活动出来以后我在两周时间里把 Hy4 preview 和 Hy3 都跑了大量真实任务包括文档整理、定时消息、API 对接、日志分析。这篇文章就是把这段时间的实操记录做个整理顺便把我踩过的一些坑列出来。它不会像官方文档那么“正”但可能更接近一个普通用户实际会遇到的情况。内容适合三类人一是刚听说 WorkBuddy 想试试的人二是已经装好但一直不知道怎么用起来的人三是在纠结要不要本地部署、怎么把工作流沉淀成 Skill 的人。下面进入正题。1. WorkBuddy 到底是什么从编程助手到通用工作台1.1 和 CodeBuddy 相比WorkBuddy 到底“多”了什么很多人第一次看到 WorkBuddy 都会把它和 CodeBuddy 放在一起比较。这两个名字实在太像社区的搜索词里也长期挂着“workbuddy和codebuddy区别”。从我的使用体感看它们的关系其实可以用一句俗话概括CodeBuddy 更贴近 IDE 里那部分写代码的场景WorkBuddy 则把 AI 能力从“写代码”扩展到了“干活”。这个“干活”指的是哪些事对我来说最典型的是三类跨工具的信息流转。例如把钉钉多维表里的数据定期同步到本地表格再生成摘要或者从某个在线文档批量提取字段整理成规范格式。定时触发类的任务。例如每天固定时间整理待办、抓取某个页面的变化、往微信发一条通知。半结构化的重复劳动。例如把一堆 PDF 按规则重命名、抽取关键信息、归入指定目录。这些任务过去通常靠人肉重复做或者指望用脚本加定时任务来搞定。但脚本的门槛不是每个人都有精力去跨过。WorkBuddy 的思路是让用户在对话里用自然语言描述需求然后由它去调度模型、工具、连接器和技能。说得直白一点它更像一个 AI 工作台对话只是入口真正值钱的是外面接的那一圈“手和脚”。有不少人第一次打开 WorkBuddy 会觉得它和普通的 AI 聊天助手没区别这就是没理解它的定位。只把它当聊天窗口用确实浪费了。WorkBuddy 的核心价值在于“任务闭环”你给它一个目标它拆解步骤调用对应工具最后把结果交回给你。聊天只是其中最短的一环。1.2 本地部署这件事决定了它的上限WorkBuddy 社区里“本地部署”从来都是热度很高的话题搜索词里还有“WorkBuddy linux版本”“WorkBuddy麒麟版”。我理解这背后的诉求大家不希望所有数据和对话记录都被拿走也不希望每次请求都依赖遥远的云端。本地部署的核心价值在于三个维度一是隐私二是可控性三是离线兜底。所谓“本地部署”不同人理解不同。最简单的形态是桌面端装一个客户端把模型 API 配好数据都在本地处理对话记录不经过第三方中转。进阶一点的形态是把 WorkBuddy 的服务端跑在自己的 Linux 机器上让它变成一个常驻生产力服务其他设备通过客户端连过来用。我自己更看重的是可控性。有些任务我明确知道它涉及内部资料不希望每次请求都跑外网有些任务则是高频小任务如果每次都要等云端响应成本和时间都不划算。本地部署之后模型走本地推理或者私有化 API网络的波动就不会那么影响体验。不过这里要提醒一句本地部署不是零门槛。它至少要解决三件事——模型权重往哪放、推理资源够不够、以及 WorkBuddy 服务本身怎么注册成系统服务。如果你只是想在笔记本上体验直接装桌面客户端就够了如果你真的想把它当作团队共享工具那才需要认真研究 Linux 部署和权限管理。2. 双模型限免究竟在免什么2.1 Hy4 preview 开放两周为什么这个窗口期值得重视Hy4 preview 是混元系列模型里较新的一个预览版本命名里的“preview”决定了它的性质它不是稳定版而是用来提前感受新能力的试吃装。限免开放两周核心价值在于零成本验证它的推理、长文本理解、复杂任务分解能力。我在实际跑任务时对 Hy4 preview 最明显的感觉是它在“复杂指令拆解”上比老模型要稳。同样是给它一个包含多个步骤的任务有些模型会漏掉中间的衔接环节比如让它“先读取 A 文件、再和 B 表做匹配、最后生成一张汇总表”老模型经常做到第二步就停了或者在第三步把字段格式搞错。Hy4 preview 在这类多跳任务上的成功率明显高一些至少我在限免期间跑的几十个任务里重试率低了不少。另外它在长文本的理解上也比较从容。我自己有份工作流是每月要读几十页的行业报告再提炼出关键变化。用旧模型的时候稍微长一点的文档经常会出现前文信息丢失的情况Hy4 preview 在长上下文场景下更稳至少不会读到后面忘了前面。这个窗口期只有两周我的建议是别拿它去跑那些你已经很熟练、结果确定的简单任务太浪费了。应该拿它去试那些“以前不敢让 AI 碰”的复杂任务多跳推理、长文档、工具调用密集的流程都可以拿来压一压。只有在这种任务上你才能真正感知到新模型的升级幅度。2.2 Hy3 到 9 月底适合当“常驻模型”的稳妥选择Hy3 作为已经打磨过一段时间的模型优势在于稳定和便宜。限免直接放到 9 月底这其实给了用户一个很长的时间窗口可以把真正长期运行的自动化流程沉淀下来。我自己就把 Hy3 作为默认的“干活模型”。为什么“稳定”在自动化里这么重要因为自动化任务最怕的就是不确定。你今天配置好一个定时任务明天模型更新了输出格式变了整个流程就可能崩。Hy3 经过这么长时间的迭代输出习惯已经相对固定适合用来承载那些需要长期稳定运行的任务比如定时报表、数据同步、消息推送。这些任务不追求最聪明的模型追求的是“不闹脾气”。另一个原因是成本。长跑型任务每天都会消耗大量 token如果都用最高规格的模型费用会非常可观。Hy3 的性价比更适合当常驻模型。限免到 9 月底意味着在这段时间里你完全可以把它当作免费生产力来用把日常任务都接上去跑通了之后再决定要不要付费续期。2.3 限免时间线怎么规划两周与一个月的差别“两周”和“到9月底”并不是同一个节奏你需要把这两段时间分开规划。Hy4 preview 适合用来做“验证型任务”。它的窗口短你应该在拿到手的第一时间就去跑最复杂、最想验证的任务把所有怀疑“模型能不能搞定”的用例全部丢给它。跑完之后做一次记录哪些任务它完成得好哪些还需要人工接管。这些记录是你后面决定要不要付费使用新模型的重要依据。Hy3 适合用来做“沉淀型任务”。它的窗口长你有充足的时间把自己的工作流固化成 Skill、连接器、定时任务让它们成为日常自动化的底座。我建议趁这段时间把那些“一直想做但懒得整理”的流程全部建起来反正模型不花钱犯错的成本也很低。这里给大家一个时间节奏参考表时间段重点任务不建议做的事前两周Hy4 preview 压测复杂任务、验证多跳推理和长文档能力拿新模型跑低价值简单问答浪费窗口前两周用 Hy3 搭建基础工作流、配置连接器和定时任务追求一步到位忽视版本更新的风险9 月底前把 Hy3 上跑通的流程固化为 Skill记录参数和踩坑把所有流程都绑死在免费模型上不做迁移预案长期根据验证结果决定哪些任务用高规格模型哪些用低成本模型不做成本测算就盲目全量接入付费模型把这个时间线想清楚你就不会在双模型限免期间手忙脚乱。说到底限免不是让你多聊几天天而是给你一个低门槛做技术验证的机会。3. 实操环节从安装到把双模型跑起来3.1 环境准备与安装方式先说安装。WorkBuddy 目前主要覆盖 Windows、macOS、Linux 三大平台社区里讨论比较多的还有 Linux 下的麒麟版适配。搜索词里“WorkBuddy linux版本”“WorkBuddy麒麟版”一直热度很高说明国内不少用户在信创环境下有实际使用需求。如果你只是个人尝鲜建议从桌面客户端开始。去官网下载对应你系统的安装包Windows 就是 exemacOS 就是 dmgLinux 有对应的包格式。装完之后启动它会引导你登录账号并配置模型服务。整个过程和装一个普通软件没什么区别不建议一上来就搞本地部署先把基本流程跑通再说。如果你确实需要在 Linux 服务器上跑 WorkBuddy方向上有两种选择一是直接用官方提供的 Linux 客户端适合你有图形界面的桌面 Linux二是把 WorkBuddy 核心服务跑在无头服务器上再用 Web 或客户端远程访问。第二种方式更接近“部署”需要你配置服务、监听端口、设置权限把它当作一个常驻进程来管理。我知道有朋友把它跑在麒麟系统上配合内网模型服务整体用下来体验还不错但初始化阶段确实比 Windows 版多一些步骤。安装完成之后第一件事不是去聊天而是先确认配置项是不是齐全。重点检查三块账号状态、模型服务地址、以及工作目录。工作目录尤其容易被忽略——WorkBuddy 在执行任务时会在本地读写文件如果你没指定一个干净的工作目录后面跑自动化任务时文件散落在各处真的很痛苦。3.2 模型配置与双模型切换这次双模型限免很多用户在问同一个问题Hy4 preview 和 Hy3 到底在哪里打开我截不了图就只能用文字描述一下逻辑。通常在 WorkBuddy 的设置项里会有一个“模型管理”或“模型服务”的入口你可以在里面看到当前可用的模型列表包括本次限免的 Hy4 preview 和 Hy3。在配置模型时需要注意两件事。第一确认限免标识是否生效。如果界面上显示的是限免就可以直接调用如果显示需要付费或没有权限先检查账号是否登录正确再检查客户端版本是否需要更新。第二搞清楚“全局模型”和“单任务模型”的区别。全局模型就是你默认对话时使用的模型单任务模型则是某一个 Skill 或连接器在运行时指定的模型。如果你希望定时任务固定用 Hy3那需要在对应任务的配置里显式指定而不是改全局设置。我自己习惯的做法是全局默认用 Hy3保证日常问答和基础任务稳定遇到复杂任务时再手动切到 Hy4 preview 去跑。这样可以控制成本也能在需要时享受到新模型的能力。3.3 Skill、连接器和自定义指令三者的区别与配置顺序很多新手看到 Skill、连接器、自定义指令这三个概念就头大总觉得它们是同一种东西。我一开始也混淆过后来用多了就分清楚了。自定义指令是最简单的它就是你给 AI 设定的人设和行为规范。比如“你是一个数据分析助手每次回答都要附上数据来源”“所有输出必须用 Markdown 表格”。它影响的是模型“怎么说”。Skill 则是更完整的能力封装。一个 Skill 通常包含指令、示例、可能需要的依赖和输出模板。它影响的是模型“会做什么”。比如你可以写一个“周报生成”Skill让它自动汇总聊天记录、提取关键事件、按固定格式输出周报。连接器解决的是“能碰到什么数据”的问题。钉钉、飞书、微信、本地文件系统、数据库、HTTP API这些都是连接器对象。它影响的是模型“能用什么工具”。社区里很多人问“workbuddy连接器是什么”说白了它就是 AI 与外部系统之间的桥梁。配置顺序建议是先接连接器再写自定义指令最后封装 Skill。因为你只有先把数据通道打通模型才有东西可以操作只有先把指令调好模型输出的风格才是你要的最后把它固化成 Skill才算真正沉淀成了能力。4. 限免期间建议重点试的三类场景4.1 用自定义指令把个人工作台搭起来很多人用 WorkBuddy 一段时间后觉得“不过如此”问题往往出在自定义指令上。没有自定义指令的 AI就像一个没有岗位说明书的实习生你说一句他做一步你不说他就发呆。加了一套好的自定义指令它才真正变成你的工作搭子。我分享几个我自己在用、且验证过效果不错的指令方向。第一个是“信息整理员”。日常阅读微信公众号文章、行业报告、竞品页面时经常有大量信息需要归档。我给它定义了一套规则输入一个链接或一段文本输出包括核心观点、关键数据、与我的业务的相关性、以及建议下一步动作。自定义指令里我还特别要求它必须使用固定格式避免每次输出的样式都不一样。第二个是“计划拆解器”。我经常把一些模糊的目标丢给它比如说“我想把团队的知识库整理干净”它会基于一套指令把目标拆成可执行的子任务每个子任务都标注优先级、依赖关系、预估耗时。这个指令不需要太复杂但把拆解逻辑写清楚AI 输出的质量就会有明显提升。第三个是“风险提示员”。我在很多指令的末尾都会加一句如果我的要求里存在逻辑漏洞、数据冲突或者潜在风险请在回答开头先指出来。这个看似简单的自定义指令实际帮我躲过了不少坑。AI 有时候不是能力不够而是默认顺着你说加一句反问指令会好很多。4.2 定时任务和多维表同步让数据自己跑起来搜索词里热度很高的一条是“workbuddy钉钉多维表定期同步”还有“workbuddy 定时发送微信消息”。这两个需求本质上是同一类定时触发加跨系统数据流转。先说钉钉多维表同步。我实际用 WorkBuddy 跑通的一个流程是钉钉多维表里维护着一个项目排期表团队成员随时会更新任务状态但更新得很零散。我配置了一个定时任务每天早上 9 点和下午 6 点各跑一次从多维表拉取数据对比前一天的状态生成一份变更摘要然后发送到工作群。这个流程如果手动做每天至少花二十分钟而且容易漏。用 WorkBuddy 之后本质上就是把“拉数据、做对比、生成摘要、发送通知”这四步串起来。连接器负责拉数据和发消息模型负责对比和写摘要定时器负责触发。三个组件在一起就是一个很典型的自动化场景。再说定时发送微信消息。这个需求更常见也更微妙。我的建议是先确认发送通道的授权方式是否合规以及是否有频率限制。配置这类任务时一定要先在测试群里跑几次确认消息内容格式没问题再放到正式群里。否则一个格式错误的消息发出去就是事故。这类自动化的共同经验是先把“手动流程”完整跑一遍记录步骤和输入输出格式然后再去 WorkBuddy 里配置。千万不要跳过手动跑通的环节直接让 AI 配置。AI 对流程的理解再强也不如你自己先摸清楚业务细节。4.3 文档型任务的批量处理限免期最适合压测的场景文档处理是 WorkBuddy 这类工具最值得压测的场景也是我觉得这次双模型限免最适合做的事。原因很简单文档处理任务通常包含读取、理解、提取、生成四个环节正好能测出模型在这四个环节的能力边界。我自己压测过一个典型任务把一批 PDF 投研报告批量生成摘要并把摘要按公司维度汇总成一张表。这类任务在 Hy4 preview 上的表现让我比较满意长文本理解稳定输出的字段格式也统一而用 Hy3 跑同样任务时摘要质量稍弱一些但对于内部快速浏览已经完全够用。压测文档任务时我强烈建议准备一个“基准测试集”。就是固定用那几份你非常熟悉的文档反复跑不同模型不同指令看它们在不同配置下的输出差异。只有用同一份测试集对比你才能判断出模型才是真的升级了还是只是这次运气好。另一个实用技巧是把输出格式写死。文档任务的输出格式比内容更重要。如果你在指令里写“提取关键信息”AI 每次返回的结构可能都不一样后面就很难做自动化处理。但如果你写“输出 Markdown 表格包含公司名称、行业、核心观点、风险提示四列”那每次返回的格式就基本可控了。5. 常见问题与排查思路5.1 高频问题速查表代码类和工具类产品遇到问题是一件特别正常的事。我把这一个月里自己和身边朋友遇到的高频问题整理成了一张速查表希望对你排查问题有点用。现象常见原因解决思路界面上看不到 Hy4 preview 或 Hy3客户端版本过旧或账号未识别限免资格更新客户端到最新版重新登录账号本地模型无法加载模型权重路径配置错误或推理资源不足检查模型文件路径、显存占用降低并发数插件列表里没有想用的插件插件未启用或目录扫描失败到插件管理页确认启用状态重启客户端钉钉多维表同步失败连接器鉴权过期或字段调整重新授权连接器检查表结构和字段名定时消息没有按时触发时区设置不对或定时器被系统挂起检查系统时区和定时器状态关闭系统休眠输出格式不符合预期自定义指令里没有固定输出模板在指令中显式指定输出格式给出完整示例Linux 版无法启动缺少系统依赖库或版本不兼容按官方文档安装依赖查看启动日志麒麟版安装报错系统版本与安装包不匹配确认 CPU 架构选择对应的安装包这个表格没法覆盖所有问题但大部分情况下都能让你找到排查方向。真正处理问题时养成看日志的习惯比什么都重要。5.2 最容易踩的两个坑第一个坑是“改了配置但不生效”。这个坑我踩了不止一次而且表现非常隐蔽。你在设置里改了默认模型或者自定义指令然后继续对话发现 AI 还是老样子完全没按新配置来。我开始以为是产品 bug后来才发现是会话缓存的问题旧会话仍然挂着旧配置只有新建会话才会加载最新设置。解决方法是养成“改动配置后新建会话”的习惯。无论是改了模型、改了指令、还是改了一个连接器的参数都新建一个会话再测试。不然你会在旧会话里做无效调试白白浪费很多时间。第二个坑是“模型能力背了配置的锅”。有段时间我觉得某个模型输出质量特别差甚至打算直接弃用。后来仔细检查了一遍才发现问题出在自定义指令上。我在指令里写了一些自相矛盾的要求AI 按指令执行的结果自然一团糟。经过反复调试指令之后同一个模型的表现直接从“勉强能用”变成了“趁手好用”。这两件事叠加起来给我的教训是遇到效果不好的情况先别急着怪模型至少先排查三个环节——会话是不是旧的指令是不是有冲突连接器是不是生效。把这三个问题排除掉再回头评价模型的真实能力。5.3 关于日志和排查习惯的建议如果你打算长期用 WorkBuddy 跑自动化任务我建议从一开始就养成看日志的习惯。WorkBuddy 执行任务时会记录运行日志包括任务触发时间、调用了哪些连接器、每一步的执行状态、以及最终的输出结果。这些日志是你排查问题的第一手资料。我自己的做法是每周固定花十分钟把这一周的运行日志扫一遍重点看那些“执行成功但结果可疑”的任务。很多自动化任务并不是直接失败而是成功完成了某个错误操作这种问题光看表面结果很难发现。只有翻了日志才能看到每个步骤做了什么才能尽早发现异常。另外一个实用习惯是给任务命名时带上日期和用途。比如“每天同步钉钉排期-生产环境”“每月汇总销售数据-季度版”。这些命名看起来小事一桩但当你的定时任务多起来之后光是靠名字就能快速定位问题不用一个个点进去看配置。结尾关于双模型限免我的一点体会这次双模型限免我的真实感受是限免本身不是重点重点是它给了每个人一个零成本做技术验证的机会。很多人平时说起 AI 自动化总觉得门槛太高不知道从哪入手。限免的价值就在于把“试错成本”降到了零你可以放心大胆地去跑那些以前不敢跑的任务跑坏了也不心疼。我个人在实际操作中最受益的一件事是把以前一个需要每天早上手工处理的报表流程彻底变成了自动运行。现在每天早上打开电脑WorkBuddy 已经把当天的数据对比和摘要生成好我只需要花两分钟确认一遍结果然后把它转发到群里。这个过程用的就是 Hy3还没花一分钱。最后再分享一个小心得别指望一次配置就完美。自动化流程都是慢慢养出来的先跑起来再根据实际输出不断调整指令和参数。限免窗口还在合适的时间就赶紧动手试试。等这批免费额度用完你已经积累了一套完全属于自己的工作流那才是这次限免最大的收获。