
今天分享一篇腾讯WorkBuddy团队最新发表的论文他们给自己造的内部尺子现在把它开源了。这篇论文不是孤立的学术工作而是 WorkBuddy 产品工程的副产品——把内部的模型选型评测、Harness 回归测试、任务分布洞察打包成一个开源 Benchmark。腾讯把多模型 Agent 工作台的选型底牌摊开了——GLM-5.2 在安全域双杀闭源模型、GPT-5.5 最省 token、Claude Opus 综合最强这些数据直接解释了 WorkBuddy 为什么要做多模型切换而不是绑定混元。提速500倍29s学会一个新Skill清华和自变量开源HOST框架一、WorkBuddy优势WorkBuddy Bench 优点任务分布对齐真实工作distribution-informed但完全开源可审计。Figure 1: Tencent WorkBuddy Bench 总览四个子集各有独立的评分仪器分数跨赛道不可比套件刻意不报总平均分——这是设计决策不是缺陷。表1套件一览四个子集双 Harness 评分二、核心方法论抗污染来自真实业务论文把提示词可被搜索引擎找到视为最重要的污染路径然后在任务生产环节就把它堵死表2开源清单——运行、评分、审计一个任务所需的一切全部公开任务来源每个任务锚定一个真实上游工件开源仓库的历史 commit / PR、真实 CVE或具体业务场景。匹配的不是原始请求本身而是内部使用分布查询意图类别、请求结构模式——任何原始用户 prompt、会话数据都不进入任务。改写协议逆向工程后改写成简短、口语化、刻意欠规格underspecified的请求。Code 赛道还通过五种角色发声开发者、算法工程师、产品经理、QA、运维。刻意欠规格请求只给意图和约束不给目标文件、接口定义、边界情况——Agent 必须自己从工作区里找回缺失的上下文。这考的是需求消歧与 grounding而不只是代码合成。赛后评测隔离评分资产在 Agent 行动期间完全不可见结束后才注入沙箱。“Hidden tests”指的是解题时不可见而非发布后保密——全部测试随开源一起放出。三、四大赛道拆解3.1 Code80 个任务里只有 10 个是修 BugCode 子集把 Agent 扔进一个 checkout 到基线 commit 的完整开源仓库要求它自己定位代码、改完、并保证隐藏测试通过。和 SWE-bench 最大的不同是角色与任务类型多样性五种角色、18 个细分类目Bug 修复只占 10/80。Figure 2: Code 与 Web 任务构成表3Code 子集来源家族A34BC46表4Code 子集构成80 任务开源版准入门机制值得一提每个候选任务先对未改动的工作区跑一遍验证器baseline reward 必须 ≤ 0.3证明任务不是”白给”再打上 gold patch 跑一遍oracle reward 必须 1.0证明任务可解。构建期的早期评测还暴露了两类零分模式Agent 陷入改测试文件的死循环直到超时在大仓库里迷路、改了完全不相干的文件——难度来自导航与定位而非代码合成。Figure 3: Code 任务与评测工作流3.2 Web交付物契约——说得再好路径下没有可运行工件就是零分Web 子集的硬核设定是artifact-not-chat 契约Agent 必须在声明的输出路径产出可运行工件如 HTML 入口聊天里写得天花乱坠但路径下没东西直接挂。70 个任务横跨生成、修改、分析、质检四类前端工作。Figure 4: Web 任务与评测工作流3.3 Office评的是最终工作区状态不是答案文本Office 子集测的是混合格式文件表格、文档、PDF、JSON、Markdown、文件树里的完整工作交接。评测盯的是最终工作区状态——写了一份看似合理的总结却没更新它描述的那张工作簿照样丢分这是纯文本评分抓不到的失败。Figure 5: Office 50 任务的构建路线与校准难度Figure 6: Office 四维覆盖评分是双通道确定性 Rule checks 验证文件、schema、数值、跨文件关系、状态变更、副作用边界LLM Judge 基于任务结束后生成的固定证据评估二元语义 rubric不看实时工作区、也不能改写 Rule 结果。每个任务预配自己的 Rule 权重 w_i ∈ [0.70, 0.95]。Figure 7: Office 评测流3.4 Security60 个任务全程无 LLM 裁判 五层反作弊Security 子集覆盖红蓝队全景漏洞发现与安全利用32红、恶意软件分析14蓝、安全运营8蓝、Agent 安全6红——38 红 vs 22 蓝难度刻意偏硬。Figure 8: Security 子集总览白盒审计任务复现 binutils、curl、nginx、vim、jq、fluent-bit 等广泛部署项目的真实历史 CVE采用 find-vuln → poc-verify 两步结构先读源码定位漏洞路径过阈值才解锁第二步再提交能在沙箱里稳定触发 ASAN crash 的 PoC。表5Security 子集构成60 任务四块粒度四、榜单结果没有全能冠军Harness 一换排名就洗牌表6WorkBuddy Bench 总榜0–100think 模式三次运行均值八块榜三分天下Opus 4.8 拿五块Code 双榜、Web 双榜、Office cbcGLM-5.2 以开源权重身份拿下 Security 双榜——开源与闭源的差距是分板块的不是均匀碾压GPT-5.5 拿 Office cc 一块。Harness 敏感性的几个爆点Code 排名在双 Harness 间直接换位GPT-5.5 在 cbc 下领先 GLM-5.272.90 vs 71.54在 cc 下被反超76.63 vs 77.06。Security 洗牌最狠七模型平均绝对位移 8.6 分GPT-5.5 从 cbc 第六蹿到 cc 第二MiniMax-M3 从第二跌到第五。Office 最稳七个双跑模型里五个位移不到 2 分中位数 0.86。工程细节能值 4 分HY-3 开启跨轮 reasoning passback 后 Code 分数 cbc 3.82、cc 1.92。拒答也值得记录Opus 4.8 在 Claude Code 下对安全任务出现 13 次任务级拒答cbc 下为零GPT-5.5 在 cbc 下 2 次。最难的类目暴露了真问题Code 子集里最难的是 bug_fix均值 0.47和 api_contract0.47——真实仓库的回归修复和严守契约的接口活最易的是 feature_pipeline0.94和 testing0.88。product_analytics 类目模型间差距几乎拉满 0–1.0 全程高分模型会正确推断”别把隔很久才买的算进来”这个隐含归因窗口低分模型代码跑得干干净净但把全部购买都算了进去——差距完全在业务语义理解不在代码能不能跑。另一个典型失败是”语义对但契约错”行为合理却丢了一两个必需字段如 OpenAPI 的 deprecated、examples验证器一打 per-field 布尔检查就连环清零。Figure 9: Office 按难度与任务类型的结果表7Code 子集每轮开销轮次 / 输出 token / 含缓存输入 token千为单位花钱多 ≠ 分数高DeepSeek-V4-Flash 在 cc 下输出约为 GPT-5.5 的 3.3 倍28.6k vs 8.7k分数却低 14.74 分GLM-5.2 的 cc 榜首成绩 77.06 花了 22.0k 输出 token而 GPT-5.5 只用 8.7k 拿到 76.63。GPT-5.5 是全场四赛道一致的”最省高分者”cbc 下 Code 6.9k / Web 13.5k / Office 10.2k / Security 7.5k 输出。Security 是最重的赛道30–89 轮/次MiniMax-M3 在 cbc 下平均 88.8 轮、约 11.1M 含缓存输入 token 换 74.14 分。六、与现有工作的对位表8Web 方向 Benchmark 能力矩阵∙ 全覆盖◦ 部分覆盖空白 未覆盖这些是自报的设计期对比不是跨榜单实测。差异化在于广度与框架而非新任务类型——Security 子集是公开 Benchmark 稀缺的红蓝全覆盖 全确定性评分Office 把混合格式多交付物工作流当”完整交接”来测Code 用五角色 18 类目跳出”修 issue”框架。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】