尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

TheAgentCompany解读:175个真实世界任务检验AI Agent能否胜任“数字员工”

TheAgentCompany解读:175个真实世界任务检验AI Agent能否胜任“数字员工” TheAgentCompany解读175个真实世界任务检验AI Agent能否胜任“数字员工”【免费下载链接】TheAgentCompanyAn agent benchmark with tasks in a simulated software company.项目地址: https://gitcode.com/gh_mirrors/th/TheAgentCompanyTheAgentCompany 是一个专门评测 AI AgentAI 智能体的开源基准benchmark它在本地模拟出一家完整的软件公司内置 175 个真实世界办公任务从写代码、看考勤到对账报销一应俱全用来检验 AI Agent 能否像数字员工一样自主完成工作。如果你的目标是快速了解这个项目是什么、怎么跑起来、任务如何评分这篇解读会给你一份完整地图。 一句话看懂把整个公司搬进 Docker现有 AI Agent 评测大多停留在查天气、订机票这类日常场景无法考察真正的专业工作。TheAgentCompany 的思路是造一家真实的公司让员工来上班。这家公司由 4 个自托管服务组成全部预置了业务数据服务用途对应真实场景GitLab代码托管与项目管理工程师的代码世界Plane项目/Issue 管理产品与研发的看板ownCloud云盘与办公文档共享文件仓库RocketChat即时通讯和同事聊天沟通这些服务都可以通过 servers/README.md 查看说明。对测试者来说最大的惊喜是一条命令就能把整家公司搭起来。官方提供了 setup.sh 脚本几分钟内自动拉取镜像并启动全部服务约需 30GB 磁盘空间详细排错指南在 docs/SETUP.md。 175个任务覆盖6类职场角色基准的核心是 175 个任务每个任务都来自真实职场工作。按角色前缀命名一眼就知道考谁sde-软件工程师修 bug、写单元测试、跑 CI 流水线、排查崩溃的服务器pm-产品经理在 Plane 和 GitLab 之间同步 Issue、安排会议、发通知ds-数据科学家修表格、写 SQL、建数据库、做预测模型hr-人力资源核对考勤、筛简历、整理人才档案finance-财务发票匹配、预算差异分析、报销审核admin-行政安排会议室、翻译销售群聊、删 PDF 页面所有任务的定义都放在 workspaces/tasks/ 目录下。看几个真实任务描述你就能体会什么叫数字员工级别的考题——最简单的如在 #general 频道发一条含Hi和飞吻表情、并 活跃用户的消息workspaces/tasks/pm-send-hello-message/task.md硬核的如阅读内部维基、克隆 API 服务器仓库并在本地跑起来然后问 Alex Turner 接下来该自我介绍给谁workspaces/tasks/example/task.md。还有更微妙的能力要求与 LLM 驱动的 NPC 同事多轮沟通、跨系统搬运信息、处理图像与数学推理——这些能力在纯网页浏览基准里根本测不到。 评分机制结果导向 过程检查点一个基准的可信度取决于打分方式。TheAgentCompany 采用双层评分结果评测主分直接验证最终状态是否符合要求如服务器是否真的跑起来了子检查点副分复杂任务沿路设置可验证的检查点给部分分partial credit每个任务目录是一个标准化试卷包结构见 workspaces/README.mdtask.md— 题目本身唯一允许给 Agent 看的文件evaluator.py— 评分函数加密存放防止 Agent 偷看答案checkpoints.md— 人工可读的评分标准说明dependencies.yml— 该任务依赖哪些服务评分器混合了两种实现确定性程序验证精确可靠 LLM 评审处理开放性产出。评测入口在 evaluation/run_eval.py完整流程文档见 docs/EVALUATION.md。 新手上手4步完成一次 AI Agent 考试第 1 步搭建公司运行 servers/setup.sh看到 All services are up and running! 即就绪。第 2 步启动任务容器每个任务都是一个 Docker 镜像docker run拉起来。第 3 步出题给 Agent初始化环境后只需一句提示词——Complete the task in /instruction/task.md——你的 Agent 就开始上班了。第 4 步自动判卷任务结束后运行/utils/eval.py传入 Agent 的操作轨迹即可得到 JSON 成绩单轨迹还可用于计算部分得分。如果配合 OpenHands 平台整个流程可一条命令批量跑完 175 题详见 evaluation/README.md。 为什么这个基准值得关注对企业AI 是否真能接管工作流直接影响采购与人力规划这个基准给出的正是上岗实测数据对开发者它是可复现、可扩展的框架加新任务只需几分钟欢迎贡献对研究者支持多 Agent 交互、多模态观察截图/DOM/API等多种设定对比一句话总结TheAgentCompany 用 175 道职场真题回答了一个严肃问题——AI Agent 离真正取代一份工作还差多远。打开 docs/README.md 开始你的第一次招聘实测吧。【免费下载链接】TheAgentCompanyAn agent benchmark with tasks in a simulated software company.项目地址: https://gitcode.com/gh_mirrors/th/TheAgentCompany创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表