
今年春节前后受中国AI圈引领全球范围内掀起了一批大模型更新热潮一时各种旗舰模型接踵而来日常办公使用到底选哪个成了问题而具备系统操控能力的AiPy Pro为实测模型执行能力提供了理想载体这是一款能够控制电脑、手机、服务器操作的AI软件我平时用它来做PPT、分析股票、做爬虫收集数据之类的。为验证大模型真实具象化执行能力设计了本次控制 Windows 画图作画的对比测评画一辆汽车看看各个大模型的表现同时也测试了openclaw控制 Windows 画图作画的对比测评。01测评目的验证大模型控制鼠标自动操作电脑的能力很多人觉得大模型只能聊聊天、写写文案其实不然。这次测评的核心目的就是验证不同大模型控制鼠标自动操作电脑的能力各大模型到底能不能控制画图软件。能不能找到Windows电脑上的画图软件。能不能操作我的电脑鼠标在画图软件正确的位置开始做画。画的图形到底准确不准确02测评过程统一变量保证公平为了保证测评的公平性我统一了所有测试变量测试平台Windows 11 AiPy Pro 0.14.1提示词打开Windows画图软件控制鼠标画一个汽车评分标准完成度是否成功画出、准确度还原度、耗时、token消耗所有测试在同一台电脑上完成排除硬件差异影响【核心测评逻辑】大模型不需要直接画图而是通过调用AiPy Pro的系统控制能力操作鼠标在画图软件中完成绘制。这本质上是对大模型逻辑推理能力、代码生成能力、任务拆解能力的综合考验。03测评第一组豆包Seed 2.0 Pro完美完成任务在所有测试模型中豆包Seed 2.0 Pro的表现最为惊艳全程耗时53秒Token消耗31188100%完成了任务1.指令理解阶段准确拆解任务为启动画图软件→最大化窗口→选择铅笔工具→绘制汽车各部分→保存文件5个步骤2.代码生成阶段生成的PyAutoGUI代码逻辑清晰坐标计算准确考虑了窗口定位、等待时间等细节3.执行阶段鼠标移动流畅绘制顺序合理先画车身轮廓再画车顶、车窗、车轮最后补充车灯等细节4.完成效果汽车比例协调线条流畅所有细节完整最终自动保存为PNG文件到指定目录 豆包Seed 2.0 Pro 作画结果截图整个过程完全不需要人工干预从启动软件到保存文件一气呵成展现了极强的端到端任务执行能力。04其它模型测试成绩汇总这次我一共测试了9款主流大模型整体表现差异非常大具体成绩如下✅成功完成任务的模型GLM-5耗时79秒消耗41769 tokens完成质量良好 作画结果截图Gemini 3.1 Pro Preview耗时100秒消耗29258 tokens完成质量一般 作画结果截图Claude Sonnet 4.6耗时232秒消耗271707 tokens汽车构造丰富最终完成但效率较低 作画结果截图❌未完成任务的模型DeepSeek V3.2耗时879秒没有准确识别画图软件画图区域位置越出构图区边界导致图片准确度不足。 作画结果截图MiniMax M2.5耗时65秒作画图片完全失真与汽车不符。 作画结果截图Kimi K2.5耗时114秒构图混乱与汽车严重不符。 作画结果截图混元2.0耗时92秒构图混乱与汽车严重不符。 作画结果截图05如果是使用OpenClaw龙虾呢在做完测评后发给朋友分享有朋友问起我龙虾的效果于是也使用龙虾配合Gemini 3.1 Pro做了一次测试结果令人很失败一笔未画耗时20秒实际未执行画图操作 作画结果截图这里第一次说画好了但是实际画布上并没有图然后我让继续画这里画了个轮廓也就是最终结果图中央的图但不是汽车形状后来openclaw自己又继续画画出了最终图左上面的图形最终结果所有模型作画结果对比图06测评总结AI原生应用时代已经到来这次测评让我对AI工具的落地能力有了全新的认识AiPy Pro这类工具的出现让大模型真正具备了动手能力不再是只能输出文本的嘴强王者大模型的竞争已经从谁更能聊转向谁更能解决实际问题执行能力将成为核心竞争力国产大模型在特定场景下的表现已经出现两级分化部分模型已经超过或达到国际领先水平。未来我还会测试更多复杂场景比如让大模型自动处理Excel数据、批量整理文件、甚至操作专业设计软件。感兴趣的朋友可以关注我一起见证AI生产力工具的进化