尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Qwen3 Max以84.51分居首:2026-09-30 Smoke快测数据简报

Qwen3 Max以84.51分居首:2026-09-30 Smoke快测数据简报 2026-09-30 赢政指数 Smoke 快测覆盖 10 个模型Qwen3 Max 以 84.51 分位居当日首位。Smoke 为每日 10 题快测适合观察短期信号不等同 Full 周榜结论。本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度主榜公式为 0.55 × 代码执行 0.45 × 材料约束。由于每日样本量较小单日分数更适合作为监控信号而不是对模型能力做长期定论。当日排名排名模型主榜代码执行材料约束诚信#1Qwen3 Max84.519472.9pass#2Claude Sonnet 4.679.419757.9pass#3Claude Opus 4.777.857285pass#4GPT-o376.867282.8pass#5Gemini 3.1 Pro73.1755.395pass#6GPT-5.570.77269.1pass#7豆包 Pro70.527268.7pass#8Grok 468.816375.9pass#9Gemini 2.5 Pro63.915080.9pass#10DeepSeek V4 Pro57.122100pass数据解读今日主榜前三中Qwen3 Max以代码执行94与材料约束72.9的搭配取得84.51Claude Sonnet 4.6则依靠代码执行97的高位在材料约束57.9下达到79.41Claude Opus 4.7通过材料约束85在代码执行72的结构下获得77.85显示头部模型在两项维度的强弱互补各有侧重。Gemini 3.1 Pro以材料约束95支撑主榜73.17而DeepSeek V4 Pro材料约束100但代码执行仅22反映出不同模型在 Smoke 测试中的即时表现差异。Gemini 2.5 Pro主榜上升22.7、代码执行上升25、材料约束上升19.9Claude Sonnet 4.6主榜上升13.1、代码执行上升10、材料约束上升16.9GPT-5.5主榜下降9.5、代码执行下降28、材料约束上升13.1这些同口径变化需结合小样本特性看待。Claude Opus 4.7代码执行暴跌28、GPT-o3代码执行暴跌21.8、豆包 Pro代码执行暴跌24.9、Grok 4代码执行暴跌31.5均可能源于题目抽样波动或单日状态起伏GLM-4.6因API故障数据不完整已进入补跑本期不参与排名。Smoke快测为每日小样本单日信号以上分数结构与异动均需后续同口径run复核确认避免对模型真实能力做出超出今日数据的推断。主要变化Gemini 2.5 Pro主榜上升22.7分代码执行25分材料约束19.9分Gemini 3.1 Pro主榜上升18.2分代码执行5.3分材料约束34分Claude Sonnet 4.6主榜上升13.1分代码执行10分材料约束16.9分DeepSeek V4 Pro主榜上升11.4分材料约束29分诚信warn→passGPT-5.5主榜下降9.5分代码执行-28分材料约束13.1分需要关注的信号Claude Opus 4.7代码执行暴跌 -28 分GPT-o3代码执行暴跌 -21.8 分GPT-5.5主榜暴跌 -9.5 分豆包 Pro代码执行暴跌 -24.9 分Grok 4代码执行暴跌 -31.5 分GLM-4.6数据不完整缺 execution,judgment 维度API 故障/超时已进入自动补跑本期不参与排名读这类 Smoke 简报时重点应放在两个问题上第一某个模型是否连续多日暴露同一类弱点第二诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化可能来自题目抽样也可能是真实退化的早期信号需要后续 run 复核。数据来源赢政指数 (YZ Index) | Run #345本文首发于赢政天下获取更多深度技术内容与资源欢迎访问官网。
返回列表