Qwen3.8-Max-Preview 三方上手实测结果

发布时间:2026/7/21 14:36:13

Qwen3.8-Max-Preview 三方上手实测结果 Qwen3.8 现在是预览版、还在迭代没有标准跑分SWE-bench/GPQA 都没出。但第三方已经有人上手实测了结论很反常识——跑分更高的 Kimi K3在实测里翻车了没跑分的 Qwen3.8反而稳。对普通开发者来说这才是该看的信号。2026 年 7 月 19 日阿里通义千问放出 Qwen3.8-Max-Preview——2.4T 参数、1M 上下文、MoE 架构官方口径仅次于 Anthropic Fable 5。但和历次 Qwen 一样官方完整 benchmark 博文还没发benchlm.ai 上它的分数栏写着 0 of 321 / Coming soon。作为一个写代码的人我不等跑分——我直接上手用。本文基于 techgogogo 7/19 上手实测报告把 Qwen3.8-Max-Preview 拉到和 Kimi K3、GLM-5.2、DeepSeek V4 Pro、Opus 4.8、GPT-5.6 同一张桌上聊聊它到底好不好用。先说人话Qwen3.8 现在是预览版、还在迭代没有标准跑分SWE-bench/GPQA 都没出。但第三方已经有人上手实测了结论很反常识——跑分更高的 Kimi K3在实测里翻车了没跑分的 Qwen3.8反而稳。对普通开发者来说这才是该看的信号。数据可信度图例✅官方口径/官方榜厂商官方账号或官方博客公布的数值权威第三方媒体/博主上手实测、或独立机构榜单vals.ai/SWE-bench/LMArena/Artificial Analysis 等⚓前代锚定本代未公布以前一代同系列已公布数据作下限锚定⏳待公布截至今日无任何公开数值如实留白一、上手实测Qwen3.8 到底好不好用techgogogo 在 7/19 发布了一份上手测评原文链接用的是他惯用的标准化考题把 Qwen3.8-Max-Preview 和 Kimi K3 拉到同一套题面前对打。这不是跑分是真刀真枪的 coding 实测对开发者更有参考价值。实测项目 1约束文本生成 逻辑推理限制性文本要求带格式/字数/结构约束的生成全对而且速度更快。24 点数学题、密码推断题顺利解开。基础推理这关3.8 干净利落。实测项目 2代码开发最该看的一关三个真实 coding 任务表现是产出效率明显跃升网页端太空射击小游戏UI 与功能完整能跑3D 飙车程序运行流畅、无操控故障这点很关键下面会说为什么模仿Trello 的看板应用还原度极高只漏了一个单独的清除待办按键对日常写代码的人来说小游戏、3D 交互、复杂 UI 还原这三类任务3.8 能一次出到基本能用的水平不用反复调。Trello 那个漏了一个按键属于接近完成但差最后一口气——典型预览版状态。实测项目 3同题对比 Kimi K3最有意思的部分同样这套题Kimi K3 的表现是答题失误、赛车失控、界面 bug、生成耗时极长。⚠️反常识警报Kimi K3 的 SWE-bench Verified 跑分是 93.4%vals.ai #3自报Qwen3.8目前 0 个跑分。但同一套实测题里跑分高的 K3 翻车、没跑分的 3.8 反而稳。这不是说 K3 不行而是跑分和真实 coding 体验之间存在明显落差——对选模型干活的人来说这个落差比榜上那几分重要得多。techgogogo 的总结Qwen3.8 综合实力更出众响应速度优势突出。注意这是 7/19 预览版的第一手结论模型还在以天为单位迭代正式版预计近期开源可能更强。二、六款模型横评跑分表 实测张力下表统一用业内可比性最强的几项基准。主角 Qwen3.8-Max-Preview 的标准跑分格如实留白⏳——官方未公布、benchlm 仍 0/321但补一列上手实测定性作为开发者视角的真实信号。Fable 5 作为官方对标的天花板列入参考。模型参数/形态SWE-benchVerifiedSWE-benchProGPQADiamond上手实测定性Qwen3.8-Max7/19 预览2.4T MoE1M ctx 将开源⏳ 待公布⚓锚定80.4⏳ 待公布⚓锚定60.6⏳ 待公布⚓锚定92.4 techgogogo小游戏/3D/Trello稳、同题K3翻车 Trilogy 架构推理盲审 80/100K3 83 AICodeKing KingBench 65/80 总榜第二Fable5 3.8 Opus4.8Kimi K37/16 开源2.8T 开源93.4% vals #3 自报—93.5% techgogogo 同题翻车答题失误/赛车失控/bug/耗时长 Trilogy 架构推理 83/100略胜Qwen80lifecycle/版本重生成/更快/省tokenGLM-5.26/13 MIT开源开源 1M ctx未直接公布58.4 ✅—开源编程登顶槽点思考过久DeepSeekV4 Pro开源 1M ctx成本↓3.7×80.6% ✅自报55.4 ✅—成本敏感型首选架构创新型ClaudeOpus 4.8闭源 海外88.6% 69.2% #1—复杂工程任务质量最优解GPT-5.6Sol闭源 海外7/9 发布96.2% #164.6% —标准任务之王出海团队Fable 5参考天花板闭源 Anthropic95.0% ~80% —Qwen 官方对标对象数据来源techgogogo 7/19 上手实测、Trilogy AI 架构推理盲评StackPerf 框架、vals.ai、SWE-bench 官方榜、Artificial Analysis、benchlm.ai及各厂商官方Alibaba_Qwen X、智谱 GLM 文档、DeepSeek、OpenAI、Anthropic、SCMP。—表示该模型该项基准未公开成绩如实留白。Qwen3.8 标准跑分格留白是事实——benchlm.ai 当前标注 0 of 321 published非编造。前代 Qwen3.7-Max 锚定值来自 qwen.ai 官方博客与 benchlm.ai。读表要点标准跑分上GPT-5.6 Sol96.2%和 Fable 595.0%是双高天花板Kimi K3 以 93.4% 居开源之首Opus 4.8 次之DeepSeek V4 Pro 与前代 Qwen3.7-Max 锚定值同档80% 段。但最右边一列才是开发者该盯的跑分王 Kimi K3 在 techgogogo 同题实测里翻车没跑分的 Qwen3.8 反而稳。跑分高 ≠ 你用着顺手这是这张表最重要的信息。三、上手门槛与性价比现在就能白嫖跑分可以等但能不能马上上手用、花多少钱是开发者更关心的。Qwen3.8-Max-Preview 这点很友好1千问 PC 端 / Web 端直接免费体验零门槛试。想先摸底够不够用的从这里开始。入口2阿里云 Token Plan 个人版39 元/月起可接 Claude Code / Cursor / Qwen Code 当后端模型。重度 coding 用户走这条。3Qoder 平台上线限时1 折、夜间0.2 折活动页。夜里跑长任务的成本能压到极低。!对比 Kimi K3K3 是开源权重7/27 前释出可私有化部署Qwen3.8 目前只能走 API/百炼权重即将开源但还没开。要私有化的现阶段 K3 更现成要现成好用、低成本 API 的3.8 更顺手。✅一句话性价比免费试用门槛最低千问 Web 端、重度用户 39 元/月 Token Plan、夜间跑活 0.2 折——Qwen3.8 在上手门槛 成本这两项上对个人开发者是目前最友好的国产旗舰之一。四、两份实测结论不一致该信哪个第一份实测——techgogogo7/19原文用标准化考题对打Kimi K3 的 SWE-bench Verified 跑分 93.4%自报、vals #3但在真实 coding 题小游戏、3D 飙车、Trello 看板里翻车——赛车失控、界面 bug、生成耗时极长Qwen3.8 反而稳3D 飙车运行流畅无操控故障、Trello 看板还原度极高只漏一键。这一份里没跑分的 3.8 赢了跑分王 K3。第二份实测——Trilogy AI原文换了维度结论就变了。作者用自研 StackPerp 框架、两个陌生 GitHub 仓库、统一环境 OpenCode 1.17.13 控制变量做软件架构与代码推理盲审——要求模型分析陌生代码库、设计系统集成、定义数据契约、追踪完整数据流。最终 Kimi K3 得 83/100、Qwen3.8 得 80/100K3 略胜 3 分即此前说的三点之差。而且各有所长K3 在生命周期状态、版本重生成上更强且更快、更省 tokenQwen3.8 在系统边界划分更清晰、能捕获 replay 元数据、工具调用次数更少。这份里K3 在架构推理上扳回一城。两份实测的张力才是真实该看的东西techgogogo 场景 3.8 赢、Trilogy 架构推理 K3 略赢——不同维度、不同结论这比一边倒可信得多。给你的落地判断日常出能跑的代码小游戏/3D/UI 生成3.8 更顺手复杂架构推理、数据流追踪、版本重生成K3 略强。别只看一份实测也别只看跑分——尤其 SWE-bench Verified 顶端GPT-5.6 96.2% / Fable 5 95.0% / K3 93.4%已挤在一起、区分度失真。第三份实测——AICodeKing KingBench有具体分数AICodeKing 频道《Qwen 3.8 Max (Fully Tested): AN ACTUAL OPEN FABLE COMPETITOR!》视频7/19约 1.1 万播放用自研 KingBench 跑 3.8对比 Fable 5 / Opus 4.8 / Kimi K3 / GLM-5.2 / GPT-5.6 Sol。Qwen3.8 Max 得 65/80总榜第二排在 Fable 5 之后、Opus 4.8 之上。强项frontend / Three.js / SVG / game / math / agentic满分项弓箭游戏、hard math、长程 agentic 任务Claude Code 里快且能干长程任务仍有短板。来源博主视频描述自研 benchmark分数体系与 Trilogy 不同、不可直接横比各自结论并列参考。五、各模型该用在哪开发者版基于实测 跑分 上手门槛给个落地的开发者用法建议不绕弯Qwen3.8-Max-Preview日常 coding、小游戏/3D/UI 生成、长程工程任务。上手门槛最低、响应快、实测稳。现在是预览版等正式开源后私有化也能上。Kimi K3要私有化部署、跑分党、前端 Code Arena 场景。但实测工程稳定性有坑上手先小范围试别直接扔长程任务。GLM-5.2开源、1M 上下文、项目级工程。性价比高但思考过久是已知槽点急活儿慎用。DeepSeek V4 Pro成本敏感、高吞吐批量活。运行成本比 V3.2 降 3.7×1M 上下文开源可自部署。Claude Opus 4.8复杂工程、代码质量优先SWE-bench Pro 69.2% #1。出海团队、不差钱、要质量天花板。GPT-5.6 Sol标准任务、终端任务之王Verified 96.2% #1。出海、标准工程流水线首选。Fable 5参考综合天花板Qwen 官方对标对象。国内不易直接用作能力上限参照。一句话口诀日常顺手用 3.8私有化看 K3/GLM成本看 DeepSeek出海质量看 Opus/GPT-5.6。六、别急着下结论的几个点3.8 还是预览版官方称以天为单位迭代。techgogogo 7/19 实测是第一手快照正式版预计近期开源可能更强也可能调偏别把预览结论当定论。标准跑分仍未公布benchlm 0/321。官方一旦放分尤其盯SWE-bench Pro——前代 Qwen3.7-Max 是 60.6%3.8 若进 70 段才算坐实仅次于 Fable 5的口径。Kimi K3 跑分是自报权重 7/27 前释出93.4% 尚待独立复现它在 techgogogo 实测翻车不等于它不行而是说明单看跑分会误判。本文实测依据为三份第三方上手实测techgogogo标准化考题3.8 赢 K3、Trilogy AI架构推理盲审K3 略胜 83:80、AICodeKing KingBench65/80 总榜第二Fable 5 3.8 Opus 4.8。三份综合看3.8 在日常 coding / 游戏 / 前端 / 数学 / agentic 强、综合排 Fable 5 之下 Opus 4.8 之上架构推理略逊 K3——预览阶段谁强谁弱还没定论。建议你自己拿同类题在千问 Web 端免费跑一遍复验这才是属于你的真实结论。本文数据截止 2026-07-20。七、为什么 3.8 值得盯三个真本事本节为定性解读视角非跑分——提炼自一段对 Qwen3.8 Max 的分析视频来源并挂上前文三份实测佐证。帮你从分数之外理解 3.8 凭什么被称作开源版 Fable 5 挑战者。1 推理下限reasoning floor高小模型简单题能答、复杂多步逻辑就崩猜、幻觉、漏步、代码看着对跑不通。2.4T MoE 的 3.8 认知面更大难任务前不易崩。实测佐证AICodeKing KingBench 里 3.8 在长程 agentic 任务、hard math 拿满分——恰是推理下限高的直接体现。2 长程抗漂移agentic persistence抗 slopification长会话里很多模型越改越烂——忘了原约束、改了不该改的、风格漂移。3.8 被定位成能在长 messy 工作流里锁住原始指令。实测佐证techgogogo 里 Trello 看板还原度极高、只漏一个键指令 adhere 到位、Trilogy 里系统边界划分更清晰、工具调用更少结构维持得住。3 开源权重 控制力私有化部署金融/医疗/政企数据不出域、可微调、长程 agent 不被按 token 烧钱、不被安全过滤卡住正当技术活。这是闭源 Opus/Fable 5 给不了的。待 3.8 正式开源权重释出这条才真正兑现现阶段只能走 API/百炼。✅ 最聪明的用法Qwen Opus 混合工作流。别让一个模型干所有事——Opus 4.8 / GPT-5.6 Sol 做规划与终审架构、风险、最后 polish3.8 做长程执行写文件、跑循环、数据处理、重复活最后再交 Opus/Fable 5 复核。规划用闭源的精度、执行用开源的自主与低成本、复核再回到闭源的严谨——这才是这波模型潮里开放闭源该有的搭配而不是非此即彼。结语Qwen3.8-Max-Preview 今天还没有一个标准跑分但已经有三份第三方把它拉到一起实测——结论各有趣味techgogogo 标准化考题里 3.8 赢K3 翻车Trilogy AI 架构推理盲审里 K3 略赢83:80AICodeKing KingBench 里 3.8 拿 65/80 总榜第二、排在 Fable 5 之后 Opus 4.8 之上。三份合起来才画出 3.8 的真实水位日常 coding / 游戏 / 前端 / 数学 / agentic 是强项、综合稳居 Fable 5 之下 Opus 4.8 之上但架构推理还略逊 K3。对写代码的人这比榜上 93.4% vs 96.2% 那几分重要得多——日常出能跑的代码、响应快、上手便宜3.8 都做到了。等它正式开源放分那天再回头看这三份实测验证一下不同维度各有胜负是不是常态——那才是这波模型潮里最值得琢磨的事。

相关新闻