尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

AI 大模型开始收“速度税“了:GLM-5.3-FlashX 收 2.5 倍、Claude 收 6 倍、MiMo 收 3 倍,DeepSeek 一分不收

AI 大模型开始收“速度税“了:GLM-5.3-FlashX 收 2.5 倍、Claude 收 6 倍、MiMo 收 3 倍,DeepSeek 一分不收 同一道题有人花 1 块、有人花 5 块。差在哪不是模型是你提问的语言和它思考的习惯。本文基于官方价目表 本号 12 跑思考实测盘点 2026 年大模型定价里的三种税文末附可收藏的自查表。太长不看TL;DR快已经被单独定价Claude Fast 6 倍价、MiMo UltraSpeed 3 倍价、GLM-FlashX 2.5 倍价——速度从附带属性变成了商品。长考税思考过程按 token 计费同一道题成本方差能到 5-6 倍实测数据见第二节。语言税同一模型同一道题英文提问思考量比中文多 71%实测。DeepSeek 三项都没收但 8 月 17 日已悄悄涨过一轮价输出价至今没降回原价。自查表3 分钟判断你正在被收的是哪张税第五节。一、速度税为什么快能单独卖钱先说机制再说考古。快不是免费送的。200 tokens/s 的推理意味着这批 GPU 是预留给你的独占推理资源、调度优先、SLA 保障。你不用的时候这些算力也在空转烧钱。厂商把这笔独占成本单独定价就是速度税的来源。上半年大家还在卷价格战降价抢量用便宜的算力冲规模下半年敢把价格往上标用速度筛客户用独占换溢价。竞争从谁的模型便宜变成了谁的速度值得加钱。把今年公开报道过的速度定价案例按时间排一排今年一季度Claude Opus 4.6 推出 Fast Mode官方文档指向 2 月底–3 月。速度比标准版快 2.5 倍输出 token/秒价格翻 6 倍输入从 $5 涨到 $30、输出从 $25 涨到 $150每百万 token。这是目前公开案例里税率顶格的一笔比 GLM 这次的 2.5 倍高出一大截。今年 5 月智谱自己就干过一轮面向部分企业客户推出 GLM-5.1 高速版 API输出速度 400 tokens/s当时号称刷新全球大模型厂商的 API 速度上限。9 月的 FlashX 已经是它第二次收税区别只在这次把价格和速度写进了公开发布会。今年 6 月小米 MiMo-V2.5-Pro 推出 UltraSpeed 模式万亿参数模型跑在普通 8 卡 GPU 上输出破 1000 tokens/s峰值接近 1200。定价是标准版的 3 倍官方口号很直白“3 倍价格10 倍输出体验”。限时两周、申请制想交钱还得排队。9 月 18 日GLM-5.3-FlashX2.5 倍价换 5 倍速常态化开放。四笔税放在一起看趋势清清楚楚**速度从模型的附带属性变成了一项可以单独定价、单独售卖的商品。**有分析把这总结成一句话大模型竞争正在从训练 Scaling Law 转向速度 Scaling Law。这里插一条我自己的数据。我用官网 chat 实测过 DeepSeek V4.1 Flash 的思考速度单跑思考 4 万字符上下平均耗时 2 分 17 秒粗折吞吐大约在每秒两三百 token 的量级刚好落在 GLM-5.3-FlashX 收税的那一档附近。口径比较粗字符数不等于 token 数也没走 API 实测这个数字先立此存照回头我用账单把它坐实。但体感是一致的DS 的思考速度已经摸到了别人要加价才能买到的档位。二、长考税慢的那批罚单换了一种开法速度税明码标价还有其他隐形的税种吗有只是罚单换了一种开法。先说一句**思考过程正在变成一项计费科目。**各家陆续把 thinking 预算、reasoning tokens 单列计费之后模型想多久直接决定账单多长。而同一道题的思考长度方差可以很大。这就是长考税的来源单价可能不高但用量随机同一道题的成本能差出几倍。速度税写在价目表上长考税写在你的账单波动里。Kimi K3。Artificial Analysis 的独立实测2026 年 7 月快照输出速度 32.6 tokens/s在 190 款模型里排第 147同价位中位数是 72.7更难受的是首 token 延迟等 161 秒才开始吐字。智力指数上它排在第七位能力配得上它的价格但慢也是真慢K3 为什么这么慢甚至成了评测文章的固定小标题。中文社区有测试者统计过单个任务生成 40 分钟起步一天跑 4 到 5 个任务烧掉 699 元会员 40% 的 token 额度粗算下来 K3 单个任务的订阅成本是 GPT-5.6 Sol 的两倍这些是社区自测口径各不同参考即可。GPT-6 Astra。两个数字比任何跑分表都有冲击力。一个是 Simon Willison 的标志性 pelican 测试max 档出一张 SVG用时 4 分 02 秒按目录价折算 63.2 美分他自己的评价是质量提升撑不起这 40 倍的延迟溢价。另一个是社区实测的《传送门》通关人类玩家 3 小时的游戏Astra 跑了近 23 小时触发 3336 次智能体循环按目录价折算 API 成本约 571 美元实测走的是 200 美元订阅账面没花那么多但烧掉的配额是实打实的。更扎心的细节是token 大量烧在想上实际输出占比很低配额消耗是标称的 1.5 到 2 倍。顺带接一句热点这段时间社区里都在喊 MiMo 2.6 是新斩杀线而它家的钱袋子思路是一脉相承的前代 V2.5-Pro 就干过 3 倍价的速度生意。我在上一篇四家实测里踩过同一类坑只是踩在了免费网页版上MiMo Pro 三跑的用时是 6 分 38 秒、22 分 12 秒、31 分 40 秒Flash 三跑是 5 分 23 秒、16 分 52 秒、32 分 38 秒。同一道题在同一个模型身上最快和最慢差出 5 到 6 倍其中两跑思考到最后一个字都没输出。换成 API 计费场景这两跑就是纯烧掉的钱而且你发出请求之前没有任何办法知道这一次会落在哪一档。这就是长考税的本质。对照之下DS 的做法值得单独说一句**它的思考链精炼程度本身就是一种降价技术。**同一道 Q4DS 三跑思考合计 12 万字符MiMo 两家六跑合计 80.6 万差出 6.7 倍而答案质量都是对的。把思考写短其实是替用户把长考税直接降没了。快加上省这两样在 DS 身上是一体的。三、语言税连用什么语言想都在计价第三种税最隐蔽它不取决于你买了什么只取决于你怎么问。机制先讲明白**大模型按 token 计费而 token 是按字/词切出来的。**中文的信息密度高同样一段意思中文切出来的 token 数通常少于英文。同一个模型思考链用英文写账单天然比中文多一截。所以模型用什么语言思考本质是个成本问题翻译只是表面现象。在做 deepseek 测试的时候我做过一组对照实验同一道题、同一个 DeepSeek中文提问三跑思考全中文平均 4.0 万字符逐句对齐翻译成英文再问三跑思考瞬间切成全英文中文字符从 79052 个掉到 46 个单跑思考涨到 6.8 万字符。用时相当、答案等价变量只剩下语言。也就是说同样的问题你用英文问DS 的思考账单要多出七成。反过来讲**中文提问是一个零配置的省钱开关。**而 MiMo 拿到中文题面会先在脑子里把题翻译成英文再想思考全程英文、最后交付中文中间那段烧钱的过程用的是最贵的语言。上一篇实测里MiMo Pro 的中文思考占比只有 1.1%几乎等于用中文问你用英文想。三种税到这里就齐了。速度税写在价目表上明码标价长考税藏在账单波动里随机扣款语言税最隐蔽它只取决于你怎么问。四、把倍数换成钱同一道题三种花法倍数看着抽象换成钱就具体了。用一个最朴素的算法把 DS 用中文提问跑完 Q4 的思考账单记作 1 块钱其他几种跑法按思考量等比例放大同一道题的思考开销是这样的同一道 Q4只看思考账单相对开销DS · 中文提问1 元基准DS · 英文提问约 1.7 元MiMo Pro · 中文题面它英文想约 3.1 元MiMo Flash · 中文题面它英文想约 3.6 元Step · 中文思考跑约 0.4 元Step · 英文思考跑约 5 元混入深度变化算法很笨各家单跑思考字符量除以 DS 中文跑的 4 万字符保留一位小数。表里的元只是记账单位你把你家模型的每百万输出 token 单价乘上去它就变成真金白银。两个口径照实交代。字符口径换 token英文吃亏同样一段意思英文 token 只多不少所以按 token 算表里的倍数只会更大。思考占输出的大头答案文本两边又差不多这个简化在倍数量级上站得住。这张表真正想说的是**同一道题、都能做对思考账单能差出 3 倍多而差价藏在两个价目表上没有的变量里你提问的语言和模型自己的思考习惯。**价目表上一个数字都没动你的账单动了。五、三税自查表·收藏版下次选模型对着这张表查写到这里三张税单都有了数字可以压成一张四行的自查表。四行全是零成本动作前两行上官网就能查后两行花你十几分钟跑两遍。先记三步自查法对应三张税查价目表≈2 分钟看有没有极速/高速/FlashX档位溢价几倍 → 对应速度税。同题三跑≈10 分钟拿你手头最贵的那道题同一题跑三遍记用时 → 对应长考税。换语言≈10 分钟中英文各问一遍看思考流语言和字数 → 对应语言税。然后对照这张表你要做的事打开查什么危险信号本文实测对照选模型扔一道中文题看思考流语言中文题面英文思考MiMo Pro中文占比 1.1%比价格有没有极速档/高速版溢价几倍同能力起步就 2.5 倍FlashX 2.5 倍Claude 6 倍接进流程同一道题多跑几遍记用时同题用时差出 5 到 6 倍Pro 6分38~31分40Flash 5分23~32分38省一笔换提问语言各跑一遍对比英文问思考贵七成71% 纯语言税这张表建议收藏。下次哪家涨价、上新档位拿出来对一遍五分钟就能判断它收的是哪张税、你有没有办法绕开。价目表只是入场券税单才是成交价。六、DeepSeek 一项没收但账本会变盘完这张价格表你会发现一个很有意思的事实本篇出现的三种税DeepSeek 一项都没收。速度上它的思考吞吐摸到了别人要加价的档位长考上它的思考链精炼程度把这项税降没了语言上你用中文问它就用中文想一分钱不加。这份三重优惠目前是白给的。但是。关注 DeepSeek 价格的朋友应该记得8 月 17 日那次没有提前打招呼的调价后来输出价也没有降回原价9 月 10 日 Flash 换代降价后输出价格闲时 4 元/百万 token依然没回到调价前的水平。免费网页版用户可能无感API 用户已经体验过一次说变就变。所以我真正想问的是这份白得的速度税减免、长考税减免、语言税减免哪些能长期保持哪些随时可能变成收税模式也许有一天极速 DS会和极速 GLM一样变成价目表上单独的一行也许长思考会被拆成档位按 thinking 预算计费也许连用中文问便宜些这种事都会在某次调价里被抹平。可能就在明天可能也已经在它内部的会上讨论开了。谁都不知道答案我们能做的就是把每一轮测试的数据存好下次调价那天第一时间知道谁在收新税。每日一问算完今天这笔账你最近一次 AI 账单里最意外的开销是什么是某次长思考烧掉的额度还是换了个提问语言后凭空多出来的钱评论区聊聊高赞回答我会单独成篇。留言区最想拆哪家的账单也可以点名热度最高的选题我优先排期。也欢迎大家关注我的同名GZH一起讨论。测试口径DeepSeek V4.1 Flash 思考速度与语言对照为本号官网 chat 实测2026-09-23同一道自编 Q4 陷阱题中文/英文提示词各三跑思考流全文存档脚本逐跑统计MiMo 思考量、用时区间对照同上。GLM-5.3-FlashX 定价与速度引自智谱官方发布及证券日报报道2026-09-18Claude Opus 4.6 Fast Mode 价格与 2.5 倍速引自 Anthropic 官方文档GLM-5.1 高速版引自智谱官方文档MiMo UltraSpeed 引自小米官方发布2026-06-08Kimi K3 速度数据引自 Artificial Analysis2026-07 快照及中文社区实测GPT-6 Astra 数据引自 Simon Willison 公开实测与社区《传送门》通关记录账单为目录价折算来源DeepSeek 调价日期与价格引自公开报道2026-08-17 生效。所有第三方价格以各家官网为准。三税换算表与自查表基于本号 12 跑思考实测及文中公开数据整理换算口径见第四节。前篇《DeepSeek MiMo 2.6 思考链实测》《DeepSeek 思考语言实测》。考卷公开https://free-llm-exam.app.workbuddy.host/
返回列表