尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

推理速度战:OpenAI×Cerebras 750 token/s 之后,本地与云端谁更快?

推理速度战:OpenAI×Cerebras 750 token/s 之后,本地与云端谁更快? 过去两周AI 圈的头条从「谁模型更大」悄悄变成了「谁推理更快」。近日Gemini 3.7 Flash 半价、DeepSeek V4 Pro 上线、Qwen3.8-27B 开源、OpenAI 与 Cerebras 推出 Ultrafast 推理档、智谱 GLM-5.3 发布——这五件事指向同一个信号推理速度正在和模型能力脱钩成为独立的竞争维度。对企业开发者来说这意味着选模型时只看 benchmark 分数已经不够还得算 token 成本、首 token 延迟和端到端 wall-clock。本文把这三天的公开信息拼成一张「速度地图」并给出可直接套用的选型检查清单。为什么速度突然成了主角2026 年之前的模型竞争基本是「榜单分数 参数规模」。但当 Agent、代码助手、长文档处理进入生产环境后真正决定体验的是多轮交互延迟一次对话动辄十几个 tool-call每轮慢 200ms整体就是数秒。长上下文成本1M token 上下文如果输出慢实时性直接归零。端到端 wall-clockHLEHumanity Last Exam这类 2500 题基准模型再聪明跑 78 小时也等于不可用。8 月 15 日 Cerebras 与 OpenAI 公布的 Ultrafast 档正是踩中了这一痛点同样答完 HLE 全部题目Sol Ultrafast 耗时 11 小时 11 分钟而 Claude Fable 5 需要 78 小时 27 分钟——将近 7 倍差距来源Cerebras 厂商自报基准待第三方复现。云端OpenAI×Cerebras 把输出速度推到 750 token/s8 月 15 日OpenAI 与 Cerebras 宣布推出Ultrafast Mode首批面向 OpenAI API 的部分客户开放。Cerebras 公布的性能数据如下对比项Sol UltrafastOpus 4.8 FastClaude Fable 5相对输出速度Cerebras 自报1×基准约 0.20×约 0.09×描述峰值 750 token/s约慢 5×约慢 11×HLE 2500 题 wall-clock11h11m—78h27m说明上表数据来自 Cerebras 官方博客/新闻稿转述malpass.co、ai0.news属于厂商自报尚未看到第三方独立复现不同模型参数量、推理硬件不同不能简单等价于「模型质量排名」。图1云端大模型推理速度倍率对比。Sol Ultrafast 以 Cerebras 厂商自报为基准横评模型与硬件不同仅对比速度量级。对开发者而言Ultrafast 的意义不是「替代思考型模型」而是把已验证质量的高能力模型加速到可交互。下面是一段示意调用字段请以 OpenAI/Cerebras 官方文档为准import openai client openai.OpenAI() stream client.chat.completions.create( modelgpt-5.6-sol, # service_tier 字段名为示意发布前请确认官方文档 service_tierultrafast, messages[{role: user, content: 用 Python 写一段并查集模板}], streamTrue, ) for chunk in stream: print(chunk.choices[0].delta.content, end)本地Qwen3.8-27B 在消费级显卡跑出约 138 token/s云端卷速度的同时本地也没有闲着。8 月 14 日阿里开源Qwen3.8-27BApache 2.0主打一个「能跑在家用显卡上」参数规模27B 稠密模型原生多模态。上下文262K 原生YaRN 可外推到 1M token。本地速度社区用户报告称在 RTX 5090 上使用 ninfer 推理引擎可达约138 token/s约为朴素 llama.cpp 的两倍来源ai0.news 转述 HN 社区实测。图2同一模型本地推理引擎优化约 2× 提速Qwen3.8-27BRTX 5090社区数据受批大小与量化影响。这里的关键不是「27B 比 700B 快」而是推理引擎优化正在把同样权重的速度天花板抬高。对需要端侧/私有部署的场景金融、医疗、代码审查这意味着本地模型的可用性从「能用」迈向「好用」。一段示意本地运行命令tag 与引擎名称请以官方为准# 示意等待官方/Ollama 等引擎上架该 tag 后即可尝试 ollama run qwen3.8:27b # 或使用 ninfer 等优化引擎 ninfer serve Qwen/Qwen3.8-27B开源侧同频GLM-5.3 与 Kog 的快信号速度战不是中美两端的故事。同一天智谱发布GLM-5.3总参数 7430 亿底座不变、后训练硬拉约 50% 性能。Terminal Bench 3.0、Agents Last Exam (CLI) 等公开基准取得开源第一来源智谱官方/界面新闻转述。完整权重将在两周内开源。同时智谱在 cvd.z.ai 用 GLM-5.3 做自动化漏洞扫描已有若干 CVE 处于 embargo 阶段。另一边法国初创公司Kog宣称在现有 MI300X/H200 硬件上实现30× 推理加速2B 小模型 demo 跑出3000 token/s来源ai0.news 转述。这一数字目前仅见单一社区源建议标记为「待独立验证」。速度战与价格战同频过去 72 小时速度和价格像双螺旋一样交替下降图32026-08-13 ~ 08-15 速度与价格相关关键节点时间线事件日期来自公开报道。几个值得留意的价格信号Gemini 3.7 Flash8/13API 价格直接减半同时 FrontierCode 1.1 Main 从 34.4% 提升到 43.6%。DeepSeek V4 Pro8/14硅基流动平台缓存命中后低至$0.44 / 百万 token配合 1M 上下文对长文档 Agent 极具吸引力。Qwen3.8-27B8/14Apache 2.0 开源免费可商用把消费级部署成本打到「电费级」。OpenAI×Cerebras Ultrafast8/15按 Cerebras 说法「不牺牲质量」即用同等质量换 wall-clock。当「更快」和「更便宜」同时发生时企业采购模型时的单一 benchmark 决策模型就会失效。选型建议速度、成本、质量三角面对这一波变局建议把选型拆成四步过滤任务契约如果是单次创意写作首 token 延迟 2s 也能接受如果是代码补全或 Agent 多轮200ms 就卡手。端到端成本不要只看 $/M token要乘实际输出长度和并发量。缓存命中价如 DeepSeek $0.44对长上下文往往是决定性因素。可控性/合规医疗、金融、政企客户优先考虑本地/私有部署Qwen/GLM 开源权重。速度天花板高并发场景关注服务商的峰值吞吐如 Cerebras Ultrafast 750 token/s本地场景关注引擎优化ninfer/llama.cpp/vLLM 的差距可达 2× 以上。一句话先锁任务再算成本最后才是 benchmark 分数。诚实的局限本文的数据全部来自公开报道与社区转述主要限制包括Cerebras 的 750 token/s、11×/5× 倍率、HLE 11h11m 均属于厂商自报尚未检索到第三方独立复现。Qwen3.8-27B 的 138 token/s 是社区实测受批大小、量化精度、驱动版本影响较大。Kog 的 30× 加速与 3000 token/s 目前仅见 ai0.news 单一转述建议等官方技术报告或独立评测。速度提升不等于体验提升ai0.news 同日报道指出部分开发者认为 Claude Opus 5 虽然更快但存在「不确认假设、输出风格怪异」等问题已回退到 4.7/4.8。价格为厂商披露口径含税、配额、peak/off-peak 策略可能差异巨大。参考与事实来源malpass.co:Top AI Stories - August 15, 2026Cerebras Ultrafast、Gemini 3.7 Flash、DeepSeek Harness、Mistral OCR 4.1、Google HEIR。ai0.news:AI News - August 15, 2026Qwen3.8-27B 138 tok/s、GLM-5.3、Opus 5 反馈、Kog 30× 宣称、Apple-Alibaba 中国模型。aistart.ai:AI NewsOpenAI 400 亿美元年化营收、Anthropic 多 Agent 冲突实验、Google 水印设置。163.com / 界面新闻 / 央广网 / 今日头条Qwen3.8-27B 开源、GLM-5.3 发布、DeepSeek V4 Pro 上线、华强北 AI 眼镜销量。环球网 / 国家超算互联网DeepSeek V4 Pro 与 DeepSeek Harness 上线。
返回列表