
据报道9月11日前后Codex负责人Tibo发帖宣布GPT-5.3-Codex-Spark 下周退役。这个模型今年2月12日上线128k上下文每秒能出1000个以上Token有报道说测得1200是OpenAI第一个不跑在英伟达技术栈上的生产模型。从发布到下线前后7个月。给的理由很直接用量一直在往下掉手上已经有明显更好的模型了。它当年为什么快又为什么活不长先看它上线时的排场这是OpenAI第一个专为实时编程设计的模型官方称客户端与服务器往返开销降了80%、每Token处理开销降了30%、首Token延迟砍掉一半代码不再一行一行蹦整块整块往外倾倒。更关键的是硬件——底层算力来自Cerebras的晶圆级芯片 WSE-3它标志着那份750兆瓦算力大单交出了第一份答卷。但快是有代价的。业内复盘的核心结论是一块晶圆装不下旗舰模型Spark本质是为了极致速度妥协出来的蒸馏版小模型。拿数据说话据报道Terminal-Bench 2.0Spark 58.4%完整版 GPT-5.3-Codex 是 77.3%。SWE-Bench Pro 曲线Spark 能把任务时长压在1到2分钟但准确率停在47%到51%完整版从3分钟起步就是51%9分钟56%16分钟57%。也就是说省下的那几分钟换来的是往下掉五六个点。宣传里的15倍提速也被扒过——发布第二天就有开发者指出那是拿Spark去比开满最高推理强度的完整版模型在同等准确率下Spark其实只快了约1.37倍。实际编码场景里凭空捏造API端点、JSON格式不稳定、多步任务跑偏的问题被放得更大。真正判它死刑的是旗舰本尊下场8月13日Cerebras发布 Ultrafast 模式。这一次跑在晶圆上的不再是缩水版而是旗舰模型GPT-5.6 Sol 本尊把大模型按层切分、铺在多台节点上做流水线在保证与标准版同等智能的前提下飙到每秒750个Token。官方对比称同一组任务标准档平均要跑7.7分钟Ultrafast 端到端只要83秒快了约5.6倍质量几乎没有差别。这一下Spark 存在的意义就没了——它当初的设计初衷就是拿智能换速度而半年后同一批晶圆上已经能跑完整旗舰速度只慢四分之一能力一分没少。晶圆产能有限缩小版和排队疯抢的旗舰版抢同一批产能时谁该腾地方不用多想。变的是什么没变的是什么变的是定位。“快正在从一个独立的专用模型”变成旗舰模型的一个付费档位。就像推理强度分 Light 到 Max 一样速度也从 Standard、Priority 排到了 Ultrafast跟算力挂钩、按档收费。以后比的不是谁能做出最快的阉割版而是谁能把最强的模型跑出最极限的速度。没变的是规律。API从来不是固定资产。过去三个月OpenAI的模型库经历了一轮密集退役6月2日 GPT-5.2 和 GPT-5.3-Codex 退役8月31日 GPT-5.4 与 5.4 Mini 退役、用户整体迁移到5.6世代9月11日轮到 SparkCodex 产品线也换成了 Sol太阳、Terra大地、Luna月亮、Astra星辰这套新命名。旧名字几乎成了遗迹。对普通开发者这几点是真教训别把业务绑死在单一模型、单一档位上。今年2月还是未来的东西9月就退役了。工程上留一层抽象/路由把模型名、采样参数、额度策略都收到配置里真要迁移时改配置而不是改代码。速度本身不是产出。花17分钟等一个能跑通的代码通常比花2分钟拿一堆Bug划算。验收标准要盯一次通过率不是首Token有多快。比速度前先对齐条件。官方宣传的倍数往往拿最高推理强度的对手做分母。自己压测时至少固定模型版本、推理强度、提示词和任务集不然数字没法用。留意附带配额这类隐性成本。这次不少开发者惋惜的其实不是模型本身而是它自带的独立配额——在主套餐额度紧张时能当备用油箱。说白了他们想留的是成本结构不是那个模型。迁移清单确认调用点 → 找出写死的模型名 → 用相同任务集在替代模型上复测通过率与延迟 → 灰度切换 → 保留回滚。有培训机构对这类模型的总结挺到位“没有智能的速度只是更快地失败。”收尾Spark 的7个月更像一次探路它证明了晶圆级芯片能扛住生成式AI的生产级流量、推理任务也能脱离英伟达生态跑。探路结束大部队进驻探路者自然退场。对做应用的人来说真正值钱的不是追上最新的模型而是让自己的代码对模型更换这件事不敏感。你手上还有在用、但已经没人维护的老模型吗迁移起来最卡的是哪一环评论区聊聊。本文事实依据据新智元2026年9月13日报道以及Cerebras、OpenAI公开信息综合整理模型与产品仍可能快速迭代。