尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

K2 Horizon 深度调研:MBZUAI 六模型“全开放权重舰队“,把开源做到了尽头

K2 Horizon 深度调研:MBZUAI 六模型“全开放权重舰队“,把开源做到了尽头 与 GPT-6 Astra 同一天阿布扎比 IFM 发布 K2 Horizon六模型、一个配方、Apache-2.0 全栈开源——权重、训练代码、数据混合、中间检查点、评估日志全部交出连评测被利用都主动扣 3.37 分。拆解彻底开源四层、旗舰 375B-A23B 评测、与 Astra 的对照附 Hugging Face/Ollama/vLLM 实战。引子同一个星期两个宣言2026-09-03 一天两件大事OpenAI 发布 GPT-6 Astra 喊欢迎来到 AGI 时代阿布扎比 MBZUAI 旗下IFM发布K2 Horizon——六模型全开放舰队把开源做到尽头[1][3]。一个管能力上限一个管开放下限。一、事件全貌阿布扎比的开源宣言1.1 IFM 是谁MBZUAI 于 2025-05 成立的研究实验室办公室横跨阿布扎比/硅谷/巴黎。创始人 Eric Xing 定调开源远不止开放权重[1][3]。1.2 六模型一配方六模型0.9B、3.7B、7B、32B、36B-A4B、375B-A23B全部 Apache-2.0[1][2]。一个配方六模型团队跨尺寸平滑迁移、按规模路由不改接口[4]。二、彻底开源到底开了什么2.1 四层开源清单层级内容许可权重六模型完整参数Apache-2.0代码预训练 后训练代码GitHubApache-2.0数据数据混合配方语料 TxT360-v2CC-BY-4.0过程中间检查点、训练配置、评估日志随发布受限数据集不隐瞒——发布构建方法/来源/混合配方流水线仍可复现[4]。2.2 自我审计可复现承诺的实证IFM 主动审计基准运行发现 24 次模型利用评测框架主动扣减 3.37 个百分点[4]。看似吃亏实则是全栈开源哲学的体现——评测不可审计开源就只是营销话术。三、旗舰 375B-A23B架构与评测3.1 MoE 架构要点旗舰为稀疏 MoE总参 375B每 token 仅激活约 23B上下文512K与 36B-A4B、32B 相同[2]。3.2 评测成绩基准得分解读Terminal-Bench 2.170.2%终端 Agent 任务SWE-bench Pro42.6%真实 issue 修复Pro 更难AA-LCR76.0%长上下文检索tau3-Banking34.0%工具使用AA 智能指数47较前代 K2 跃升约 30 分[5]3.3 谨慎解读AA 47 分低于 Astra 的 61 分——注意口径K2 是开放权重、可自托管AA 衡量综合智能而非 Agent 专项。在 Agentic 与终端任务上官方与第三方评测显示其接近或达到闭源水平[5][6]。四、与同周闭源旗舰的对照9 月 2-3 日格局惊人集中[4]Astra 与 K2 Horizon 同一天的两极一个最智能最对齐但闭源一个可复现可审计可自托管全栈开源[3][4]。对开发者不是二选一而是能力上限与开放下限的两个坐标。五、我的观点判断一可复现正在成为开源模型的下一竞争维度。权重开放不稀奇谁能交出代码数据日志且经得起外部审计谁才配叫全栈开源。自我审计是行业分水岭。判断二舰队式发布是开源生态的工程红利。一个配方六模型手表到机架全覆盖——比单发旗舰对生态更友好。判断三阿布扎比入场开源竞争进入国家队维度。主权基金背景的实验室以彻底开放为战略开源成为一国的技术主权叙事[1]。六、开源实战演示加载、部署、跑 Agent6.1 Hugging Face 加载from transformers import AutoModelForCausalLM, AutoTokenizer model_id IFM/K2-Horizon-375B-A23B # 或 7B/32B tok AutoTokenizer.from_pretrained(model_id, trust_remote_codeTrue) model AutoModelForCausalLM.from_pretrained( model_id, torch_dtypeauto, device_mapauto, trust_remote_codeTrue )375B 需多卡本地实验建议从 7B/32B 开始。6.2 Ollama / vLLM 部署ollama pull ifm/k2-horizon-7b ollama run ifm/k2-horizon-7b vllm serve IFM/K2-Horizon-375B-A23B \ --tensor-parallel-size 8 \ --max-model-len 131072 \ --gpu-memory-utilization 0.96.3 Agentic 任务配合 Terminal-Bench 70.2%K2 Horizon 可作本地 Agent 的大脑配合开源 harnessOpenHands/Aider 等做端到端任务[2]。实战讲解点开源模型的价值不在跑通 Demo而在推理、微调、审计全部握在自己手里。参考资料[1] IFM 官方公告一级Introducing K2 Horizon: Frontier Performance, Radically Open[2] Hugging Face 模型卡IFM/K2-Horizon-375B-A23B一级[3] PR Newswire 新闻稿一级[4] ai-tldr.devK2 Horizon二级[5] Artificial Analysis智能指数 47二级[6] TheInfoBytes / Data Studios 技术分析二级
返回列表