
仓库修复比单题编程麻烦得多。模型要读 issue 和报错日志在目录里找到相关文件理解函数之间的调用关系写完补丁还要跑测试。任何一步偏离目标后面的操作都会跟着出错。MiniCPM5-2B 在 SWE-bench Verified 上修复了 46.4% 的测试样本。数学也很能打。AIME 2025 和 AIME 2026 都是86.5Qwen3.5-4B 分别为 78.8 和 82.7。长文本任务 NoLiMa 上两者是68.1对43.5工具调用BFCL v4 是 66.6 对 56.8。OpenBMB 对搜索和多步执行投入的训练资源也反映在 BrowseComp-ZH 与 GAIA Text-103 的领先成绩上。代码能不能运行数学题有没有算对函数参数是否合规搜索结果能否找到来源都有明确的检查办法。OpenBMB 用这类数据训练小模型RL 可以拿到稳定的奖励信号。2B 容量有限清楚地判断每一步对错比堆入更多普通文本管用。PART 02模型基础配置MiniCPM5-2B 采用 42 层 Transformer总参数约 25.17 亿其中非词嵌入参数约 19.82 亿原生上下文长度为 131072。OpenBMB 沿用 LlamaForCausalLM 接口主流推理框架可以按熟悉的方式加载模型。注意力部分用了 GQA16 个查询头共享 2 个键值头。查询头保留表达空间两个键值头则减少长文本推理需要保存的 KV Cache。131K 上下文会快速消耗显存OpenBMB 用这项配置换取更长的输入和更高的并发。OpenBMB 用42 层维持网络深度用较少的非词嵌入参数控制主要计算量再用 GQA 压低长上下文的缓存开销。用户在电脑上运行模型时内存占用和解码速度比下载包大小更影响体验。PART 03这 2B 是怎么练出来的MiniCPM5-2B 沿用常见的网络结构OpenBMB 主要靠数据和后训练拉开差距。团队把训练分成基础训练、中期训练和后训练每个阶段使用不同的数据配方。OpenBMB 还开放了 UltraX、UltraData-Code、UltraData-SFT-Agent-2609 和 UltraData-RL-2609其中 Agent SFT 数据约 50 万条RL 数据超过 8 万条。训练前段先建立语言能力中期加入代码与数学进入后训练后团队集中补推理、长文本和行动能力。OpenBMB 也按质量给数据分层。团队越靠近后训练越偏向能够核对答案的样本。2B 模型容量有限低质量 token 会挤占高价值知识的位置。OpenBMB从 L0 原始资源开始经过清洗、去重和质量判断把数据送入可以训练的层级。最高一层强调答案可验证和知识可组织。代码要通过测试数学题要能核对结果工具调用要符合格式。小模型借助这些信号学习任务边界RL 训练也能得到清晰反馈。后训练花的力气更大。OpenBMB 先用 400B token 的深度思考 SFT 数据训练模型再分别训练数学、代码、Agent 和写作等 RL 专家最后通过 On-Policy Distillation 将 16 个专家合进一个发布模型其中有 5 个 Agent 专家。OpenBMB 的消融结果显示RL 加 OPD 让推理与通用能力平均增加 10.96 分Agent 能力平均增加 6.96 分。OPD 训练时多个专家先在各自擅长的任务里给出策略学生模型沿着自己会遇到的状态学习训练数据也随学生的行为变化。团队借此把数学、代码与 Agent 专家的经验装回同一个 2B 模型。产品上线后只需维护一个模型调用链也会缩短。固定答案蒸馏常会遗漏学生模型自己的错误路径。学生一旦走到教师数据没有覆盖的位置后续动作就容易失控。On-Policy 的做法让专家围绕学生当前生成的轨迹提供反馈训练可以碰到更多真实失误。Agent 需要连续调用工具这种差别会积累到整条任务链上。高质量数据提高了参数利用率专项 RL 集中训练代码和数学OPD 再收拢多位专家的经验。OpenBMB 用这套训练流程缩小参数差距MiniCPM5-2B 才能在多项测试中压过 4B 模型。PART 04MiniCPM 系列一直在抠端侧效率OpenBMB 在 MiniCPM4 中公开过端侧架构 InfLLM v2。系统先把 KV Cache 切成块用语义核计算相关性并选出 Top-k再让注意力集中到相关块、开头块和局部窗口。这套方法减少了长上下文计算。OpenBMB 的实验把注意力稀疏度推到 81%长文本能力仍接近全注意力版本预填充和解码也能共用这套机制。InfLLM v2 把筛选分成两步。语义核先给各个缓存块算相关度系统只保留与当前查询相关的候选块注意力模块再处理候选块和附近窗口。模型无需在每个 token 上回看全部历史内容长文档带来的计算量和缓存读取随之下降。OpenBMB 还为同一代模型开发了UltraClean、UltraChat v2、ModelTunnel v2 和 CPM.cu。前两项处理训练数据ModelTunnel v2 先在小模型上寻找训练策略CPM.cu 把稀疏注意力、量化与投机采样放进推理系统。团队训练 MiniCPM4-8B 时只用了约为 Qwen3-8B 22% 的预训练 token综合成绩已经接近。到了 MiniCPM5-2BOpenBMB 继续把模型、数据、训练和推理放在一起算账。团队逐层寻找可省下的算力比较不同数据的训练收益再决定要把哪些专家能力蒸馏回小模型。这些选择直接影响模型速度和评测成绩。PART 05先把它放进代码编辑器OpenBMB 让 MiniCPM5-2B 兼容 LlamaForCausalLM主流推理框架可以直接加载。团队提供 BF16、GGUF、MLX 4bit、GPTQ 4bit 和 LiteRT 等版本覆盖 vLLM、SGLang、llama.cpp、Ollama、LM Studio 与 Apple Silicon另有 DSpark 草稿模型用于投机解码。SGLang 的 minicpm5 解析器还能把 XML 风格的工具调用转成 OpenAI 兼容的 tool_calls。只计算模型权重BF16 大约需要 5GB4bit 原始权重约 1.3GB实际运行还要给 KV Cache、激活值和推理框架留空间。相比 4B 模型普通笔记本更容易常驻一个量化版本边缘服务器也能用同样的显存处理更多并发。我会先拿它做本地代码助手。它的代码分数够高2B 体量也方便放进开发机或企业内网。代码解释、局部修改、测试生成和命令调用都可以在源码留在本地的情况下完成。接入工作流以后多文件修改和失败重试比榜单分数更能决定它能不能留下。编辑器可以把当前文件、报错日志和仓库索引交给模型模型生成补丁再调用测试命令确认结果。2B 版本占用的资源较少开发者不用为每次提问等待云端请求尚未公开的代码也能留在公司网络里。BFCL 和 BrowseComp-ZH 的成绩还给了工具型 Agent 一个机会。模型可以判断何时调用搜索、数据库或业务接口再整理返回结果。它不用把全部知识记在参数里2B 的运行成本更容易换来低延迟、常驻内存和离线可用。对许多端侧产品这些体验比聊天时多背几条百科知识更实在。PART 064B 依然守住了几块阵地把 53.9 拆开看MiniCPM5-2B 也输掉了几项。HMMT Feb 2026 上它的 63.8 略低于 Qwen3.5-4B 的 64.0MATH-500 是94.6 对 99.0。IFEval、MMLU-Pro、MMLU-Redux 和 GPQA-Diamond 等指令遵循与通识项目也有更大模型排在前面。差距最大的两项出现在高难度软件工程。SWE-bench Pro 上MiniCPM5-2B 得到 14.4Qwen3.5-4B 是28.2Terminal-Bench v2.1 则是 8.6对 25.8。任务一旦拉长到更完整的工程环境模型容量带来的优势仍然明显。Verified 主要观察模型能否修复真实 issuePro 和 Terminal-Bench 要求模型完成更长的操作链并理解更完整的工程环境。MiniCPM5-2B 已经会写代码和修改仓库遇到需要持续规划与多轮操作的任务稳定性还没追上 4B。53.9 很抢眼但它没有抹平参数差距。MiniCPM5-2B 偏科明显代码、搜索和工具调用是长板知识、指令遵循和高难度工程操作4B 仍占优势。做本地代码辅助或搜索 Agent可以优先试 MiniCPM5-2B。任务涉及长时间终端操作时4B 更稳。PART 072B 终于能认真谈产品了过去的端侧小模型常常停在“能跑起来”模型可以启动遇到复杂任务却很快露怯。MiniCPM5-2B 把代码和 Agent 分数拉高了一个档位OpenBMB 又提供了常见的量化格式。产品团队可以把它列入本地代码助手和工具调度器的选型。25 亿参数降低了内存压力和加载时间OpenBMB 又用数据配方与专家蒸馏补回能力。电脑和边缘服务器可以用它做常驻代码助手部分移动设备也有部署空间。高难度工程任务还会难住它但这个 2B 模型已经值得进入产品选型表。PART 08模型下载OpenCSG社区https://opencsg.com/models/OpenBMB/MiniCPM5-2BHugging Face社区https://huggingface.co/openbmb/MiniCPM5-2BPART 09OpenCSG vs 魔搭如何选择模型部署在魔搭、OpenCSG 等模型社区中均可实现但 OpenCSG/CSGHub 的核心在于它不只是让模型跑起来而是进一步支持企业把模型、数据集、代码和应用等 AI 资产放到本地、内网或离线环境中统一管理。它解决的不只是模型怎么部署、怎么调用的问题更是模型进入企业后如何被安全管理、版本沉淀、权限控制和持续运营的问题。对于企业来说CSGHub 可以帮助构建自己的私有模型资产中心降低对外部平台的依赖对于个人开发者来说也可以用更系统的方式管理模型、实验项目和 AI 应用流程。相比更偏向模型发现、体验和使用入口的魔搭CSGHub 更适合那些希望把 AI 能力真正沉淀下来并长期维护、持续迭代的用户。PART 10关于 OpenCSGOpenCSG 是全球领先的开源大模型社区平台致力于打造开放、协同、可持续生态AgenticOps 是人工智能领域的一种 AI 原生方法论由 OpenCSG开放传神提出。AgenticOps是 Agentic AI 的最佳落地实践也是方法论。核心产品 CSGHub 提供模型、数据集、代码与 AI 应用的一站式托管、协作与共享服务具备业界领先的模型资产管理能力支持多角色协同和高效复用。