尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

大模型是什么?讲透 Token、上下文窗口、Temperature 和 MoE

大模型是什么?讲透 Token、上下文窗口、Temperature 和 MoE 大家好我是晚安code。假设一个场景这个模型说支持 100 万上下文那我是不是可以把整个项目代码都丢进去看了眼账单没说话。所以我打算把大模型是什么这件事从头到尾讲一遍一个名词都不跳过。这篇就把话说白大模型到底是什么Token、上下文窗口、Temperature、MoE 各自管什么Chat 模型和基座模型差在哪普通对话和深度思考怎么选网页端和 API 该用哪个。看完你至少能自己判断一个模型值不值得用。点个收藏咱们开始。一、大模型到底是个什么东西先说结论大模型就是一台下一个 Token 预测机。它做的事非常朴素——给你一串文本猜下一个 Token 最可能是什么。听着像废话对吧我一开始也这么想。但你要让这个猜测足够准模型就必须在内部把语法、事实、逻辑关系、代码结构这些东西全部编码进去。就像输入法联想你打今天天气它猜不错这背后只统计了几个词的关系大模型的联想窗口开到了几万亿参数的尺度今天天气后面接着猜的可能是段能跑的代码。拆开看一个模型由三样东西决定参数权重训练学出来的数值规模从几 B 到几 T 不等这是大字的来源架构现在基本都是 Transformer 及其变体决定了参数怎么连、信息怎么流训练数据喂进去的文本量与质量决定了它知道什么、不知道什么。预训练阶段的目标函数简单到只有一行最大化下一个 Token 的预测概率。剩下那些会写代码“能翻译”懂比喻的能力是数据量堆到一定程度后自己长出来的业内管这叫涌现。所以别把大模型想成一本科教书它更像一个把海量文本压缩进参数里的概率函数。理解这一句后面四个概念就都顺了。二、Token 与上下文窗口它一次能看见多少Token词元大模型处理文本的最小单位模型不按字算按 Token 算。你可以理解为模型眼里的积木块——中文一个汉字大约 12 个 Token英文一个单词大约 13 个 Token。这个单位为什么重要因为它同时是计费单位和容量单位。我第一次认真看 API 账单的时候才反应过来我按字算费用人家按 Token 算中文因为分词方式的缘故同样一段话的 Token 数经常比我想的多。上下文窗口Context Window模型单次请求能看见的 Token 总数上限包含你输入的提示词和模型生成的回复。你可以把它理解成一张工作台所有材料都得摊在这张桌子上桌子放不下的内容模型是真看不见。这里有个特别容易踩的误区上下文窗口不是硬盘是桌面。我见过不少人以为开 100 万 Token 就等于有了 100 万 Token 的记忆于是把整个仓库的代码一次性塞进去。实际会发生三件事推理成本按 Token 线性上涨输入越长单次请求越贵KV Cache 吃掉大量显存并发能力直线下降长请求排队是常态注意力被稀释材料越多模型越容易抓不住重点中间位置的内容尤其容易被忽略。所以长窗口的正确用法是该放的才放——检索出来的相关片段、当前任务的上下文而不是无脑全量投喂。可能有人会问那我是不是该无脑选上下文最长的那个模型不一定。先看你任务的真实长度日常写代码、做问答128K 大多用不满。长窗口更适合读整本书、审一整个仓库这种场景而且用之前最好实测一下它在长输入下的召回表现厂商标的是最大支持不是质量保证。三、Temperature同一个问题为什么每次回答都不一样大模型的输出不是查表是采样。每次生成一个 Token模型会先算出一整套概率分布再从里面挑一个——Temperature 就是控制这个挑有多随机的旋钮。Temperature温度控制模型输出随机性的采样参数值越低输出越确定、越可复现值越高输出越发散、越有意外。你可以理解为做菜的火候——小火慢炖出稳定的味道大火爆炒出来的东西每次都不一样。判断句放这儿Temperature 不是聪明度旋钮它调的是随机性调高不会让它变聪明只会让它更敢瞎说。我踩过的坑很典型有一次让模型从一段日志里抽结构化字段怎么改提示词都不稳定时而多一个字段时而少一个。后来才发现默认温度在那摆着把它压到 0 附近输出立刻老实了。这是我一般会用的取值仅供参考场景建议温度原因代码补全、信息抽取、分类00.3要的是可复现容不得自由发挥日常问答、翻译、总结0.50.7稳定为主留一点自然表达空间起名、头脑风暴、文案发散0.91.2要的就是多样性撞出意外组合不过要提醒一句温度不是唯一变量。同一温度下换个模型、换个提示词模板、甚至只是重跑一次输出不一样都很正常。四、MoE为什么 2.8 万亿参数的模型还跑得起这两年国产模型的参数一个个往万亿上冲但 API 价格反而在跌。矛盾吗不矛盾因为总参数不等于每次推理要算的参数。MoEMixture of Experts混合专家把一个大模型拆成很多个并行的子网络专家每次处理一个 Token 时由路由网络只挑其中一小部分专家来算。你可以理解为一家综合医院——院里几十个科室你感冒了只挂呼吸科不用把全院医生都叫来会诊。和传统稠密模型对比一下就很清楚维度稠密模型MoE 模型每次推理要算的参数全部参数只有被激活的少数专家显存占用相对低参数少高总参数都得装下同等算力下可扩展的上限受算力限制明显更高推理延迟稳定路由有额外开销但总计算量小这里有个特别常见的误读看到2.8 万亿参数就以为跑一次要烧掉 2.8 万亿参数的算力。不是的真正决定推理成本的是每次激活的那部分参数。再补一个我自己的观察MoE 让参数竞赛变得没那么直接可比了。厂商发布会报总参数工程师该看的是激活参数——两个总参一样的模型激活参数量可能差一个数量级成本和速度完全不是一回事。五、Chat 模型不等于更聪明的基座模型判断句Chat 模型不是基座模型的升级版它是基座模型被规训之后的样子。基座模型Base Model只做过预训练、目标就是续写下一个 Token 的模型。它知识量大但不会回答问题——你问它北京在哪它可能接着给你编出十个类似的问题因为在它眼里你只是给了它一段待续写的文本。Chat 模型在基座之上做过指令微调和对齐的模型能听懂请帮我做某事这类指令并按助手的口吻回答。你可以理解为同一个人的两种状态——一个是满腹经纶但不看场合的学者一个是受过职业训练的客服。从基座到 Chat中间大致走三步SFT指令微调用大量指令—回答样本教它对话格式偏好对齐用人类偏好数据RLHF、DPO 之类让它学会哪些回答更好、哪些不能说安全与风格收尾加上拒答边界、语气规范、格式习惯。对齐换来了听得懂人话代价是别的原始知识密度会被话术稀释输出多样性下降模型也更倾向于给出四平八稳的答案。做领域微调的朋友尤其要注意——你要的是把新知识灌进去还是把回答风格调成助手腔这决定了你选基座还是选 Chat 版。这不是一个哪个更好的问题是哪个更合你的事。六、普通对话和深度思考差在哪先说结论两者的区别不在谁更聪明而在要不要给模型发一张草稿纸。普通对话Fast / 非思考模式模型直接开始生成答案每个 Token 都是最终输出的一部分。你可以理解为脱口而出的回答。深度思考Thinking / 推理模式模型先输出一段内部推理过程想完了再给结论。这段过程有时直接展示给你有时被折叠起来但只要它产生了就一样计费。深度思考现在大致有这么几种控制方式深度也分档开关式一个按钮思考开或关最粗放强度分档像reasoning_effort这类参数可以设 low / high / max本质是给推理过程留多少 Token 预算自动路由由平台判断简单问题直接答、复杂问题才把思考拉起来。同一个问题两种模式的差别集中在四件事上维度普通对话深度思考首字延迟快几乎立刻出字明显变慢等几秒到几十秒Token 消耗只算答案推理过程也计费常常翻几倍稳定性直接但可能漏步骤多步任务正确率更高出错方式答得浅可能想歪推理链越长越容易跑偏至于什么时候该用我的判断标准是看任务有没有中间步骤场景建议原因数学题、算法题、多步逻辑用中等强度起步收益最明显复杂代码调试、架构权衡用需要连贯的因果链信息抽取、格式转换别用规则明确想多了反而出错RAG 检索问答、摘要、翻译别用答案在材料里靠归纳不靠推理闲聊、简单改写别用纯烧钱RAG检索增强生成的思路是先从知识库捞出相关片段再让模型基于这些片段作答。它的核心工作是读懂材料、说清楚链式推理帮不上忙还会拖慢响应、推高成本更麻烦的是推理链拉长之后模型有可能偏离检索到的原文开始自己编。我踩过一个挺有意思的坑有次让它算个两位数乘法顺手开了最高档思考结果它绕了一大圈还差点算错。思考强度是预算不是保险。七、网页端 AI 和 API 调用买的不是同一个东西判断句网页端和 API 背后往往是同一个模型但你买到的东西完全不是一回事。网页端是成品API 是零件——这个差别决定了它俩各自适合什么活。维度网页端API 调用计费订阅或免费聊多少不影响钱包按 Token 计费输入输出都算钱参数控制基本没有Temperature 被藏起来了温度、思考强度、最大长度都能自己设系统提示词平台写死的你改不了完全由你掌控上下文平台可能自动截断历史传多少是你的事费用也归你附加能力自带联网、文件解析、画图、记忆裸模型检索和工具得自己接数据流向是否用于训练看平台条款企业版通常可约定不用于训练自动化手动点可批量、可嵌进产品、可进 CI我第一次把网页端用得很顺的提示词搬到 API 上效果掉了一截排查半天才反应过来网页端的系统提示词里早就替我写好了一堆约束API 那边是白纸一张什么都得自己填。所以怎么选很清楚偶尔用用、试效果、做调研网页端更省事要进生产、要批量跑、要可复现、要私有化只能走 API。API 给你的不是更强的模型是更多的控制权和更多的责任——费用、并发、提示词、数据合规全都得自己扛。八、2026 年国产主流大模型举例截至 2026 年 10 月国内第一梯队的旗舰基本形成了共识打法MoE 架构 长上下文 开源权重。下面这张表是我整理的主流型号具体参数以各家官方文档为准。模型厂商架构与参数上下文备注DeepSeek V4 系列深度求索MoEPro 版 1.6T 总参 / 49B 激活1MMIT 开源2026-09 更新 V4.1 FlashKimi K3月之暗面MoE2.8T 总参1M权重已开源Qwen3.8 系列阿里MoEMax 级约 2.4T 级参数长上下文多榜国产第一梯队GLM-5.3 系列智谱MoEFlash 版约 320B 总参 / 18B 激活1M原生多模态混元 Hy3 preview腾讯MoE295B 总参 / 21B 激活256K已开源LongCat-2.0美团MoE1.6T 总参 / 48B 激活1M国产算力训练说几个具体感受**长上下文已经是标配。**1M 这个词在 2026 年出现得越来越频繁DeepSeek、Kimi、GLM 这几家都把百万级写进了宣传口径腾讯混元 Hy3 和讯飞星火 X2-Flash 则停在 256K 一档。但如第二节所说标称值和使用质量是两回事上生产前自己压测一轮最稳。MoE 是默认选项。上面这几家无一例外全部是稀疏架构激活参数普遍落在几十 B 的量级。这也意味着参数量这个指标越来越不适合拿来横向比强弱。**开源是真开源。**DeepSeek 走 MITKimi、GLM、混元都把权重放了出来这对想私有化部署的团队是实打实的好事——至少你可以先下载下来跑通再说。回到开头那个问题。大模型是什么说到底它是一台用海量文本练出来的下一个 Token 预测机Token、上下文窗口、Temperature、MoE 这些名词描述的都是这台机器的某个零件怎么转。搞懂零件的代价并不高但回报很直接——你不再需要听别人替你判断。以 2026 年 10 月这个时间点看选国产模型我建议先看激活参数和单价再看上下文和榜单排名。总参数最唬人也最不能用来横向比。参考链接DeepSeek V4 预览版发布公告搜DeepSeek V4 previewDeepSeek V4.1 Flash 发布说明Kimi K3 快速开始文档搜Kimi API 平台 文档腾讯混元 Hy3 preview 发布报道美团 LongCat-2.0 发布报道智谱 GLM 全栈体系研报摘要我是晚安code持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊搞懂大模型是什么这件事上你被哪个名词绕得最久
返回列表