
1. 提示词工程到底是什么为什么大家都在谈它我接触提示词工程的时间不算短最早还是在GPT-3时代那时候大家管这个叫“咒语”因为确实像在念咒——同一个问题换个问法出来的效果天差地别。后来模型越来越大提示词反而越来越重要已经成了大语言模型使用中绕不开的核心技能。所谓的提示词工程简单说就是通过设计输入给大模型的文本引导模型输出期望结果的一套方法。它不是写作文更像是在训练一只非常聪明但偶尔犯糊涂的“实习生”——你得把需求交代清楚把边界划出来把例句给到位这实习生才能交出像样的活儿。很多人误以为提示词工程就是“礼貌一点跟AI说话”比如加个“请”“谢谢”其实不是这么回事。从技术底层看大语言模型是根据海量语料训练出来的概率模型它生成下一个词时会从所有可能的分布里挑一个。提示词的作用本质上是把模型在生成时可能走的路径收窄你强调某个角色它就进入某个领域的语境你给了示例它就在示例的格式和内容分布里去生成你要求分步骤它的注意力就落在推理链条上。理解了这一点你会明白提示词工程的核心不是“讨好AI”而是“约束概率空间”。这套技能用在哪里写周报、做PPT大纲、提炼会议纪要、写代码、做数据分析、读论文、文案创作几乎任何你使用大模型的场景都能用上。尤其是那些对输出格式和稳定性要求高的场景比如批量生成结构化数据、自动化pipeline里嵌模型推理没有一套像样的提示词你根本没法保证每次返回的结果格式统一。这篇文章里我把自己实际用过多次、反馈稳定的十个技巧整理出来每一个都配了可复制的模板片段。这些技巧从最简单的角色设定到稍微进阶的任务拆分都有覆盖适合的人群很宽——如果你刚开始接触提示词工程可以直接“抄作业”如果你已经写过几百条提示词我相信里面还是有几条能给你一些新的启发。2. 先搞懂大模型的“脾气”才知道提示词该往哪个方向写2.1 模型的底层机制决定了提示词的价值我见过太多人抱怨“AI不够聪明”实际上多数情况是提示词没把路铺好。大语言模型不是一个真正“理解”语义的推理引擎它更像一个通过海量输入来预测下一个词的概率系统。你可以把它类比成一个看过无数本书、知识量惊人但有点“顺着你说”的对话者——你给的上下文里有暗示它就朝暗示的方向走你的问题模棱两可它的回答也会模棱两可。这就带来一个关键推论模型没有“常识性提问”的补偿机制。人跟人之间交流你说得含糊了对方会追问但大模型默认不会追着你问“你的需求到底是什么”它会直接在模糊地带里选一个最可能的方向去生成内容。所以提示词工程的第一性原理是“把每一句话都写到让模型不需要猜的程度”。2.2 三个必懂的关键参数温度、Top-p、最大长度在谈技巧之前有必要先交代三个最常用的推理参数因为它们会直接影响提示词的效果参数作用经验值temperature控制随机性值越大输出越发散创意写作0.8-1.0信息抽取0.1-0.3top_p按累计概率截断候选词与temperature共同控制多样性一般配合temperature用不要同时调太高max_tokens限制输出最大长度按需求设定注意不要太短导致回答被截断我在用提示词做信息抽取和结构化输出时temperature一般压到0.2以下否则模型偶尔会自作聪明地帮你“润色”文本而写文案、起标题这类创意任务温度会放到0.8左右让模型有更多发散空间。记住一个原则任务越“事实导向”温度越低任务越“创意导向”温度越高。2.3 上下文窗口是有限的规划要提前做大模型的上下文窗口从几年前的2048、4096发展到现在主流的32K甚至128K看着很大但经不起浪费。你把一份上万字的文档直接丢进去再问问题看起来没什么问题实际上模型要在很多token里“找重点”不但慢效果还差。提示词的编写要时刻有“token预算”的概念关键指令前置示例给得精准原文摘录控制长度。这也为后面要讲到的“模板化”思路埋了个伏笔——与其每次手动写一堆废话不如把核心框架固定下来只改变量。3. 十招掌握提示词实战技巧每一招都能直接抄3.1 技巧1角色设定法——给模型一个“人设”就成功了一半这个方法应该算是最广为人知的技巧。在提示词开头明确告诉模型“你是一位XX”这句话的作用远不止仪式感。因为大语言模型的训练数据里包含了海量特定身份人物的对话、文章和思考方式一旦你激活了某个“角色分布”模型生成的语气、用词、知识边界和思维方式都会向这个角色靠拢。拿我经常用的一个场景举例你是一位有十年经验的互联网产品经理擅长用简洁的语言拆解复杂需求。 现在请你帮我分析以下用户反馈归纳出前3个最值得优化的方向 [待分析的用户反馈内容粘贴在这里]这个提示词比我直接写“帮我分析用户反馈”收到的结果要精炼得多。原因在于“有十年经验的互联网产品经理”这个角色自带了一套术语习惯和思维方式模型在这个角色语境下生成的内容会自动过滤掉很多“学生腔”和空泛表达。实操时有两个细节值得注意一是角色描述要具体但不冗长两三句话说明职业背景、擅长领域和输出风格就够了写太多反而占token又让模型抓不住重点二是角色设定要和任务类型匹配你让它总结文档时强调“逻辑清晰、忠实原文”让它写作时强调“风格鲜明、有代入感”不要一个角色打天下。3.2 技巧2结构化输出法——用格式框住模型的思维如果问我在所有技巧里最推荐哪一个那一定是让模型按预设结构输出。大模型默认会用自然段回答但实际工作中我们往往需要的是清单、表格、JSON或Markdown结构。不给结构模板模型的输出就像脱缰的野马你永远不知道它下一段会是什么格式。举个例子我需要从一篇长文中提取关键词和摘要直接问“请帮我提取关键词”可能会得到一段话。但用结构化输出的方式请阅读以下文章并按以下格式输出 主题xxx 关键词xxxxxxxxx 一句话摘要xxx 具体建议最多3条1. xxx 2. xxx 3. xxx ---- 文章内容如下 [粘贴文章]这招的底层原理是模型在生成时会顺着你给的格式框架逐项填充内容相当于让它从一个自由的“作文模式”切换到了一个“填空题模式”。不确定性大幅下降输出稳定得多。如果是在程序里调用API推荐指定JSON格式输出然后直接解析效率会非常高。3.3 技巧3少样本提示——给几个例子胜过千言万语很多人在写提示词时拼命描述“我要什么样的结果”结果模型还是跑偏。这其实非常正常因为语言描述是有损压缩的你脑子里的“简洁风格”和模型理解出来的“简洁风格”可能差了十万八千里。解决办法其实很简单给例子。少样本提示Few-shot Prompting就是在提示词中提供几个输入-输出对让模型模仿。打比方说你教一个实习生什么是“周报”说了很多遍他都不太明白但你把上周的周报给他看一遍他马上就知道该怎么写了。模型也是这个逻辑——你的示例就相当于在约束它的输出空间。我在做文本分类时经常用这个技巧效果立竿见影判断以下用户评论的情绪是正向、负向还是中性。 示例1 评论这个产品太好用了推荐给所有朋友 情绪正向 示例2 评论物流太慢了等了一周才收到。 情绪负向 示例3 评论价格适中功能基本满足需求。 情绪中性 现在判断 评论屏幕清晰度一般但电池续航很给力。 情绪这个写法的优势在于通过两个到三个示例模型的分类准确率会大幅提升。经验是示例给两到三个就够了太多反而会干扰模型示例要覆盖典型情况尤其要包含容易混淆的边界情况。3.4 技巧4思维链提示——让模型“多想一步”再回答大语言模型在回答复杂推理问题时有时候会直接“跳步”给出结论而跳步的过程里很容易出错。这就像你让一个小学生直接算“72乘以48等于多少”而不允许列竖式他可能在脑子里随便凑一个答案。思维链Chain-of-Thought这个技巧的核心就是强制让模型把中间推理步骤写出来再给出最终答案。有个有趣的细节是学术界发现不需要复杂的提示模板哪怕只是在问题后面加一句“让我们一步一步思考”都能显著提升推理类任务的效果。我自己在实际使用中不会用这么偷懒的方式而是会明确要求模型分步骤请解决以下数学问题要求 1. 先列出题目给出的已知条件 2. 说明解题的基本思路 3. 逐步演算并标明每一步的依据 4. 最后给出结论 问题[粘贴问题]这个方法不只适用于数学题。分析用户需求、写复杂的方案、做竞品对比这些任务都适合用思维链的方式拆开。模型在输出推理步骤时其实相当于利用了一部分上下文窗口作为“临时草稿纸”它把中间结果写下来之后每一步的判断都有了依据整体准确性自然更高。3.5 技巧5让模型先提问再回答——告别“猜心思”默认情况下模型会在你给出指令之后立刻输出结果哪怕你的需求含混不清。大多数时候这会导致返工——你以为它懂了看到输出才发现它完全理解偏了。要解决这个问题不需要改变模型行为只需要在提示词里写清楚“先提问、再回答”。让人惊喜的是这个技巧的适用范围相当广。我把它用在两个场景里一是一个人做项目时自己需求还不明确让模型先问几个问题反而帮助我把需求梳理得更清楚二是写代码任务时模型先确认输入输出的具体格式、异常处理边界给出的代码基本不用改第二次。模板如下我想让你帮我写一个Python脚本具体作用是[描述大概任务]。 我目前还没有完全想清楚所有细节请你先向我提出3-5个关键问题例如输入数据的格式、希望输出的格式、是否需要处理异常情况等在得到我的回答之后再开始编写完整方案。注意这里有一个隐藏的坑有些模型的指令遵循能力不够强你在让它“先提问”后它还是直接给出了完整答案。我的处理办法是在提示词末尾再加一句“在当前阶段请只提问不要给出任何方案内容”多一层约束从实践经验来看能显著提升指令的生效概率。3.6 技巧6限定输出长度——把“废话”扼杀在摇篮里大模型的默认输出风格普遍偏长你问一个简单问题它能给你写一篇小论文。原因也很简单训练数据里那些长文往往是众包标注员精挑细选的长回答模型学会了这种“多说一点”的风格。在实际工作中这既是优点也是灾难。控制输出长度的最直接方法就是在提示词里给出明确的字数约束和条数约束请用不超过200字概括以下文章的要点要求分3点输出每点不超过2句话。有时候光说“不超过200字”模型还是不好好执行因为它没有办法在生成前就规划好整体长度它是逐词生成的。我常用的补充手段是“先规划后输出”让模型在正文前先写一个不超过50字的开头框架或者在提示词里指定“每一点不超过40字”。这种微约束比单纯说“简短一点”要可靠得多。3.7 技巧7引用原文后再处理——最大限度减少“自由发挥”大模型在处理长文本时有一个让人头疼的特点它不会老老实实地引用原文而是倾向于用“自己的话”重述。这个特点在做要点提取的时候还好但做逐字校对、关键信息摘录时就是灾难。比如你让它从合同条款里提取违约金金额它可能把“按日万分之五”改成了“按每天0.05%”意思没变但作为法律用途绝对不行。我的解法是在提示词里明确要求“先引用原文再给出解释或处理结果”请从以下合同中提取违约相关的条款。 要求 1. 先用原文原话引出相关条款不要改写 2. 再对条款进行简要解释 3. 最后列出可能的风险点指定“引用原文”这个动作本质上是通过输出格式约束了模型的生成范围——它的第一个动作变成了“复制”而非“改写”后续的生成也会围绕原文来展开。凡是涉及精确信息提取的场景我的建议是这条约束必须有。3.8 技巧8负面提示——告诉模型“不要做什么”大多数人在写提示词时只会告诉模型“你要做什么”却忽略了“不要做什么”。在训练数据里模型见过太多“说人话的、不完整的、风格各异的回答”如果你不设边界它很容易滑向你不想要的方向。负面提示的作用就是主动把这些概率压低。举个例子我让模型总结会议纪要时如果只写“请总结会议纪要提炼行动项”它可能就会用“会议室充满了热烈讨论的氛围”这种废话开场。加上负面约束后效果完全不一样请总结以下会议纪要要求 - 只输出行动计划清单不要有背景描述 - 不要使用“首先/其次/最后”这类连接词 - 不要出现主观评价只保留客观行动项 - 每条行动项用一行表述负面提示不是越多越好挑两三个最关键的负面约束加进去就够了。如果写太多“不要”模型反而会觉得无所适从因为它被禁止了太多表达路径有的模型会出现输出质量下降的情况。3.9 技巧9任务拆分法——把大任务变成流水线复杂任务直接丢给模型它容易“消化不良”上下文太长、注意力分散、分不清主次。最近我做项目时深刻体会到与其让模型一次性输出一个大而全的方案不如把它拆成几个小步骤每步单独用一次提示词。举一个实际的例子——写一份产品竞品分析报告。如果直接说“帮我写竞品分析”模型给出的内容通常是车轱辘话。我的做法是分四步第一步让模型从给定的资料中提取竞品的基本功能列表第二步让模型对每个功能做优劣势对比第三步让模型总结出差异化的机会点第四步让模型把前面的结果拼装成报告结构每一步的输出我都检查一下再进入下一步。这样做的最大好处是每个环节的问题可以被及时发现和修正不会到最后一步才发现整体结构跑偏。这也是提示词工程里少走弯路的核心策略。3.10 技巧10模板化思维——把常用的流程固定下来最后一个技巧其实是把前面九条整合起来打造一个自己专属的提示词模板库。模板化的本质是写“带变量的标准流程”就像工厂里的模具一样把不变的框架固定下来把每次要变的内容留成空位。一个标准的工作型模板长这样# Role 你是一位[填写角色] # Task 请完成以下任务[填写任务描述] # Requirements - [填写关键要求如格式、风格、长度] - 不要[填写负面约束] # Input [粘贴输入内容] # Output Format [指定输出结构]这种写法有清晰的层级和标签模型会非常容易理解指令的重点。为什么推荐用标签因为模型在训练时见过海量带有Markdown标签和JSON字段的文本你把提示词组织成这种结构它就能更快把握“哪段是指令、哪段是数据、哪段是格式要求”。4. 模板库整理十个场景复制即用下面这些模板是我从自己的提示词库里挑出来、反复验证过稳定性的十个场景模板。需要说明的是任何模板都不可能万能适配还是要根据具体场景微调。4.1 文档总结与要点提炼你是一位资深的文档分析师。请阅读以下文档输出一份精简的总结报告。 要求 1. 用不超过300字概括文档核心内容 2. 列出3-5个关键要点每条不超过20字 3. 指出文档中可能存在的逻辑跳跃或数据缺口 4. 最后用一句话概括文档适合哪些读者 --- 文档内容 [粘贴文档]这个模板很适合读长文章、看行研报告、整理客户聊天记录一次输出就拿到了“总结要点批判性意见受众定位”基本不用二次加工。有一个使用技巧是如果文档很长不需要一次性把全文贴进去先贴目录和首尾段落让模型生成第一版后再按需补细节。4.2 文案改写与风格迁移你是资深文案编辑擅长根据不同的平台调性改写文字。 请将下面的原文调整成[小红书/知乎/公众号/微博]风格。 要求 1. 保留原文核心信息不要虚构事实 2. 语言风格要贴合平台用户习惯 3. 标题控制在20字以内正文不超过500字 4. 不要出现震惊定了等夸张标题党词汇 --- 原文 [粘贴原文]用这个模板时最需要注意的是“保留原文核心信息”这条约束不加的话模型很可能会给人名、数字、品牌名“换头”信息失真。另外不同平台的风格差异很大写清楚目标平台比写“更活泼一点”要有效得多。4.3 代码解释与审查你是一位资深后端工程师擅长代码审查和教学。 请审查下面这段代码按以下格式输出 - 代码整体功能一句话概括 - 潜在问题按严重程度排列给出问题类型如性能、安全性、可维护性 - 优化建议每条建议附带修改后的代码片段 - 对初学者的白话解释用生活类比解释这段代码的核心逻辑 --- 代码 [粘贴代码]代码审查场景里我比较看重“按严重程度排列”这个约束没有它模型可能会把无伤大雅的风格问题放在安全隐患前面说排序会导致你抓不住重点。另外“生活类比解释”对帮助非技术同学理解代码逻辑也特别有用。4.4 会议纪要整理你是会议记录专员。请根据下面的会议原始记录输出一份结构化纪要。 格式要求 ## 会议主题 ## 参与人从原文中提取 ## 讨论要点用3-5个要点概括 ## 行动项每条注明负责人和截止时间如果没有写未指定 ## 待讨论问题 要求不要添加原文中不存在的信息。 --- 会议原始记录 [粘贴文字记录]所谓“不要添加原文中不存在的信息”本质上就是在规则层面压制模型生成幻觉。实测下来加上这句话后纪要里凭空杜撰的内容会明显减少。4.5 头脑风暴与创意发想你是创意策划专家。请围绕以下主题进行头脑风暴输出10个创意方向。 要求 1. 每个创意用一句话描述不超过30字 2. 用一句话说明这个创意的目标受众 3. 用一句话说明执行难度低/中/高 4. 最后从价值/创新/可行性三个维度打分1-10分 5. 选出一个你推荐的方向并说明原因 --- 主题[填写主题]头脑风暴场景里设置“执行难度”这个维度很有用否则模型会生成一堆听起来很炫但实际根本没法落地的点子。打分制则可以帮助你在大量想法里快速找到候选方向。4.6 结构化数据抽取请从下面的文本中抽取指定信息必须以JSON格式输出。 抽取字段公司名称、发布日期、涉及金额、相关人员名单、核心结论 输出示例 {公司名称: , 发布日期: , 涉及金额: , 相关人员名单: [], 核心结论: } 如果没有找到某个字段填null。 --- 文本内容 [粘贴文本]信息抽取是所有模板里对格式要求最严的一类给输出示例特别重要。模型一旦知道你要JSON结构就会老老实实地把信息往框架里填。经验之谈是在提示词中把字段名都定义得精确一点别让模型自己“翻译”字段名。4.7 学习辅助与知识问答你是一位耐心的导师擅长用通俗类比解释复杂知识。 请用以下方式讲解[知识点] 1. 先用一句话说明这个知识的应用场景 2. 再用一个生活中的类比解释核心原理 3. 接着给出一个逐步的推导示例 4. 然后列出3道练习题难度递增不给出答案 5. 最后用一句话总结作为记忆口诀学习场景下最难的是让模型做到“深入浅出”。“生活类比”这一步是最容易出彩的但偶尔也会出现类比不当的情况从实操来看看到不合适的类比我会直接在提示词里补一句“换一个更贴近日常的类比”体验会好很多。4.8 邮件与消息撰写你是一位得体的商务沟通专家。请根据以下信息帮我撰写一封邮件。 发送目的[说明发邮件的目的] 收件人关系[如客户/老板/同事/陌生合作方] 关键信息[列出必须包含的内容点] 期望结果[希望对方采取什么行动] 风格倾向[正式/简洁/亲切/跨部门协商] 额外要求请在邮件末尾加上一句关于[某个事项]的跟进提醒。写邮件模板里最有价值的是“收件人关系”这个维度。对陌生合作方的邮件和对老板的邮件语气完全不同模型需要这个信息才能把用词和礼貌程度调到合适的档位。如果没给这个信息它默认生成的是“万金油”式商务邮件——挑不出毛病但也毫无特点。4.9 项目管理与任务规划你是资深的项目经理擅长把模糊目标拆解为可执行的任务计划。 请根据我提供的目标制定一份项目计划包含 1. 总体里程碑按周划分不超过6个节点 2. 每个里程碑的交付物 3. 每个里程碑的风险点与应对建议 4. 资源需求人力、工具、预算 5. 衡量项目成功的3个关键指标 --- 项目目标[填写] 当前资源[可选填写现有资源] 截止时间[填写]项目计划模板的重点在“按周划分不超过6个节点”。如果不限制数量模型可能给你拆出二十个任务看着很细致实际上没法执行。资源受限时把“当前资源”填进去模型给出的计划会现实很多。4.10 产品需求分析你是资深产品经理擅长从用户反馈中提炼需求。 以下是用户对[产品名]的反馈信息请 1. 归纳出5个高频需求点 2. 按用户影响程度和改进成本两个维度给每个需求打分 3. 在用户影响-改进成本坐标上给出优先级建议 4. 针对最高优先级的一项需求写一个简短的PRD初稿 --- 反馈信息 [粘贴反馈内容]这个模板把“散乱的用户反馈”变成了“优先级建议PRD草稿”是我日常工作中用得最顺手的一个。特别是第3点的坐标判断能让团队快速对齐什么该先做、什么该缓一缓。5. 在实际项目里怎么用一个从粗到精的提示词调优过程5.1 第一版提示词的典型问题很多初学者拿到的第一版提示词往往是这样的帮我分析这份销售数据给出一些建议。这种提示词的问题非常多没有数据来源根本没贴数据、没有分析维度什么方面的建议、没有输出格式列清单还是写报告、没有受众老板看还是同事看。模型拿到这样的任务只能靠猜它在训练数据里见过无数种销售分析的回答模式最终选了一个最“平均”的路径来生成。5.2 迭代调优的完整记录假设我实际要做的是“分析门店销售数据锁定最近销量下滑的原因并给出三条可执行的改善建议”。我的做法是分层迭代第一版提示词你是零售行业的数据分析师。以下是某门店过去6个月的销售数据请分析销量下滑的原因并提出建议。数据[表格数据]我实测这个版本的问题有两个一是“原因”部分写得太泛模型说是“市场竞争加剧”“产品缺乏吸引力”这类谁都不得罪的废话二是建议部分没有结合数据里的具体数值。于是我在第二版里加了两个约束请基于数据表格中具体的品类和月度变化进行归因不要给出没有数据支撑的猜测。建议部分请写明针对哪个品类在什么时间范围内采取什么动作。第二版效果明显好了不少模型开始引用“3月B品类销售额环比下降33%”这类具体证据来支撑结论。但我还不满足继续加了一层输出格式的要求最终的输出格式 一、核心结论不超过100字 二、下滑原因按影响程度排列每个原因必须引用数据表格中的具体数字 三、三个改善动作每个动作包含目标品类、时间范围、具体操作、预期效果到这一版输出已经可以直接拿去跟团队开了。从第一版到第三版我只改了三处加角色、约束归因方式、指定输出结构。这就是提示词工程中“逐步收紧约束”的完整过程其中非常重要的一点是不要指望一次功成把提示词调优当作迭代过程才能逼近最理想的效果。5.3 调优的优先级判断标准根据我自己的经验提示词调优有一个顺序思路先解决“方向偏不偏”再解决“格式对不对”最后解决“细节细不细”。如果模型输出的内容跑题了先检查角色设定和任务描述是否明确如果内容对了但格式乱那就是缺少结构模板去模板库找一个对应模板套上如果格式对但深度不够那就是约束太少需要加入“引用数据”“给出具体措施”这类细化指令这个优先级帮助我避免了一个常见误区很多人看到模型输出质量不好第一反应是加更多修饰词比如“请你非常专业地、特别详细地、用商业思维来帮我”但实际上这些废话对模型没有任何作用。真正起作用的是在关键约束点上做文章。6. 常见问题与排查技巧实录6.1 模型输出太啰嗦压不住篇幅这是被问得最多的问题。我在前面说过根本原因是模型训练时养成了“多写一点”的偏好。排查路径很简单先检查提示词里有没有给出明确的字数上限、条数上限如果没有先补上。补了还不听话就在输出结构上下功夫比如指定“每条不超过40字”、要求“不要出现与核心内容无关的过渡句”。最后的手段是调低温度参数因为温度高时模型更容易自由发挥。实测下来最有效的组合是“设定总字数设定条数设定每条的细微约束”三者同时出现时模型输出的压缩率会非常高。6.2 模型输出的格式总是对不上格式问题通常出现在结构化输出场景里。尤其是当你要求模型输出JSON时有时候它会多写一段解释文字导致JSON解析失败。我的排查习惯是第一步在提示词里写死“只输出JSON不要包含任何其他文字”第二步给出一个明确的JSON格式示例第三步如果用的是API可以把temperature设低一点0-0.2三步都做到了JSON解析失败率基本可以降到非常低。如果还是失败可能是模型本身版本能力有限建议考虑换一个指令遵循能力更强的模型。6.3 模型回答问题过于宽泛和空泛这多半是提示词里缺少“边界条件”导致的。比如你问“怎么提高用户留存”模型给你的回答就是“提升用户体验、优化产品功能、加强运营触达”听着都对细品全是废话。我的处理方式是在提示词里加入“请给出可操作的具体措施”并附带约束“每条措施必须包含具体场景、操作步骤和预期效果”。宽泛的回答是模型的默认路径你必须在提示词里逼它走进“具体路径”。6.4 同样一个提示词效果时好时坏这个问题大部分情况源于“温度参数设置”。如果你用的是默认参数尤其是一些在线产品里隐藏了温度控制模型输出本身就带有一定的随机性。解决方案是在API调用中把温度调低或者把提示词里的关键约束写得更强这样即使随机性还在输出也不会跑太远。温度不是一个谜一样的参数它控制的是从候选词里采样的随机性。你希望模型稳定输出同一风格内容的时候就把它往低里调就这么简单。6.5 多步推理任务老是出错多步推理是提示词工程里的一个硬骨头。模型能力的边界在这里体现得最明显。我试过几个办法思维链提示是最直接的手段逼迫模型把推理过程显性化把复杂任务拆分为多次独立的提示词调用在有答案可对的时候给一两个完整的输入-输出示例。多数情况下效果都还可以没法保证100%正确但比起不约束默认输出强不少。7. 写在最后的实操心得提示词工程最迷人的地方在于它不要求你会写代码不要求你有算法背景但对逻辑能力、表达能力和换位思考能力的要求非常高。写提示词本质上是把大脑里的思路“翻译”成模型能精确理解的语言这个过程用到的是“把话说清楚”的能力而这种能力在任何行业里都是稀缺的。我个人体会最深的一点是不要神话技巧也不要轻视技巧。提示词工程的很多技巧归纳起来就是“约束、示例、结构、迭代”这四个词。你的提示词越清晰、越具体、越结构化模型输出越稳定。但没有任何一个技巧能弥补任务本身的模糊——如果连你自己都不清楚想要什么再好的提示词模板也无能为力。最后分享一个小建议每次调试出效果很好的提示词随手存进模板库。时间长了你会拥有一套属于自己的“最佳实践集”以后遇到类似需求直接调用稍微改改变量就能用。积少成多这才是提示词工程真正的复利所在。