尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

大模型时代程序员转型全攻略:岗位选择与技能路线

大模型时代程序员转型全攻略:岗位选择与技能路线 写代码写了七八年我一直以为自己吃的是“手速饭”。直到有一天我发现自己最值钱的能力不再是敲键盘的速度而是“想清楚要做什么”的能力。这话不是我矫情是最近在程序员圈子里被反复验证的一个结论。你去看那些特别火的热词“当代码不再靠手写程序员的第二曲线在哪里”“系统设计与业务洞察的胜利”“大模型投毒测试”“GPU微调大模型”……你会发现大家对“程序员”这三个字的理解已经完全变了。以前聊的是“你数据库优化怎么样”“你并发写过多少”现在聊的是“你会不会微调模型”“你能不能把Agent接到业务里”。大模型赛道确实已经不是“要不要关注”的问题了而是“以什么姿势进去”的问题。这篇文章我想从自己的观察和实际踩坑经历出发把职业前景、岗位选择、技能路线这些事掰开揉碎了讲清楚。不整虚的全是能直接拿去用的东西。1. 为什么“大模型转型”是程序员当下最值得思考的事1.1 代码生产方式变了岗位结构也在变先说一个底层事实代码生产的边际成本正在无限趋近于零。以前一个业务系统要上线前后端、数据库、测试、部署每一步都要人肉堆。现在你打开任何一个主流的AI辅助编程工具给它一个清晰的需求描述它能直接生成一版能跑的代码。而且这版代码的水平比刚工作一两年的初级工程师写出来的只高不低。这意味着什么意味着“只会写业务代码”这个能力正在从“核心竞争力”变成“基本生存技能”。就像二十年前会用Excel是本事现在会用Excel只是岗位的基本要求。同样的逻辑我们正在经历编程能力从“专业技能”到“通用素养”的转变过程。那程序员的岗位结构会怎么变我自己的判断是三层分化最底层是“指令执行者”就是接需求、写代码、改bug这部分会被AI大量替代中间层是“方案设计者”能把业务问题翻译成技术方案知道用哪个模型、搭什么架子、怎么评估效果最顶层是“技术决策者”能判断哪些问题适合用大模型解决、哪些用传统规则就够了、投入产出比怎么算。你现在去招聘网站刷一刷大模型方向的岗位会发现大多数高薪职位要的都不是“会写代码的人”而是“会设计系统的人”。这就是那个热搜词说的“系统设计与业务洞察的胜利”。1.2 这一波转型和以往有什么本质不同很多老程序员对“转型”挺麻木的毕竟这些年技术浪潮一波接一波大数据、云计算、微服务、中台……每一波都是“错过就完了”结果也没见谁真的被行业淘汰。但大模型这波转型跟以往有本质区别。区别在于以前的技术浪潮改变的是“实现方式”而这一次改变的是“劳动力本身”。Hadoop那一波你从写Java变成写MapReduce本质上还是在写代码微服务那一波你从单体架构变成分布式架构本质上还是在解决工程问题。但大模型这一波你面对的是一个“能直接产出代码、能直接回答业务问题、能直接代替部分人工推理”的新物种。更关键的是这波浪潮的渗透速度比以往任何一波都快。我之前带过的一个团队做企业内部知识库以前用的是ESkibana做一个搜索功能要两周。后来换成了RAG方案两天就搞定了效果还更好。这种效率差一旦被业务方感知到整个技术栈的替换就只是时间问题。所以我的建议很简单不要纠结“要不要转”要纠结的是“怎么转”。哪怕是先原地不动把大模型用在自己的日常开发里也是转型的一部分。最怕的是那种“我知道这东西很牛但跟我没关系”的心态那才是真正的危机。2. 大模型赛道有哪些岗位、各自要什么能力市面上聊大模型岗位信息特别乱有的说“算法岗卷死了”有的说“应用开发招不到人”其实都对因为大模型赛道本身就不是一个岗位而是一个岗位集合。按我的分类这个赛道大概可以分成四类。2.1 算法侧岗位预训练、微调、对齐工程师这一类的核心工作是“把模型本身调好”。细一点分有做预训练的就是从头训练一个大模型这个方向基本是大厂和头部AI公司的游戏门槛极高动辄千卡万卡集群普通程序员别想有做微调的用开源底座模型比如Qwen、Llama系列在特定领域数据上做二次训练让模型具备某个垂直领域的专业能力这是目前最有就业需求的方向之一还有做对齐的就是通过RLHF、DPO这些方法让模型输出更符合人类偏好这个方向技术含量高理论要求也高。这类岗位的画像很明确Python是基本功PyTorch要熟深度学习理论得过关损失函数、梯度传播这些概念不能只是“听过”要有真的理解。另外一点越来越重要工程能力。你在实验室里跑通一个训练脚本不算本事能把数据清洗、训练、评测、部署全链路打通才是稀缺能力。薪资方面纯算法岗头部确实很高应届生都能拿到很高的包但竞争也极其激烈核心壁垒是“论文竞赛实习”三件套。如果你没有这些背景硬挤算法岗的成本很高后面我会细说。2.2 应用侧岗位Agent开发、RAG开发、应用架构师这是我个人最看好、也是绝大多数程序员最适合的方向。核心工作不是“训练模型”而是“用模型解决问题”。你不需要从头发明模型你需要的是知道手里这个模型擅长什么、不擅长什么然后设计一套提示词、工作流、外部工具调用方案让它能在真实的业务场景里稳定工作。举几个具体例子RAG开发工程师做的是知识库问答、私有数据检索增强。核心技能是向量化、Embedding选型、检索策略、重排序、缓存设计。这套东西对后端程序员来说非常友好你的工程经验不仅不浪费反而是优势。Agent开发工程师做的是让大模型能调用工具、能规划任务、能自主完成多步流程。核心技能是函数调用Function Calling、工作流编排、状态管理、异常处理。这活儿对逻辑能力要求很高因为你写的不是一个线性程序而是一个“有可能会跑偏”的自主系统。大模型应用架构师做的是整体技术方案比如选哪个模型做底座、用商用API还是私有化部署、数据放哪里、延迟怎么控制、成本怎么估算。这个岗位是目前市场缺口最大的因为它要求你同时懂业务、懂模型、懂工程。应用侧岗位的技术栈大概是Python或者Java都行但Python优先LangChain、LlamaIndex这些框架要熟向量数据库比如Milvus、Qdrant、Chroma要会用RESTful API设计和异步任务编排是基本功Docker和K8s多少得懂一点因为你最终要把东西部署上去。2.3 工程侧岗位部署、推理优化、MLOps大模型跑起来很贵显存要大推理要快成本要控。所以“能把模型跑起来、跑得快、跑得便宜”的工程人才成了非常稀缺的资源。这类岗位做什么事一是模型部署就是把训练好的模型打包成可服务的接口常见方案是vLLM、TGI、Ollama这些推理框架二是推理优化包括量化把FP16压到INT8甚至INT4、KV Cache优化、连续批处理、算子融合目标是在不显著降低精度的前提下把响应速度提上去三是MLOps做的是全流程的自动化管理从数据版本、训练实验记录到模型上线监控属于DevOps在大模型时代的进化版。这个方向对底层感兴趣的程序员特别友好。你不需要有很强的算法背景但需要对GPU原理、显存管理、CUDA编程、网络通信这些东西有深入理解。这些年搞分布式系统和性能优化的同学在这类岗位上很吃香。2.4 数据与产品侧岗位容易被忽略的“价值洼地”还有一个方向经常被忽略数据工程师和AI产品经理。大模型的效果上限很大程度上取决于数据质量。数据采集、清洗、标注策略、质量评估这些工作直接影响模型效果但愿意认真做的人不多。如果你想切入赛道又不想卷算法数据方向是一个不错的选择。AI产品经理则是“懂技术的产品经理”核心能力是能判断什么场景适合用大模型、ROI怎么算、模型效果怎么衡量。这一类岗位的薪资也很可观但前提是你得有足够的技术功底能跟工程师对话否则很容易被团队边缘化。为了让你有个直观对比我整理了一个表格把四类岗位的关键特征列出来岗位方向核心工作内容入门门槛竞争热度代表技术栈适合人群算法侧预训练、微调、对齐极高需要深度学习理论极卷核心岗位拼论文PyTorch、Transformers、DeepSpeed有算法背景的研究型人才应用侧RAG、Agent、应用架构中等工程能力可平移需求旺盛缺口大LangChain、向量数据库、Python后端、全栈程序员工程侧部署、量化、MLOps中高需要底层功底供不应求竞争温和vLLM、Docker、K8s、CUDA运维、SRE、后端底层数据与产品数据治理、AI产品设计中低业务理解优先正在升温SQL、Python、数据分析数据工程师、转岗产品3. 怎么选适合自己的岗位三个维度判断岗位摆在那里怎么选我的建议是不要盯着“哪个岗位最火”而要盯着“哪个岗位最适合你现在的底子”。判断维度有三个。3.1 第一维你手里的技术栈是什么技术栈决定你切入的速度。如果你一直是写Java的Spring Boot后端对Python只能说“会点”那我不会建议你直接冲算法岗。算法岗的面试连环问能把你问出心理阴影。但你的Java后端经验做Agent应用开发、做RAG服务端完全是降维打击。现在主流的应用框架虽然用Python写的居多但你要做企业级应用最终绕不开Java生态里的稳定性、事务、高并发这些东西。反过来如果你是Python出身做过数据处理对NumPy、Pandas这些熟那你的路线就顺很多可以直接从数据清洗、微调数据准备切入再往微调方向走。工程侧更不用说了你如果熟悉Docker、K8s、Linux性能调优那部署优化这条路就是给你准备的。大模型再热它也跑在服务器上它也需要运维、需要监控、需要资源调度这些都是传统工程人的地盘。3.2 第二维你的思维习惯适合哪种工作这是很多人忽略的一点。算法岗和应用岗对人的思维习惯要求完全不同。算法岗更像是“科学家”思维你面对的是一个不确定的问题你要提出假设、做实验、看指标、分析原因、再改方案。你需要在模糊中找到稍好一点的方向然后反复迭代。这个过程很磨人实验结果不好是常态你可能花两周调参结果指标没涨反而跌了。能接受这种“慢反馈”的人适合走算法路线。应用岗更像是“工程师”思维你面对的是一个明确的业务目标你要做的不是探索最优解而是在约束条件下找一个“足够好”的方案。比如老板说“我们要做一个客服机器人把人工客服的压力降低30%”你不需要把模型调到世界第一你需要的是设计一套可靠的工作流让模型在80%的问题上能准确回答剩下的20%交给兜底逻辑。能在不确定的模型输出里搭出确定性系统的人适合走应用路线。工程岗则偏“底层”思维你关心的是响应时间、吞吐量、显存占用、成本。别人讨论模型效果你关心的是“这个效果需要用多少张卡才能撑住”。如果你看技术文章时最感兴趣的是性能优化那部分工程岗会更适合你。3.3 第三维职业阶段与风险承受能力最后聊点现实的。如果你工作三五年以内试错成本低可以大胆一点哪怕先去学个框架、做个开源项目不行再退回来。如果你工作八年以上拖家带口那我建议你别搞“裸辞转算法”这种操作从自己当前的业务出发找一个可以用大模型提效的场景先把它落地了这本身就是一次漂亮的转型。我见过一个特别典型的案例一个朋友做传统BI报表开发年包不高自己也干腻了。他没有辞职而是用一个月时间把公司内部的报表生成逻辑做成了一个基于大模型的“自然语言查数助手”业务同事用中文提问系统自动生成SQL并返回结果。就这么一个东西在公司里传开之后他就成了“懂AI的人”后来顺理成章转到了公司AI部门既不用吃亏降薪简历上也多了漂亮的一笔。所以岗位选择不是“选热门”而是“选自己能打的位置”。你的技术栈、思维习惯、职业阶段共同决定了哪一个方向对你来说阻力最小、胜率最高。4. 转型实操技能树怎么点、项目怎么落地方向定了接下来就是最实际的怎么学、怎么做项目。这一章的每一句都是实操不带任何水分。4.1 技能树全景基础、工具、实战三阶段我之前整理过一张“大模型应用开发技能树”在这次转型中用得很顺分享出来给你参考。第一阶段是“打地基”。Python基础语法要熟到能不假思索地写出来HTTP、RESTful API、JSON这些网络知识要能脱口而出SQL要会写因为很多业务数据在数据库里你要把数据取出来喂给模型或者做向量化。这个阶段不需要碰任何大模型内容1到2周搞定。第二阶段是“摸工具”。先玩熟ChatGLM、通义千问这类商用API把Prompt Engineering的核心套路掌握角色设定、上下文注入、输出格式约束、少样本示例。然后立刻转到开源模型上安装Ollama在本地跑一个7B左右的模型体验私有化部署的完整流程。接着学LangChain或者LlamaIndex把一个简单的“文档问答”跑通。这个阶段的目标是你能对别人讲清楚“什么是RAG它解决了什么问题在什么场景下会失效”。大概需要3到4周。第三阶段是“做项目”。不满足于demo不满足于教程里的玩具代码把项目往真实业务场景靠。这个阶段没有固定时间表根据项目复杂度变化但这是让你获得市场认可的关键一环。4.2 从本地部署开始的第一周让模型跑在自己的电脑上很多人卡在第一步的原因是觉得“本地跑模型”是一件特别高技术含量的事。其实早不是了。你现在用Ollama部署一个开源大模型操作简单到像装一个普通软件。装Ollama就一行命令装完把模型拉下来就能跑。我用一张消费级的显卡跑过Qwen2.5-7B效果非常能打做日常问答、代码生成都够用# 下载并安装 Ollama官方脚本macOS/Linux 通用 curl -fsSL https://ollama.com/install.sh | sh # 拉取 Qwen2.5 7B 模型约 4.7GB视网速等几分钟 ollama pull qwen2.5:7b # 运行模型进入交互式对话 ollama run qwen2.5:7b第一次跑起来的时候那种“大模型原来离我这么近”的感觉确实很震撼。但这只是开始更重要的是把它接到程序里。Ollama默认暴露了一个本地HTTP服务你直接用Python原生的requests库就能调用import requests resp requests.post( http://localhost:11434/api/generate, json{ model: qwen2.5:7b, prompt: 用一句话解释一下什么是RAG检索增强生成。, stream: False } ) print(resp.json()[response])到这里你已经完成了“本地部署大模型”的完整闭环。别小看这一步它让你的简历上可以光明正大地写一行“熟悉大模型本地化部署方案掌握Ollama/vLLM等推理框架”。而很多人连这一步都还没迈出去。4.3 做一次真正能写进简历的微调LLaMA Factory实操本地部署只是“用模型”而“微调”才是很多人眼里真正代表技术含量的活。但微调的门槛已经被开源工具打得很低了。我格外推荐LLaMA Factory算是目前我见过最好上手的微调工具把原本需要写大量训练代码的工作简化成了配置文件加命令行操作。而且它特别适合在消费级显卡上做一些轻量级的全参数微调或者LoRA微调刚入门不用考虑那种动辄几百张卡才能跑的训练任务。先做数据准备。微调的第一性原理是你给模型的“输入-输出”对决定了模型学会什么。比如你想让模型学会写营销文案你需要准备类似下面的JSON数据[ { instruction: 请为一款主打安全性的国产SUV生成一段短视频口播文案。, output: 开这辆车回家老婆放心。全新一代智能安全系统主动刹车、盲区预警、车道保持全系标配从上车那一刻起安全感直接拉满。 } ]数据量起步建议至少1000条质量远远重要于数量。模型能不能学会你想要的东西主要看数据质量是否一致。全部准备好之后定位到项目目录用一条命令启动训练# 以 Qwen2.5-7B 为底座用 LoRA 方法微调保存到本地的 qwen-lora 目录 llamafactory-cli train \ --model_name_or_path Qwen/Qwen2.5-7B \ --dataset my_dataset.json \ --template qwen \ --lora_target q_proj,v_proj \ --output_dir ./saves/qwen-lora训练结束后你会得到一个LoRA权重文件它本身不是一个完整的模型但可以通过脚本跟原始底座模型合并导出用来做本地推理或者部署。微调完你需要准备几个评测样本看看模型在目标风格的输出上有没有明显变化如果没有变化优先检查数据格式、训练轮数和学习率这几个关键点。关于显存我之前用一张显存不高的卡也跑过。我的建议是7B模型做LoRA微调显存12GB起步16GB比较舒适。你跑一次完整的微调实验控制在一两个小时以内是比较健康的状态。不要一上来就调全参数先用LoRA把流程跑顺后面再想优化的事。4.4 用RAG做一个完整项目不是玩具是能解决真问题的方案微调适合解决“风格迁移”“特定能力培养”这类问题但知识库问答这类场景更常用的方案是RAG。RAG的完整链条是文档加载 → 文本切分 → 向量化 → 向量入库 → 检索 → 注入提示词 → 模型回答。我们一步一步来。文档切分这个环节最容易被轻视。切太碎语义就断了上下文信息丢失切太大检索出来的内容不够精准。我的经验是对于正式文档按标题和段落级别来切每段控制在300到500字左右重叠控制在50字以内。切分要用支持自定义分隔符的工具不能一行一行的硬切。向量化是RAG的另一个关键点。这一步做的事情是把一段文本转换成一串浮点数。选择Embedding模型时优先选中文优化过的模型否则中文字词的语义会表达得不够准确。向量化之后检索阶段就是在向量数据库里做相似度搜索最常见的是余弦相似度。最后把检索到的文本和用户的问题拼在一起交给大模型让它基于上下文回答。这个过程可以用LangChain高度简化但我不建议你在一开始就只依赖框架。很多教程直接用LangChain的VectorstoreIndexCreator一把梭这导致你根本不了解内部发生了什么。我的建议是先用原生代码把流程走一遍哪怕效率不高但你会深刻理解每一个环节的意义。# 伪代码示例理解 RAG 的完整链条不建议直接用于生产环境 documents load_and_split(docs/*.md) # 1. 加载文档并切分 vectors embed(documents) # 2. 向量化 store VectorStore(vectors) # 3. 向量入库 question 报销流程是什么 results store.search(embed(question), top_k3) # 4. 检索相关片段 prompt build_prompt(question, results) # 5. 拼接提示词 answer llm(prompt) # 6. 大模型回答当你真的手工走完这一整条链路再回头看LangChain的各个组件会有一种“这玩意儿原来是在做这个事”的豁然开朗感。做项目的时候有一个判断标准分享给所有想转行的朋友如果你做完的项目只能跑在你自己电脑上那它只是一个作业如果你能把它做成一个别人能通过网页访问、能真实使用、能解决真实问题的工具那它才有资格写进简历。这个标准直接决定了你转型的成功率。5. 避坑指南常见问题与真实经验转型路上坑很多我把自己和身边人踩过的坑整理出来按频率排个序希望能帮你省点时间。5.1 先看看这张问题速查表有没有你关心的常见问题真实情况是什么应该怎么办算法岗是不是一定需要发论文核心算法岗确实需要但应用型算法岗更看重项目经验用LLaMA Factory做一两个高质量的微调项目比水论文管用不会Python、只会Java能不能转能应用开发和工程侧完全能进大模型服务端也有很多Java生态的活儿补Python基础语法即可不需要成为Python专家本地跑大模型配置要求高不高要看用多大模型7B量化版在普通消费级显卡上就能跑CPU也能跑小模型先用Ollama在本地CPU跑小模型找感觉再考虑升级硬件大模型会不会像以前AI一样“过两年就凉了”短期会有泡沫但技术方向没问题所有软件都在变成AI原生软件不要赌风口要沉淀方法论怎么定义问题、怎么评估效果、怎么迭代年龄大了是不是没机会大模型是重工程的方向经验多反而是优势尤其是系统设计和成本控制不要拿短板拼毕业生拿长板拼稀缺性架构、稳定性、业务理解要不要报培训班培训班的资料有用但指望“交了钱就上岸”一定是错的用免费开源资料学习把钱花在买算力和数据上产出自己的项目5.2 关于“不会论文能不能做算法”这件事这是个高频问题我单独拿出来说。结论是不能进“纯预训练”那种研究岗但完全能进“行业微调”和“应用型算法”岗位。很多中小型公司根本不需要训练自己的基础大模型它们需要的是把开源底座模型在垂直领域做好微调比如法律问答、医疗辅助、金融风控。这类岗位要的不是你的论文能力而是三件事第一你能不能把数据处理好第二你能不能把训练流程跑通第三你能不能评估模型好坏并且持续改进。这三件事一个有工程背景的人认真学一段时间完全可以做到。我认识一个做Java后端的朋友完全靠自学的LLaMA Factory做项目把公司内部的“合同关键信息抽取”任务用微调解决掉了效果比之前基于正则规则的老方案好一个量级。没人问他有没有论文大家只看结果。5.3 关于“只调API算不算入行”这种焦虑朋友圈里有一种声音“你用别人的API那不是本事那只是调接口。”对这种说法我坚决不同意。现在大模型行业落地的主赛道不是每个公司都去训练自己的模型而是“拿现成的模型解决实际的业务问题”。这道题本来就是API开发者、应用工程师来解的。工作中大量关键难点都在工程侧怎么把不稳定的模型输出变成稳定的业务逻辑、怎么做成本控制、怎么兼顾响应速度和回答质量、怎么兜底异常情况——这些事换个不懂工程的人根本做不了。所以如果你正在做“调用大模型API”相关的工作你已经在大模型赛道上了不用觉得低人一等。先把“会调API”做成“会调得比别人好”就能接触到更多核心业务后面再想是否往模型底层走。5.4 关于“跟着培训班能不能上岸”的实话我不一竿子打死培训班因为我自己也看过一些机构的资料有些整理得确实不错能帮你节省搜集信息的时间。但你要清醒地认识到培训班能给你的是“信息”给不了你“能力”。能力这个东西只能发生在你自己处理真实问题的过程中。更靠谱的路径是自己制定学习计划用免费的官方文档和开源项目做练习把基础技能夯实。然后找一个真实场景做项目哪怕是给朋友公司免费做一个AI客服、给自己搭一个AI看文献的工具都行。最后把项目开源或者写成文章发出来让面试官能直接看到你的思考过程。这比任何证书都有说服力。最后说一点我的心里话说实话写了这么多年代码我对“程序员”这个身份的理解在这大半年里悄悄发生了变化。以前我总觉得核心竞争力是“写代码比别人快bug比别人少”。现在我的想法变了我更愿意把它理解为“你能不能用一个新工具把价值更快地交付出来”。大模型时代代码本身越来越便宜真正贵的、稀缺的是那个“知道要做什么、为什么要这么做、怎么验证有没有做好”的人。这一篇文章讲岗位、讲路线、讲实操最想传达给你的不是那些命令和框架而是这个底层的角色转变。把手弄脏先跑通一个模型再做一个小项目你会慢慢地从“程序员”长成“用AI解决问题的工程师”。这个身份没有人能替你做主但从现在开始你可以自己选。
返回列表