1. 大模型岗位全景解析:从入门到精准定位
最近两年,大模型技术彻底改变了AI行业的就业格局。我身边至少有20位从事传统NLP、CV的朋友在去年完成了向大模型方向的转型,薪资涨幅普遍在30%-50%之间。但与此同时,新入行的同学普遍面临一个困惑:大模型相关岗位名称五花八门,JD描述又高度相似,到底该如何选择适合自己的发展方向?
以2023年某头部大厂的招聘数据为例,大模型相关岗位数量同比增长了370%,但岗位细分维度却增加了5倍。这种爆发式增长带来的信息不对称,让很多求职者陷入了选择困难。本文将基于我近三年参与大模型团队组建和校招面试的经验,为你拆解这个新兴领域的岗位矩阵。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 五大核心岗位详解与技术栈对照
2.1 算法工程师:模型能力的塑造者
2.1.1 基座模型岗:大模型时代的"造车人"
基座模型研发是目前技术门槛最高的方向,主要分为三个技术流派:
-
理论派:专注Transformer架构创新。我参与面试的候选人中,90%都需要在白板上推导Flash Attention的数学原理。典型工作包括:
- 设计新型Attention机制(如2023年流行的MQA/GQA)
- 探索MoE架构的动态路由算法
- 研究模型 scaling law 的突破方法
-
工程派:需要处理千卡集群的分布式训练问题。以我们团队最近训练的340B模型为例,关键技术挑战包括:
- 3D并行策略优化(数据/模型/流水线并行)
- 显存优化(ZeRO-3 + Activation Checkpointing)
- 训练稳定性控制(梯度裁剪系数设为1.0还是2.0?)
-
能力派:Agent方向今年特别火爆。一个常见的误区是认为Agent就是API调用,实际上核心工作在于:
- 工具使用能力的原生微调(Toolformer范式)
- 复杂任务分解的强化学习(比如让模型自主决定是否要调用计算器)
- 环境交互的鲁棒性提升(处理API调用失败等边缘情况)
重要提示:基座模型岗通常要求顶会论文(NeurIPS/ICML/ICLR),但数据清洗经验可以弥补论文短板。我们团队去年录用的两名候选人就是凭借在The Stack数据集上的预处理工作获得offer。
