一分钟速读:

  • 智算中心越建越多,算力运维人才却没跟上
  • 最缺的是既懂算力又懂业务的复合型人才
  • 训练、推理、运维三类岗位都在抢人
  • 国产算力适配,让这类人才变得更稀缺
  • 想招到人,得换一套筛选和培养的思路

编者按:

前阵子有个做算力服务的老板跟我倒苦水。他们去年签下几个智算中心的运维单子,合同都到手了,团队却一直搭不起来。挂在招聘网站上的算力运维岗,挂了三个月,投进来的简历一只手数得过来,能过技术关的更是没有。他问我:这行的人,都跑哪去了?

这个问题,今年被问了不下十次。智算中心一个接一个落地,显卡一批批到货,可会伺候这些设备、能把算力榨出效率的人,始终是少数。今天这篇文章,就把「算力运维为什么这么难招」拆开讲清楚,顺带说说企业该怎么招、怎么留。

目录

  1. 智算中心为什么一下子多了起来
  2. 最缺的到底是哪几类人
  3. 为什么这类人才这么难招
  4. 国产算力适配,让缺口更明显
  5. 招人之前,先看清岗位的真实要求
  6. 怎么招、怎么留:三条实在建议
  7. 常见问题(FAQ)

智算中心最缺的三类岗位

▲ 智算中心最缺的三类岗位:训练优化、推理优化、集群运维

一、智算中心为什么一下子多了起来

先把背景说清楚。这两年,从地方政府到互联网大厂,再到一批算力服务商,都在往智算中心里砸钱。原因也不难理解:大模型要训练、要推理,靠的就是成片的GPU集群,算力正在变成和水电一样的基础设施。

设备的钱好花,卡买回来插上电就能跑。可要让这些卡真正转起来、稳定转起来、把每一分算力都用在刀刃上,靠的是一群平时容易被忽视的人,也就是算力运维和调优工程师。设备越多,这群人的缺口就越明显。

智算中心的竞争,早就不在「谁家卡多」这个层面了,而在「谁家能把卡用好」。而「用好」这件事,恰恰是眼下最缺人的地方。

二、最缺的到底是哪几类人

算力这行的人才缺口,不是一个岗位的事,是几类岗位同时缺。拆开看,主要是三类。

第一类是训练优化工程师。他们的活儿,是让一个大模型的训练过程更快、更稳、更省钱。几百上千张卡一起跑,卡和卡之间的通信、显存怎么分配、梯度怎么同步,都是门道。同样一个模型,调得好能省下几成的算力成本。

第二类是推理优化工程师。模型训好了,上线给用户用,这时候拼的是「又便宜又快」。同样的显卡,能不能多扛几倍的并发,全靠推理侧的优化。大模型应用一个接一个落地,这块的人才缺口涨得比训练侧还快。

第三类是算力集群运维。这是基础中的基础,也最容易被人忽视。上千张卡的集群,要管供电、散热、网络、存储,还要盯卡的健康状态。GPU集群的故障率、返修率,跟普通服务器差得远,没有一群经验老到的运维,集群根本撑不住。

这三类人有个共同点:都得「既懂算力,又懂业务」。只会敲命令、不懂模型跑的是啥,或者懂模型、不会调集群,都干不好。而「复合」两个字,恰恰是人才稀缺的根源。

AI人才的缺口到底有多大、企业该怎么抢,我之前专门写过一篇,可以一并翻翻:AI人才招聘指南:企业怎么高效抢到人工智能核心人才→

三、为什么这类人才这么难招

很多人以为,算力人才难招是因为钱给少了,其实不然。难招的根本,在于供给太少、门槛太高。

先说供给。GPU集群运维、大模型调优,这些方向真正热起来,也就是最近两三年的事。一个方向从冷门到抢手,人才的培养周期根本跟不上。学校里的课程还在讲传统IT运维,企业要的却是能摆弄上千张卡的人,中间隔着好几年的实战经验。

再说门槛。算力运维看着是「运维」,其实横跨了硬件、网络、系统和算法四个领域。你得懂GPU的架构,懂高速网络,懂Linux底层,还得多少了解点模型训练推理的流程。随便拎出一块,一两个月都补不齐。

更要命的是,这类人才大多集中在几家头部大厂和少数算力服务商手里。中小企业和新入局的算力公司想挖人,要么给不出匹配的薪酬,要么给不了足够有意思的项目,常常是有岗位、没人来。

算力人才难招的四个原因

▲ 算力人才难招的四个原因:门槛高、人才少、竞争激烈、适配杂

四、国产算力适配,让缺口更明显

还有一个被很多人忽略的因素:国产芯片的适配,正在把人才缺口进一步拉大。

过去大家默认的算力生态,是围绕英伟达的CUDA建起来的,市面上会的人也多。这两年国产芯片起来了,政策也在往自主可控的方向引导,越来越多的智算中心开始上国产卡。可国产卡的软件栈、工具链,跟过去那套不完全一样,很多现成的经验没法直接搬。

这意味着,企业需要的人,不仅要懂算力运维,还得熟悉国产芯片的生态,能做一些跨平台的迁移和适配。这种「既懂主流、又懂国产」的人才,市面上更是凤毛麟角。

对企业来说,这是个绕不开的现实:卡换了,人就得跟着换思路。谁先把适配的人才配齐,谁就能在新一轮的算力竞争中先走一步。芯片人才整体的供需,之前也拆过,可以顺带看看:半导体高端人才招聘真相→

五、招人之前,先看清岗位的真实要求

很多企业招算力人才招不到,问题不全在市场上,也在于岗位写得不清楚。几个常见的毛病,我在这行见得太多了。

第一个毛病,是把「算力运维」当成普通运维来招。JD里写的还是「熟悉Linux、会写脚本」,可真正要干的,是管理几百张GPU卡的集群。岗位描述和实际工作对不上,招来的人自然干不了。

第二个毛病,是要求堆得太满。把训练优化、推理优化、集群运维、国产适配全写进一个岗位,指望一个人全包。这样的人本来就少,要求一堆,更是把人吓跑。

第三个毛病,是只盯着「熟练工」,不接受培养。算力人才总量就那么大,只挖现成的,肯定挖不动。愿意招一些底子好、能快速上手的人,再配上内部培养,反而更现实。

所以,招人之前先问自己一句:这个岗位,我到底要解决什么问题?把需求想清楚、写清楚,是招到人的第一步。

六、怎么招、怎么留:三条实在建议

讲完为什么难招,落到操作上,无锡猎头公司常给企业三条实在的建议。

第一条,把岗位拆开招,别指望一个人全包。训练优化、推理优化、集群运维,这三块能拆开就拆开,每个岗位对应一个明确的方向。岗位越具体,越好找到对的人。

第二条,用「项目」去吸引人,别只盯着薪资。算力人才大多在意自己经手的项目够不够大、够不够前沿。中小公司给不出大厂的薪资,但可以给「从零搭一个集群」「主导一个国产化迁移」这样的机会,对很多技术人来说,这比多几千块钱更有吸引力。

第三条,建立自己的培养梯队。与其永远在外面抢人,不如招一些基础扎实的年轻人,配上内部导师,用一两年时间培养出来。算力人才的市场缺口短期内不会消失,早点建梯队,后面才不至于被卡脖子。

说到底,算力人才的竞争,拼的是企业的长期耐心。设备可以一次性买齐,人才得一点点攒。想在这波智算浪潮里站稳,越早动手越主动。如果您正为算力相关岗位招人发愁,欢迎拨打 400-001-7166,找无锡百猎猎头聊聊。我们专门帮企业梳理这类技术岗位的真实需求,用对的方法找到对的人。

常见问题(FAQ)

算力运维和传统IT运维,是一回事吗?

差别挺大。传统IT运维管的是服务器、网络和数据库,算力运维管的是一整片GPU集群,还要懂模型训练推理的流程。前者偏稳定,后者偏性能和效率。企业招人时如果把两者混为一谈,很容易招错人。

小公司招不到算力人才,是不是只能放弃?

不至于。薪资拼不过大厂,可以从「项目」和「成长」下手:给一个有挑战的从零搭建机会,或者用内部培养的方式,招底子好的年轻人自己带。算力人才看重的东西,未必只有钱。

国产算力适配,普通企业也要提前准备吗?

要。政策在往自主可控的方向走,国产卡的比例只会越来越高。企业现在开始储备懂国产生态的人,或者让现有团队提前接触国产软件栈,后面切换的时候才不会手忙脚乱。