在最近的招聘市场上,一大波有关“AI数据标注员”的岗位开启了火热招聘,而这一现象背后,离不开大模型热与大厂的大模型布局。这篇文章里,作者就做了一定的讲述和分析,一起来看一下。
“人均月薪两万、本科以上学历、直通百度字节。”
有些许荒凉的年底招聘市场,在最近的短短一周之内,突然冒出了一大批“AI数据标注员”的岗位,正在火热招聘中。
据「自象限」搜索,这些岗位不仅有百度、字节、京东、滴滴、美团等“梦中情厂”,工资月薪十分亮眼,都在1万到2万元之间,且发布时间很短,都在1周到1个月之间。
除了新以外,岗位招聘显然非常急迫。
据招聘软件显示,HR们都异常活跃,一天24小时几乎全程在线,日均回复次数在十次以上,隔几分钟就回复一次。
“最近只要一上线,有关AI数据标注员的招聘消息就疯狂弹,重复地弹。”不少正在求职的人向【自象限】反映,“上次这么疯狂的打招呼,感觉还是主播招聘。”
招聘的火热,很难不让人想到大厂的大模型之战。
不过,据「自象限」观察,“AI数据标注员”招聘不是由这些大厂直接操办,而是通过猎头公司来负责招聘。岗位的名字也是五花八门,有“数据标注”、“AI话术编辑”、“数据标注分析师”、“标注员”、“AI训练师”等等。
虽然叫法不同,但关于这些岗位的职能描述却大差不差,据招聘软件信息显示,其中很大一部分岗位跟现下大热的大模型有关,入职的数据标注员们的日常工作包含,大模型的编辑校对、大模型的数据标注管理、大模型的内容质量评估等。
▲ 图源Boss直聘截图
「自象限」向多位招聘HR进行了咨询,“工作的主要内容是对文心一言大模型回答结果的分析和判断,工作的地点在百度科技园。”有猎头回复道。
高薪资待遇、挂钩大模型、大厂哄抢……有求职者看到了机会,“大模型的风,要带动新一批大厂人扎根了,普通人的机会来了吗?”
但事实上,时间紧、任务重的岗位招聘,要求却并不算低,基本学历要求本科起步,985、211优先本科和硕士优先,在具备语言学、中文信息处理、计算语言学、文学等相关专业背景的同时,还得对一些AI技术的原理有了解。
严格准入门槛,招聘软件上神秘的“AI数据标注员”背后,藏着大厂的大模型棋局。
历时一个多月的面试,中文系毕业的罗文(化名)最终敲定了自己的offer——百度文心一言的AI数据标注员。连她自己都不敢相信,一个纯技术小白现在的日常竟然是给大模型当“考官”。
“毕业三年,没有任何AI经验,转行涨薪,幅度近50%,月薪在9k-15k左右”,罗文告诉我们。
坐在两台电脑前,罗文每天的主要工作有两项:一是做题,直接给大模型进行“填鸭式”教育;二是给文心一言当“判官”,评判给出的答案对不对、好不好。
所谓“填鸭”就是强行把写好的答案喂给大模型,这样的好处就是从数据源上不会出错,以此来提升大模型的训练效果。
罗文告诉「自象限」,数学题、常识题、作文题她都做过,但这还远远不够,“理论上,越专业越好,比如我擅长文学领域,那就专攻文学题,有的同事专业是医学,那就做医学问答题”,罗文道。
罗文的话已经在一些社交平台得到验证,有人曾发布帖称,“急需招募金融专业人员,有偿给文心一言答题,一天30多道,每道题价格在1.5-2.4元。”
▲ 图源社交媒体平台小红书截图
另一项工作就是给大模型当“判卷老师”,就像学生考试一样,每天大模型会生成各种问题的答案,罗文就需要承担老师的角色,判断其生成的答案与题目是否一致,答案是否正确。
若遇到诸如作文一类没有标准化答案且开放性的问题时,则需要评判答案的好坏,比如,系统会随机给一组数据,包含1个问题和3个回答。罗文需要先标注出这个问题属于什么类型,随后给3个回答分别打分并排序。分数区间为0-5分,如果打分低于3分,还要标注出具体原因,例如“答非所问(0分)”、“严重跑题(1分)”、“存在逻辑问题,存在事实性错误,比例较小给2分”等。
这个工作虽然看上去并不难,但却异常重要,甚至可以从外包直通大厂的机会。据上述猎头告诉我们,“虽然合同跟我们猎头公司签,但是还是有六分之一的几率转正,进入百度集团”。这或许也是严格控制学历的原因。
▲ 图源Boss直聘截图
为此,由于百度地图的数据标注,有稳定的地图业务需求及自动驾驶模型、算法模型的训练需求,所以对数据标注的质量要求更高,的确搭建了专门的数据标注团队。
市场上对“罗文”的需求,不止大模型公司。
据统计,目前,市面上的数据标注岗位大致分为两种。
一种以NLP(自然语言)为主要方向,百度、字节、京东、美团等一批大模型科技公司一拥而上,给自家大模型找人工数据训练师。这其中又分为几个细分的方向,譬如数据分析、大模型生成结果判定、辅助大模型逻辑推理等等。
另一个方向则是CV(图像),存在已久,人们更加耳熟能详的是“2D拉框”和“3D拉框”,主要是满足滴滴、毫末、轻舟智航等这类车企,为其智能驾驶业务提供图像数据质检和标注帮助。
▲ 图源Boss直聘截图
观察发现,十一月是NLP方向数据标注的转折点,此前,百度、京东等大厂无论是校招还是社招,都仅开设了很少或压根没有AI数据标注岗位,招聘软件上也只是零星地开放了实习生的岗位,通常不设学历上限,大专学历封顶。
毫无征兆地突然冒出一批岗位需求,这背后或许与大模型厂商的研发受阻有关。 多位行业人士曾透露,截至目前,国内的大模型水平或许仅能达到GPT-3.5水平,发展的核心还是数据质量问题。
一边是国外OpenAI连放猛招,直逼GPT-5,一边是国内企业喊着“要落地”、“要用上大模型”,双重压力下,又用起了“人海战术”。
技术研发水平不够,人工能力来补齐,国内大模型厂商开始疯卷“AI数据标注员”,为大模型能力“飞升”再加一把燃料。
由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。
但是具体到个人,只能说是:
“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。
我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。
AI大模型时代的学习之旅:从基础到前沿,掌握人工智能的核心技能!
这套包含640份报告的合集,涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师,还是对AI大模型感兴趣的爱好者,这套报告合集都将为您提供宝贵的信息和启示。
随着人工智能技术的飞速发展,AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型,如GPT-3、BERT、XLNet等,以其强大的语言理解和生成能力,正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。
作为普通人,入局大模型时代需要持续学习和实践,不断提高自己的技能和认知水平,同时也需要有责任感和伦理意识,为人工智能的健康发展贡献力量。
该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。
学习是一个过程,只要学习就会有挑战。天道酬勤,你越努力,就会成为越优秀的自己。
如果你能在15天内完成所有的任务,那你堪称天才。然而,如果你能完成 60-70% 的内容,你就已经开始具备成为一名大模型 AI 的正确特征了。
保证100%免费
】因篇幅问题不能全部显示,请点此查看更多更全内容