时薪800、学历硕士起:大厂热抢的AI数据“炼金师”到底在做什么?
如今,阿里、字节、DeepSeek、MiniMax等企业的一些相关岗位,不再冠以“数据标注”的名称,而是改名为“数据百晓生”、“AI出题专家”、“数据炼金师”等等。
能力要求也随之变化。不少岗位的学历要求提高到硕士及以上,拥有法律、金融、医学、编程、语言学等专业背景,或是具备丰富从业经验和竞赛经历的人才更为吃香。
要求提升后,这些岗位的薪资待遇也有可观的上浮。在Boss直聘等招聘平台上,金融、法律、医学等垂类任务已经出现每小时500-800元的报价。即便是在大厂做外包岗,这类岗位的月薪也从传统数据标注三四千元的水平,提高到8000-10000元左右的水平。
大模型时代的数据标注,正在成为一种复杂得多的职业。而这一变化背后,其实对应着AI产业自身的一次转向。
同时,互联网数据并非天然的高质量资源,其中大量内容存在重复、噪声、错误甚至相互矛盾的语料。模型可以靠互联网数据学习语言模式,却未必能够形成可靠判断。
▲某大厂的数据标注岗位要求中,提到了高质量中文数据的短缺
合成数据虽被视为缓解这一问题的路径,但难以根本解决问题。模型生成的数据受限于自身能力边界,可以扩展已有知识,却难以创造超出自身认知的判断标准。
因此,后训练阶段的Scaling逐渐成为行业重点。这一阶段,模型能力的提升越来越依赖人工反馈,包括模型评测、偏好数据构建以及RLHF等工作。模型需要人类告诉它,什么答案更优,什么逻辑更符合现实,什么表达更符合专业标准。
而在金融、法律、医疗等专业领域,以及推理、创意写作等复杂任务中,只有具备深厚专业知识和判断能力的人,才能产出真正高质量的数据,反哺模型的能力提升。
随着后训练重要性的持续提升,从2025年下半年开始,字节、阿里等国内大厂和DeepSeek、MiniMax、智谱等AI头部厂商,陆续在招聘平台、高校社群和社交媒体上宣传自家的专家数据平台或是高级数据标注岗位,吸引更多专业人才加入。
为了理解这类新型数据标注工作的具体内容,智东西采访了两位参与者。他们进入行业的路径不同,所处职业阶段也不相同,对工作的感受更存在明显差异,但都在参与同一件事:帮助模型学习如何判断、理解与表达。
去年,拥有十多年金融和互联网从业经历的Molly,在社交平台上看到字节专家数据平台Xpert的招募信息后,随即投递了简历。
▲字节专家数据标注平台Xpert
真正进入平台之前,她首先需要通过测试。候选人不仅要证明自身专业背景,还需要设计能够“难倒模型”的问题。平台会同时调用多个模型进行验证,只有当至少两个模型回答失败时,题目才有机会被认定为有效。
Molly并不觉得测试困难,但她也观察到,不少参与测试的候选人会卡在这一环节。在她看来,原因并不只是学历高低,而是真实行业经验的差异。“很多硕博学生没有真正的从业经历,所以很难设计出有行业深度的问题。”她说。
最终,Molly进入了商科与金融方向的专家任务组。她提到,这类任务往往对应真实业务场景。以投资尽调场景为例,多种模型会模拟机构对项目开展评估,围绕风险、运营与商业可行性生成数份上万字分析报告。
而她的工作,则是以金融从业者的视角,对这些结果进行比较与判断:哪份分析更符合真实业务逻辑,风险识别是否充分,评估框架是否贴近实际决策流程。完成选择之后,工作并未结束。她还需要进一步拆解判断过程,从多个维度解释依据,并指出其他答案存在的问题。
这类任务采用时薪制,根据测试结果和专业能力进行分级。Molly观察到,在金融方向,300元至500元时薪并不罕见。
需要补充的是,这份工作的时薪并不能直接换算为月薪,其薪酬完全与工作量挂钩,专家每天接多少任务、平台每天放多少任务,都会影响专家在一段时间内的总收入。
在Xpert上,大多数任务都可以在线完成,但需要全程录屏以防作弊,确保判断来自真实专家,而非其他AI工具。
在Molly看来,这份工作的核心能力要求并不是学历,而是长期积累的行业经验,真正做过投资、做过评估,才知道模型的问题在哪。
除了金融相关任务,Molly有时也会主动选择一些时薪较低的逻辑题。在她眼里,这些任务更像桌游,因此做起来颇有趣味。
谈起这些经历时,Molly始终带着一种明显的兴奋感。我们问她是否享受这份工作,她几乎没有犹豫地说道:“很快乐。”
他所在的AI小说项目组刚成立不久,正处于缺人阶段。相比成熟团队优先招募有标注经验的从业者,这个组更看重写作背景。
渊星恰好符合这一点。他有出版经历,也拿过一些写作奖项,因此即使缺乏标注经验,仍顺利通过面试进入团队。
但真正入职后,他发现,这份工作的实际内容与外界对“AI小说”的想象并不完全一致:抛去创意工作的外壳,其本质上是一套高度细分的数据生产流程。
渊星所在的团队需要同时处理多个模型生成结果:同一个小说指令会被交给该大厂的模型以及其他竞品模型作答,标注员则负责逐条阅读、比较,并依据规则判断问题所在。
这份工作对专业能力有着不低的要求。团队里有大概一半人干过编剧,其他人则有网文创作、媒体投稿的经历,标注员需要判断人物行为是否符合设定、剧情推进是否合理、冲突是否成立,一切都被拆解成细致的评分标准。
完成问题识别后,标注员还要给模型输出打分,并在部分项目中对文本进行人工改写,删除冗余描写、修补逻辑漏洞,或重新调整结构。其中一项工作是为长篇小说“抽细纲”。一部十几章、上万字的小说,需要被逐章提炼成结构化大纲,再作为模型扩写和训练的数据输入。
从本质上来看,这更像一种需要文学判断力的流水线工作,任务高度重复、标准化。渊星认为,标注员在生态链中的位置很低。
渊星称,他的工作时间是每天上午9:30到晚上6:30,中午有90分钟休息时间,上下班时间弹性,基本不会加班。
尽管对文学审美和写作能力有一定要求,但渊星的薪资水平并不高。他在北京工作,每月到手收入约为8000元,五险一金按当地最低标准缴纳。