2017年的时候,我在北京中关村一个创业咖啡馆里,听到两个年轻人聊人工智能。其中一个说,他们公司刚拿下一笔融资,要做自动驾驶。另一个问,你们打算怎么搞数据?第一个年轻人愣了一下,说,数据?买啊。当时在场的人都笑了,觉得这个问题问得外行。但现在回头看,那个问“数据怎么搞”的年轻人,可能才是真正看懂了这个行业的人。数据标注,这个听起来像流水线工人干的活儿,恰恰是AI落地时最先卡脖子的环节。没有它,再牛的算法也是空中楼阁。

你随便打开一个手机App,人脸识别解锁、语音转文字、拍照翻译,背后全是数据标注的影子。但大多数人感知不到它的存在,就像你用电的时候不会去想发电厂怎么运转。我有个朋友在AI公司做产品经理,他跟我说过一句话,我记到现在:算法是发动机,数据是汽油,标注就是炼油厂。没有炼油厂,发动机再先进也只能趴窝。这话糙理不糙。现在很多AI公司烧了几千万融资,发现钱全砸在数据清洗和标注上,比研发费用还高。这不是个例,是行业常态。
数据标注这活儿,听着简单,做起来全是坑。拿自动驾驶来说,一辆车要识别红绿灯、行人、路障、车道线,每一帧画面都得标注出来。一个熟练的标注员,一天能标几百张图,但一辆测试车跑一天,产生的数据够一个团队标一个月。而且标注不是画个框就完事,阴天和晴天的光线不一样,雨天路面反光不一样,老人和小孩的体型不一样,这些细节全得考虑到。我认识一个标注团队的负责人,他说他们最怕的不是工作量,是标准不统一。同一个物体,十个标注员能画出十种不同的框,算法学出来的东西就是四不像。
这个行业里有个特别反常识的现象:越先进的AI,越需要“笨功夫”。前两年大模型火起来的时候,很多人以为数据标注要失业了,因为模型自己能生成数据了。结果恰恰相反,大模型反而催生了更复杂的数据标注需求。模型生成的内容需要人工评估质量,回答需要标注是否安全、是否符合逻辑、是否包含偏见,这些比画框难多了。我见过一个专门给大模型做反馈标注的团队,成员全是985硕士,因为这份工作需要的判断力,根本不是普通标注员能具备的。这哪是什么劳动密集型产业,分明是智力密集型。
但话说回来,数据标注行业现在也面临不少尴尬。最突出的问题是人才流失。一个标注员干一两年,技能熟练了,工资涨了,但天花板也到了。很多人在这个岗位上待不久,不是因为不努力,是看不到职业路径。另一个问题是价格战。有些外包公司为了抢单,把单价压到几毛钱一张图,标注员累死累活一天赚不到二百块,质量自然没法保证。这个行业如果一直这么卷下去,坑的是整个AI产业。便宜没好货,用在数据标注上再合适不过。
不过,情况正在起变化。国内已经出现了一批专业化的数据标注企业,开始往垂直领域深耕。比如做医疗影像标注的,标注员得有医学背景,能看懂CT片和MRI片子;做法律文书标注的,得懂法律条文和案例逻辑。这些细分领域的标注服务,单价高、门槛高、不可替代性强,正在把数据标注从一个“脏活累活”变成一个有专业壁垒的行业。我最近接触到一家公司,专门做工业质检的数据标注,他们给工厂做缺陷检测,标注员需要熟悉各种金属材料在不同光照下的缺陷特征。这种活儿,根本不是随便拉几个人培训三天就能干的。
另一个趋势是工具和流程的标准化。以前数据标注全靠人肉,现在很多平台开始用“人机协同”的方式:先让算法预标注一遍,人工只需要修正错误。这样效率提高了,标注员的角色也变了,从“画框的”变成了“审核的”。虽然还是重复劳动,但至少没那么枯燥了。我亲眼看过一个智能标注平台的演示,一辆车在视频里跑,标注系统自动识别出车辆、行人、路标,标注员只需要确认和微调,效率至少提升三倍。这说明数据标注这个行业,也在被AI自己改造。
回到文章标题,数据标注服务,确实是驱动AI落地的隐形基石。这话不是比喻,是事实。你看看那些AI应用跑得顺的公司,哪个不是把数据治理做得扎扎实实。反过来,那些算法惊艳但数据一团糟的项目,基本都死在了路上。我记得有个投资人跟我说过,他看AI项目,第一不看算法团队多牛,先看他们的数据团队怎么搭建。数据标注这个环节做得好不好,直接决定了一个AI产品能不能从demo变成真正能用的工具。
说到底,AI的落地不是靠一个天才算法工程师灵光一现,而是靠成千上万个小时的重复劳动,靠那些坐在电脑前一张图一张图画框的标注员,靠那些在深夜还在核对标注标准的质检员。他们不站在聚光灯下,甚至很少有人知道他们的存在,但没有他们,那些所谓的人工智能,就只是一堆跑不动的代码。所以下次你再用人脸识别解锁手机的时候,不妨想想,那个让你手机认出你的人,可能正在千里之外的一个工位上,喝着速溶咖啡,盯着屏幕上密密麻麻的标注框。这才是AI落地的真实模样。


