AI能替人类打工赚钱吗?真实实验给出意外答案

AI打工实验:成果与困境
实验设计与执行
ScaleAI开展“远程劳动指数”实验,将各大模型当作“打工人”扔进真实项目接单。测试范围涵盖写作、3D建模等23类常见线上工作,任务来自Upwork真实订单,配备完整需求说明与素材,流程高度仿真,从理解需求到最终提交,任一环节失误都算任务失败。
实验结果展示
实验结果不尽人意,所有参与测试的AI模型对复杂项目的整体自动化率低于3%。表现最好的Manus成功率仅2.5%,240个任务只完成6个,赚到1720美元,远低于人类报酬均值。其他模型更是表现不佳,通过率均不超过3%。
失败原因剖析
AI失败集中在四类情况。45.6%的任务质量过低,成品业余;35.7%的任务不完整或格式错误;17.6%的任务存在技术与文件完整性问题;14.8%的任务有严重视觉或逻辑不一致。如珠宝设计项目,AI无视原图,新图质量差且与需求不符。

AI的优势与局限
AI在创意类和基础内容类任务上有天赋,擅长从零开始创作。但在多步骤操作、保持文件一致性或二次编辑时容易翻车。尽管出活速度快,可交付质量难以达标,人类完成项目平均28.9小时,AI投入相近“算力时间”成果多不合格。
新旧基准对比:为何新基准更重要
旧基准的问题
近两年大模型在封闭题库分数飙升,但与真实就业市场表现背离。现有基准如MMLU、MT-Bench和ARCChallenge,分别存在像闭卷知识竞赛、只能反映“聊天体感”、与现实场景脱节等问题,测的是“答题能力”,无法满足企业对“交付成果”的需求。
RLI的创新
ScaleAI推出的RLI以真实付费订单为测试题目,考验模型完成一整个工作流的能力,涵盖任务上下文、协作及产出可交付成果等方面,几乎无法“刷分”,能有效衡量模型的全流程适应力。
真实场景的挑战
现实工作中充满模糊多变的情况,如甲方临时改要求、参考资料问题或新增任务环节等,这些是传统模型能力测试未涉及的,而RLI能让模型面对更贴近现实的挑战。
AI对工作结构的影响:现状与未来
当前就业市场变化
RLI实验表明AI绝对自动化率几乎为零,短期内不会全面替代人类工作。但哈佛分析显示,AI引入后初级岗位招聘量下降,尤其在流程标准化行业,任务颗粒度变细、价格分层趋势明显。
未来岗位需求转变
未来初级岗位要求可能变为能使用AI完成部分日常杂务,并具备确保交付的能力。纯执行型技能贬值,定义问题、管理流程、整合资源的能力成为新核心竞争力。
人机协作的趋势
AI虽在考试中“聪明”,但现实中真正能“干活”的还是懂得让AI融入团队的人。人机协作是短期到中期的唯一路径,未来工作将在人机协作中不断重塑。

相关问答
“远程劳动指数”实验是如何进行的?
ScaleAI选Upwork上240个真实订单,涉及多类线上工作,给模型配备需求说明等,让其从理解需求到最终提交,全流程仿真测试。
AI在“远程劳动指数”实验中的整体表现如何?
整体自动化率低于5%,多数模型通过率不超3%,完成任务少,报酬远低于人类。
AI在实验中失败的主要原因有哪些?
主要原因包括质量过低、任务不完整或格式错误、技术与文件完整性问题、严重视觉或逻辑不一致等。
RLI与传统基准有什么不同?
RLI用真实付费订单测试,考模型完成工作流能力,贴近现实;传统基准存在与现实脱节等问题,侧重答题能力。
AI崛起对当前就业市场有什么影响?
7%,尤其在批发零售、行政支持等流程标准化行业。
未来初级岗位对能力有什么新要求?
未来初级岗位要求能使用AI完成30%日常杂务,并具备确保交付的能力,更注重综合管理能力。

