AI能替人类打工赚钱吗?真实实验给出意外答案

财云财经阅读:42832025-11-06 22:25:00评论:0
摘要: 通过“远程劳动指数”实验测试AI“打工”能力,其自动化率低、交付质量差。当前AI转化经济价值的能力处于初级阶段,人机协作仍是主流。

AI打工实验:成果与困境

实验设计与执行

ScaleAI开展“远程劳动指数”实验,将各大模型当作“打工人”扔进真实项目接单。测试范围涵盖写作、3D建模等23类常见线上工作,任务来自Upwork真实订单,配备完整需求说明与素材,流程高度仿真,从理解需求到最终提交,任一环节失误都算任务失败。

实验结果展示

实验结果不尽人意,所有参与测试的AI模型对复杂项目的整体自动化率低于3%。表现最好的Manus成功率仅2.5%,240个任务只完成6个,赚到1720美元,远低于人类报酬均值。其他模型更是表现不佳,通过率均不超过3%。

失败原因剖析

AI失败集中在四类情况。45.6%的任务质量过低,成品业余;35.7%的任务不完整或格式错误;17.6%的任务存在技术与文件完整性问题;14.8%的任务有严重视觉或逻辑不一致。如珠宝设计项目,AI无视原图,新图质量差且与需求不符。

AI能替人类打工赚钱吗?真实实验给出意外答案

AI的优势与局限

AI在创意类和基础内容类任务上有天赋,擅长从零开始创作。但在多步骤操作、保持文件一致性或二次编辑时容易翻车。尽管出活速度快,可交付质量难以达标,人类完成项目平均28.9小时,AI投入相近“算力时间”成果多不合格。

新旧基准对比:为何新基准更重要

旧基准的问题

近两年大模型在封闭题库分数飙升,但与真实就业市场表现背离。现有基准如MMLU、MT-Bench和ARCChallenge,分别存在像闭卷知识竞赛、只能反映“聊天体感”、与现实场景脱节等问题,测的是“答题能力”,无法满足企业对“交付成果”的需求。

RLI的创新

ScaleAI推出的RLI以真实付费订单为测试题目,考验模型完成一整个工作流的能力,涵盖任务上下文、协作及产出可交付成果等方面,几乎无法“刷分”,能有效衡量模型的全流程适应力。

真实场景的挑战

现实工作中充满模糊多变的情况,如甲方临时改要求、参考资料问题或新增任务环节等,这些是传统模型能力测试未涉及的,而RLI能让模型面对更贴近现实的挑战。

AI对工作结构的影响:现状与未来

当前就业市场变化

RLI实验表明AI绝对自动化率几乎为零,短期内不会全面替代人类工作。但哈佛分析显示,AI引入后初级岗位招聘量下降,尤其在流程标准化行业,任务颗粒度变细、价格分层趋势明显。

未来岗位需求转变

未来初级岗位要求可能变为能使用AI完成部分日常杂务,并具备确保交付的能力。纯执行型技能贬值,定义问题、管理流程、整合资源的能力成为新核心竞争力。

人机协作的趋势

AI虽在考试中“聪明”,但现实中真正能“干活”的还是懂得让AI融入团队的人。人机协作是短期到中期的唯一路径,未来工作将在人机协作中不断重塑。

AI能替人类打工赚钱吗?真实实验给出意外答案

相关问答

“远程劳动指数”实验是如何进行的?

ScaleAI选Upwork上240个真实订单,涉及多类线上工作,给模型配备需求说明等,让其从理解需求到最终提交,全流程仿真测试。

AI在“远程劳动指数”实验中的整体表现如何?

整体自动化率低于5%,多数模型通过率不超3%,完成任务少,报酬远低于人类。

AI在实验中失败的主要原因有哪些?

主要原因包括质量过低、任务不完整或格式错误、技术与文件完整性问题、严重视觉或逻辑不一致等。

RLI与传统基准有什么不同?

RLI用真实付费订单测试,考模型完成工作流能力,贴近现实;传统基准存在与现实脱节等问题,侧重答题能力。

AI崛起对当前就业市场有什么影响?

7%,尤其在批发零售、行政支持等流程标准化行业。

未来初级岗位对能力有什么新要求?

未来初级岗位要求能使用AI完成30%日常杂务,并具备确保交付的能力,更注重综合管理能力。

声明

转载声明:欢迎分享本文,转载请保留出处!

本文网址:https://www.caiair.cn/post/ai-yuancheng-laodong-zhishu-383008.html

上一篇:

下一篇:

排行榜