红杉中国推出的xbench,能否成为通往AGI之路的关键助力?

红杉中国在AI领域的布局与行动
积极布局AI企业
自ChatGPT引发热潮后,红杉中国迅速行动全面拥抱AGI。在AI六小龙中,红杉中国成功投资了四家。在具身智能领域,热门的宇树科技、智元机器人都是其被投企业。凭借Manus在AgenticAI领域的影响力,也在A轮获得红杉中国投资,可见其在AI行业布局决心之大。
推出创新基准测试
红杉中国宣布推出全新的AI基准测试xbench。这是首个由投资机构发起,联合国内外十余家顶尖高校和研究机构的数十位博士研究生共同打造的测试。其打破常规,以投资机构身份跨界推出产品,展现出强大的业务洞察和务实姿态。

xbench诞生的背景与原因
现有基准测试的困境
当前用于评估AI能力的基准测试面临难题。随着基础模型快速发展,它们“刷爆”了市面上的基准测试题库,在各大榜单上屡获高分甚至满分,使得真实反映AI系统客观能力变得愈发困难。
红杉中国的思考与探索
早在2022年ChatGPT推出后,红杉中国就对AGI进程和主流模型进行内部月评与汇报。在建设和升级“私有题库”xbench时,发现主流模型“刷爆”题目速度加快,基准测试有效时间缩短,从而质疑现有评估方式,思考核心问题并寻求解决方案。
xbench的创新解题思路
注重现实实用性
红杉中国打破惯性思维,为现实世界实用性开发新任务设置和评估方式。AI进入新阶段,既需要考察能力边界的测试,也需要实用性任务体系。xbench引入新基准概念,采用“双轨制”评估,让AI面临更多复杂环境下效用的考察。
建立长青评估体系
针对静态评估集易失效的问题,xbench维护动态更新的题目扩充评估集。同时设计可横向对比的能力指标,用于观察模型发展速度与关键突破信号,助力判断模型落地阈值和Agent接管业务流程的时机。
xbench的特点与意义
独特的评估体系与特点
xbench采用双轨评估体系,构建多维度测评数据集,追踪模型理论能力上限与Agent实际落地价值。同时采用长青评估机制,持续维护并动态更新测试内容,确保时效性和相关性,还发布核心评估集并提出评测方法论。
探索新投资方法论
xbench本质是一套评估AI产品的“标准”。红杉中国将其“开源”,可能在探索适应AGI时代的新投资方法论,希望更多人士参与共建,为AI发展和投资带来新的可能性。

相关问答
红杉中国在AI领域投资了哪些企业?
红杉中国在AI领域投资广泛,AI六小龙中独中四元,还投资了具身智能领域的宇树科技、智元机器人,以及AgenticAI领域的Manus等企业。
为什么现有基准测试难以反映AI客观能力?
基础模型发展迅速,“刷爆”了市面上的基准测试题库,在各大测试榜单上取得高分甚至满分,导致现有测试难以真实反映AI系统的客观能力。
xbench的双轨评估体系是怎样的?
xbench的双轨评估体系分为AGITracking和ProfessionAligned。前者评估AI系统的能力上限与技术边界,后者量化AI系统在真实场景的效用价值。
长青评估机制有什么作用?
长青评估机制通过持续维护并动态更新测试内容,确保时效性和相关性,能跟踪模型能力演进,捕捉Agent产品迭代关键突破。
xbench首期发布了哪些内容?
xbench首期发布包含科学问题解答测评集与中文互联网深度搜索测评集,对主要产品综合排名,还提出垂类智能体评测方法论和相关评测框架。
红杉中国推出xbench的目的是什么?
红杉中国推出xbench旨在弥补现有评测体系不足,探索AGI时代新投资方法论,推动AI技术突破与产品迭代。

