李飞飞团队“50美元”复刻模型背后,是真低价高性能吗?

财云财经阅读:60532025-02-08 20:45:00评论:0
摘要: 李飞飞团队用不到50美元打造出s1-32B模型,看似低成本高性能,然而50美元未包含全部成本,性能也未全面超顶尖模型,核心在于测试时的拓展和高质量数据集构建。

s1-32B模型的低成本打造

报道中的低成本

据外媒报道,李飞飞等研究人员以不到50美元费用,使用16张英伟达H100GPU,耗时26分钟完成s1-32B模型训练。参与项目的研究员表示如今约20美元就能租到所需计算资源,这看起来是非常低的成本。在AI发展中,模型训练往往需要大量资源投入,这样低成本的成果很是惊人,这一消息也引起了科技界广泛关注。

成本的疑问点

这个成本存在很多疑问。s1-32B模型是基于阿里通义千问Qwen2.5-32B-Instruct进行监督微调,而非从零开始训练,这两者成本不可比。而且50美元是否包含数据、设备、消融实验等费用并不明确。实际上,像DeepSeek等公司前期做消融实验等是需要大量“烧钱”的,所以这个50美元成本可能只是表面的。

s1-32B模型的性能表现

与顶尖模型对比

李飞飞团队论文提到s1-32B在数学和编码能力测试中的表现与OpenAI的o1和DeepSeek的R1等尖端推理模型不相上下,在竞赛数学问题上比o1-preview高出27%。这一结果看似很优秀,但实际上s1-32B只能在特定测试集上超过o1-preview,并没有超过“满血版”o1和DeepSeek-R1。

李飞飞团队“50美元”复刻模型背后,是真低价高性能吗?

样本效率情况

研究结果显示s1-32B是样本效率最高的开放数据推理模型,表现明显优于其基座模型以及OpenAI的推理模型o1-preview。不过这也不能完全说明它在整体性能上超越了其他顶尖模型,因为它在不同测试集的表现存在差异,整体性能的衡量是多方面的。

模型背后的真正探索

测试时拓展技术

李飞飞团队论文核心是研究测试时拓展。这是一种在模型推理阶段通过多步推理提高性能的技术。例如模型回答问题时会先初步推理,若结果不佳会重新推理优化。研究团队通过预算强制,控制模型思考时间或操作步数,让模型充分考虑问题,逐步优化结果。

高质量数据集构建

研究团队从16个来源收集59029道高质量题目,包括多种高难度问题。经过验证和过滤得到1000个样本的s1K数据集,覆盖50个领域且每个问题都有答案和推理轨迹。这个高质量数据集基于难度、多样性和质量三个标准构建,它极大降低了s1-32B模型的训练成本。

李飞飞团队“50美元”复刻模型背后,是真低价高性能吗?

李飞飞团队的s1-32B模型真的只花了50美元训练成本吗?

不是。虽然报道称花费不到50美元,但这是基于已有预训练模型微调,且50美元可能未涵盖所有费用,前期相关研究投入未计算在内。

s1-32B模型在性能上全面超过OpenAI的o1和DeepSeek-R1了吗?

没有。它只能在特定测试集上超过o1-preview,在任何测试集都未超过“满血版”o1和DeepSeek-R1。

测试时拓展是如何提升模型性能的?

测试时拓展在模型推理阶段操作。如控制模型思考时间或操作步数,若初步推理结果不好,模型会重新推理优化,逐步生成高质量答案。

s1K数据集有什么特点?

s1K数据集从16个来源收集59029道题筛选而来,有1000个样本,覆盖50个领域,包含多种高难度问题,每个问题都有答案和推理轨迹,基于三个标准构建。

为什么说高质量数据集降低了s1-32B模型训练成本?

高质量数据集减少了模型训练时对大量数据的需求,避免了大规模数据投入,使得在数据获取、处理等方面的成本降低,从而降低训练成本。

李飞飞团队的研究重点是成本还是其他方面?

研究重点不是模型的低成本,而是测试时拓展技术以及高质量数据集的构建等方面的探索。

声明

转载声明:欢迎分享本文,转载请保留出处!

本文网址:https://www.caiair.cn/post/lifeifei-tuandui-s132b-moxing-220105.html

上一篇:

下一篇:

排行榜