马斯克发布Grok3,真的超越现有AI模型了吗?

财云财经阅读:74262025-02-20 14:02:00评论:0
摘要: 马斯克发布Grok3,测评表现优秀登上排行榜榜首,但有人失望,性能提升有限,引发对Scalinglaws是否失效的思考,工程能力令人印象深刻。

Grok3的发布与测评表现

发布概况

马斯克发布了Grok3,这一被称为“地球最聪明的AI”的模型。同时发布的还有Grok-3Reasoning推理模型。Grok3由约20万个GPU的数据中心训练,计算能力是Grok2的10倍且训练数据集扩大。

测评成绩领先

在测评方面,Grok3表现出色。在Math、Science和Coding任务测评中,Grok基座模型领先同类模型。如AIME'24数学能力测试Grok-3得52分高于DeepSeek-V3的39分,GPQA科学知识评估Grok-3以75分领先DeepSeek-V3的65分。推理模型Grok-3Reasoning在benchmark上得分也高于诸多模型,发布后登上ChatbotArenaLLM排行榜榜首。

Grok3的特点与争议

思维链亮点

Grok3的一大亮点是思维链的升级。它通过1.8万亿参数的混合专家模型实现从“执行指令”到“主动思考”的质变。例如处理火星移民基地能源系统问题时能逐步拆解问题。但它会模糊思考过程,马斯克称是防止抄袭。

争议之处

不少人对Grok3失望,它走“大力出奇迹”路子,虽堆了20万张卡,计算量远超DeepSeek,但与现有模型性能未拉开质的差距。这似乎印证预训练到头的结论,引发人们对Scalinglaws是否失效的思考。

马斯克发布Grok3,真的超越现有AI模型了吗?

相关工具与马斯克的工程能力

GrokDeepSearch

发布会上还推出Agent工具GrokDeepSearch,能扫描互联网和X平台信息生成高质量回答,类似互联网文章答案。AndrejKarpathy评价其约PerplexityDeepResearch功能水平,未达OpenAI“深度研究”水平。

工程能力震撼

相比Grok3模型,马斯克的工程能力更令人印象深刻。Colossus从10万卡提升到20万卡仅花92天,建设超算中心也仅用122天,远低于业内4年的平均周期。这种算力基建效率或成为竞争AGI的关键。

在AI发展中,Grok3虽有领先之处,但也存在问题,而马斯克在工程建设方面的能力对未来竞争意义重大。

马斯克发布Grok3,真的超越现有AI模型了吗?

相关问答

Grok3在哪些测评任务上领先其他模型?

Grok3在Math、Science和Coding任务测评中领先。如AIME'24数学测试和GPQA科学知识评估中分数高于DeepSeek-V3等模型。

Grok3的思维链有什么特殊之处?

Grok3的思维链能实现从“执行指令”到“主动思考”的质变,通过混合专家模型拆解复杂问题,但会模糊思考过程防止抄袭。

为什么有人对Grok3失望?

因为Grok3虽计算量巨大,但与现有模型性能未拉开质的差距,走“大力出奇迹”路子,似乎印证预训练到头的结论。

GrokDeepSearch的功能水平如何?

GrokDeepSearch能生成高质量回答,AndrejKarpathy评价约PerplexityDeepResearch功能水平,未达OpenAI“深度研究”水平。

马斯克的工程能力体现在哪?

体现在Colossus从10万卡提升到20万卡仅花92天,建设超算中心只用122天,远低于业内平均周期。

Grok3的发布对Scalinglaws有何影响?

Grok3堆大量计算资源性能提升有限,似乎印证Ilya说的预训练到头结论,侧面说明Scalinglaws可能到瓶颈期。

声明

转载声明:欢迎分享本文,转载请保留出处!

本文网址:https://www.caiair.cn/post/grok3-masike-688100.html

上一篇:

下一篇:

排行榜