阿里新模型Qwen3-Max-Thinking性能超GPT-5.2?真有这么厉害吗?

财云财经阅读:50352026-01-28 14:41:00评论:0
摘要: 1月26日晚阿里推出千问系列旗舰推理模型Qwen3-Max-Thinking,在多项权威测试中表现出色,总参数量超万亿,有改进,普通用户可免费体验,在开源领域成绩斐然。

Qwen3-Max-Thinking的重要突破

媲美顶尖模型的表现

1月26日晚阿里推出的Qwen3-Max-Thinking在19项权威基准测试中表现优异,能与OpenAI的GPT-5.2-Thinking、谷歌的Gemini3Pro等国际顶尖模型媲美,这意味着国产大模型在高阶推理领域迈出了重要一步。

核心参数与打磨过程

该模型总参数量超万亿,预训练数据量达36TTokens,经过大规模强化学习打磨。如此庞大的数据量和精细的打磨,为其卓越性能奠定了坚实基础。

阿里新模型Qwen3-Max-Thinking性能超GPT-5.2?真有这么厉害吗?

自适应工具调用能力

自主选择工具的优势

Qwen3-Max-Thinking具有自适应工具调用能力,能在对话中自主选择并调用内置的搜索、记忆和代码解释器功能。比如解答实时政策问题时可自动检索最新信息,降低“幻觉”风险。

提升用户体验与准确性

这种自主调用工具的方式,无需用户额外指令,让模型能像专业人士一样工作,大大提升了用户体验,同时也提高了回答的准确性和可靠性。

测试时扩展技术

避免冗余计算

测试时扩展技术通过“经验提取”式反思,避免传统模型并行推理的冗余计算。在相同算力下聚焦未解决难点,有效提升了推理性能。

显著的成绩提升

该技术使GPQA科学知识测试得分从90.3提升至92.8,LiveCodeBench编程测试从88.0升至91.4,在关键推理基准上超越Gemini3Pro。

性能比拼中的亮眼表现

HLE工具调用基准领先

在HLE工具调用基准中,Qwen3-Max-Thinking以58.3分远超GPT-5.2-Thinking的45.5分和Gemini3Pro的45.8分。

数学推理测试登顶

在IMO级数学推理测试中,Qwen3-Max-Thinking获91.5分登顶,预览版更曾拿下AIME25与HMMT25双满分,展现出强大的数学推理能力。

开源领域的辉煌成就

衍生模型数突破20万

1月21日,阿里千问衍生模型数突破20万个,成为全球首个达成此目标的开源大模型。

下载量突破10亿次

千问系列模型下载量突破10亿次,平均每天被下载110万次,超越美国Llama,稳居开源大模型全球第一。

目前普通用户可通过千问PC端、网页端免费体验Qwen3-Max-Thinking,企业能通过阿里云百炼获取API服务。阿里在AI领域持续加大投入,未来Qwen3-Max-Thinking或许还会给我们带来更多惊喜。

阿里新模型Qwen3-Max-Thinking性能超GPT-5.2?真有这么厉害吗?

相关问答

Qwen3-Max-Thinking的总参数量是多少?

Qwen3-Max-Thinking总参数量超万亿,如此庞大的参数为其强大性能提供了支撑。

自适应工具调用能力有什么作用?

能让模型自主选择并调用搜索、记忆和代码解释器功能,降低“幻觉”风险,像解答政策问题时可自动检索信息。

测试时扩展技术如何提升推理性能?

通过“经验提取”式反思避免冗余计算,聚焦未解决难点,从而提升了在科学知识测试和编程测试等方面的成绩。

Qwen3-Max-Thinking在HLE工具调用基准中的成绩如何?

在HLE工具调用基准中,8分。

阿里千问在开源领域有哪些成就?

阿里千问衍生模型数突破20万,成为全球首个达成此目标的开源大模型,且模型下载量突破10亿次,稳居开源大模型全球第一。

普通用户如何体验Qwen3-Max-Thinking?

普通用户可通过千问PC端、网页端免费体验Qwen3-Max-Thinking。

声明

转载声明:欢迎分享本文,转载请保留出处!

本文网址:https://www.caiair.cn/post/ali-qianwen-qwen3maxthinking-512587.html

上一篇:

下一篇:

排行榜