阿里新模型Qwen3-Max-Thinking性能超GPT-5.2?真有这么厉害吗?

Qwen3-Max-Thinking的重要突破
媲美顶尖模型的表现
1月26日晚阿里推出的Qwen3-Max-Thinking在19项权威基准测试中表现优异,能与OpenAI的GPT-5.2-Thinking、谷歌的Gemini3Pro等国际顶尖模型媲美,这意味着国产大模型在高阶推理领域迈出了重要一步。
核心参数与打磨过程
该模型总参数量超万亿,预训练数据量达36TTokens,经过大规模强化学习打磨。如此庞大的数据量和精细的打磨,为其卓越性能奠定了坚实基础。

自适应工具调用能力
自主选择工具的优势
Qwen3-Max-Thinking具有自适应工具调用能力,能在对话中自主选择并调用内置的搜索、记忆和代码解释器功能。比如解答实时政策问题时可自动检索最新信息,降低“幻觉”风险。
提升用户体验与准确性
这种自主调用工具的方式,无需用户额外指令,让模型能像专业人士一样工作,大大提升了用户体验,同时也提高了回答的准确性和可靠性。
测试时扩展技术
避免冗余计算
测试时扩展技术通过“经验提取”式反思,避免传统模型并行推理的冗余计算。在相同算力下聚焦未解决难点,有效提升了推理性能。
显著的成绩提升
该技术使GPQA科学知识测试得分从90.3提升至92.8,LiveCodeBench编程测试从88.0升至91.4,在关键推理基准上超越Gemini3Pro。
性能比拼中的亮眼表现
HLE工具调用基准领先
在HLE工具调用基准中,Qwen3-Max-Thinking以58.3分远超GPT-5.2-Thinking的45.5分和Gemini3Pro的45.8分。
数学推理测试登顶
在IMO级数学推理测试中,Qwen3-Max-Thinking获91.5分登顶,预览版更曾拿下AIME25与HMMT25双满分,展现出强大的数学推理能力。
开源领域的辉煌成就
衍生模型数突破20万
1月21日,阿里千问衍生模型数突破20万个,成为全球首个达成此目标的开源大模型。
下载量突破10亿次
千问系列模型下载量突破10亿次,平均每天被下载110万次,超越美国Llama,稳居开源大模型全球第一。
目前普通用户可通过千问PC端、网页端免费体验Qwen3-Max-Thinking,企业能通过阿里云百炼获取API服务。阿里在AI领域持续加大投入,未来Qwen3-Max-Thinking或许还会给我们带来更多惊喜。

相关问答
Qwen3-Max-Thinking的总参数量是多少?
Qwen3-Max-Thinking总参数量超万亿,如此庞大的参数为其强大性能提供了支撑。
自适应工具调用能力有什么作用?
能让模型自主选择并调用搜索、记忆和代码解释器功能,降低“幻觉”风险,像解答政策问题时可自动检索信息。
测试时扩展技术如何提升推理性能?
通过“经验提取”式反思避免冗余计算,聚焦未解决难点,从而提升了在科学知识测试和编程测试等方面的成绩。
Qwen3-Max-Thinking在HLE工具调用基准中的成绩如何?
在HLE工具调用基准中,8分。
阿里千问在开源领域有哪些成就?
阿里千问衍生模型数突破20万,成为全球首个达成此目标的开源大模型,且模型下载量突破10亿次,稳居开源大模型全球第一。
普通用户如何体验Qwen3-Max-Thinking?
普通用户可通过千问PC端、网页端免费体验Qwen3-Max-Thinking。

