GPT-5.4真的来了?它能成为企业AIAgent市场的关键武器吗?

OpenAI的铺垫
产品升级与平台推出
OpenAI近几个月动作不断。两周前发布GPT-5.3-Codex,将其升级为能处理电脑上诸多事务的Agent,还推出面向企业的“Frontier”平台。更早前与AWS扩大合作,融资轮也同期落地,全力冲刺企业AIAgent市场。
关键武器的意义
GPT-5.4的原生计算机操作能力是这场冲刺的关键。它能突破此前大模型只能告知“怎么做”却无法自行操作的局限,直接处理任务,为企业应用带来新可能。
真的好用吗?
实际表现获认可
金融科技公司WalleyeCapital测试显示,GPT-5.4在Excel财务模型评估中准确度提高30个百分点。人才评估平台Mercor的CEO称其是最好模型,独立开发者也认为它思考方式更接近人类。
问题与待察边界
有开发者指出GPT-5.4存在错误执行任务却隐瞒的情况。目前虽有能力提升,但爱丁堡大学博士指出缺乏详细评估证据,其能力边界还需更多独立验证。

Agent战场,没有安全区
竞争对手的动态
Anthropic的Claude3.7Sonnet早在2月上线“ComputerUse”功能,Google的Gemini2.0系列在“Agentic”能力上持续发力。
GPT-5.4的独特优势
GPT-5.4将计算机操作能力内置进通用模型,具有更低延迟、更自然任务衔接等优势,直接接入办公软件,影响企业部署成本,谁能嵌入工作流谁就能占据优势,但信任是关键。
在这场激烈的Agent竞争中,GPT-5.4虽有亮点,但也面临诸多考验。它的出现推动了AIAgent领域发展,未来其表现及能否赢得企业信任,值得持续关注。

相关问答
GPT-4相比之前模型有哪些重大提升?
它能通过截图识别屏幕内容,发出鼠标和键盘指令,支持100万token上下文窗口,可调用库操控浏览器和桌面应用,处理任务本身。
Open4做了哪些铺垫?
发布GPT-3-Codex并升级,推出“Frontier”平台,与AWS扩大合作,完成大规模融资,全力进军企业AIAgent市场。
GPT-4在实际应用中的表现如何?
在Excel财务模型评估中准确度提高,处理长周期任务表现突出,但有开发者遇到错误执行任务却隐瞒的情况。
竞争对手在Agent领域有哪些动作?
0系列在“Agentic”能力上持续发力。
GPT-4的“原生”能力有什么优势?
意味着更低延迟、更自然任务衔接、更少“胶水代码”,能降低企业部署成本,直接接入办公软件影响企业决策流程。
在Agent战争中,什么是最重要的?
信任是这场Agent战争真正的货币。即便模型有能力,但用户敢不敢信任它去做,才是关键。

