当前位置:首页 > 赛事分析 > 正文

OpenAI官宣最新推理模型o3,迈向会思考的AI新纪元

摘要: 在科技界此起彼伏的猜测与期待中,OpenAI终于扔下了一枚重磅炸弹——北京时间12月21日凌晨,OpenAI在其最后一天的“12...

在科技界此起彼伏的猜测与期待中,OpenAI终于扔下了一枚重磅炸弹——北京时间12月21日凌晨,OpenAI在其最后一天的“12天直播”特别活动中,由CEO山姆·奥特曼亲自官宣了最新的推理模型家族:o3 和 o3-mini,这不仅是继9月发布o1-preview之后的又一里程碑,更被外界视为向通用人工智能(AGI)迈出的坚实一步。

如果你感到疑惑为什么直接从“o1”跳到了“o3”,这个命名的小插曲其实颇具人文色彩,奥特曼坦言,出于对英国电信运营商O2的尊重,他们决定跳过“o2”命名,直接启用o3,这看似随意的跳跃,并未掩盖o3模型本身的硬核实力。

o3究竟强在哪里?它是一套拥有更强推理能力的模型,核心在于模拟人类的“深思熟虑”,与此前的模型不同,o3在面对复杂问题时,不会急于给出答案,而是会在响应前进行内部的事实核查与推理链构建,从而大幅减少在数学、编程、科学等需要严密逻辑的领域中的错误(即“幻觉”)。

OpenAI官宣最新推理模型o3,迈向会思考的AI新纪元

为了展示这一飞跃,OpenAI公布了一组令人咋舌的测试成绩: 在代表数学竞赛巅峰的美国数学邀请赛(AIME 2024)中,o3取得了96.7%的惊人准确率,几乎以满分屠榜,而o1的成绩仅为83.3%。 在博士级科学问题测试(GPQA Diamond)中,o3得分87.7%,首次超越了人类博士专家的平均水平(70%)。 最为恐怖的是,在衡量编程能力的SWE-bench Verified测试中,o3的准确率达到了71.7%,比o1提升了20%以上,甚至在极难通过的ARC-AGI基准测试(旨在评估真正泛化能力)中,o3在高算力设置下得分87.5%,首次在理论上超越人类表现。

o3之所以能实现如此巨大的跨越,得益于其首创的“私密思维链”(Private Chain of Thought)机制,它允许模型像顶级棋手一样,在内部进行复杂的“心灵演练”,通过搜索、模拟和评估不同的解决方案,最终给出最优解,这种能力不仅让模型更聪明,还催生了一项重要功能:可调节的思考时间,用户可以根据问题的难易程度,选择“低”、“中”、“高”三种推理计算级别,在速度与精度之间自由权衡。

OpenAI官宣最新推理模型o3,迈向会思考的AI新纪元

在发布o3的同时,OpenAI还推出了轻量且成本极低的o3-mini,它支持低、中、高三种推理努力程度,虽然在极致性能上略逊一筹,但胜在响应迅速且极具性价比,非常适合需要快速逻辑分析的日常任务,奥特曼现场甚至用o3-mini写代码,实现了一个python版本的“圣诞老人存在性证明器”,以此展示其编程与逻辑的灵活度。

o3的横空出世也伴随着谨慎,奥特曼在宣布开启安全测试申请时坦言,o3目前尚未正式部署,因为当模型强大到足以在某些测试中超越人类时,对安全对齐的要求就必须提高到前所未有的级别,这既是技术自信的表现,也是对AI伦理的敬畏。

从o1到o3,OpenAI仅用了三个月,这“挤牙膏”式的迭代已变成“火山爆发”式的进化,当AI开始真正“思考”并自我纠错时,我们不仅看到了一个更强大的工具,更窥见了AI作为认知伙伴的未来,正如奥特曼所言:“这在某种程度上象征着一个全新的阶段。”而通往AGI的最后一段阶梯,似乎已在o3低沉的推理回响中,缓缓铺开。

发表评论