最强模型正式发布
具有品牌史上最强能力的GPT-6 Astra模型, 由OpenAI推出, 官方声称它是全球顶尖智能生成式AI, 且具有最优对齐效果, 此模型于美国德州超算基地完成训练, 动用超过10万张GPU, 规模极其庞大。
这还是头一回, 大规模运用前代模型, 参与监督训练的旗舰产品。这表明新版本的学习方式, 出现了重大突破,并非全然依靠传统的训练路径, 而是凭借前辈的经验, 来提高自身能力啦。
硬核数学测试登场
Epoch AI跟曼彻斯特大学一块儿发布了Erdős基准测试, 这测试是专门用以检验AI真实解题能力的, 测试涵盖68道人类一直到现在都没解出来的数学难题, 不存在标准答案, 将杜绝“背答案”这种可能。
所有模型皆于统一条件之下竞赛, 即有着300美元运算能力预算, 以及为其设定的72小时时间限制, 所需予以输出的证明必须借助Lean这种形式化验证方式, 由程序自动核查其中的对错这种规则保证了每个模型均能处于同一起跑水平之上。
五道难题被攻克
进行这场测试时, GPT – 6 Astra摇身变为那惟一交卷的大模型, 一下子成功攻克了5道历时长久都未能破解的猜想, 而其他四款主流AI, 其中涵盖GPT – 5.6以及Fable 5.1, 全部都得了零分。
其当中含有, 1931年时, Erdős18岁之际所提出的解离集猜想, 这属于他自我宣称“人生第一个正经问题”的相关研究, 另外还存在一座极端值图论范畴的著名题目, 也就是Erdős – Sós猜想, 而这些诸多题目, 困扰了无数顶尖数学家长达数十年之久。
解题成本有多高
GPT – 6 Astra对这五道题展开了全部的尝试, 总计消耗的算力超过了22万美元, 其中标准基准测试自身花费大概2万美元, 若按照每次300美元的预算以及3%的成功率来算, 解出一道关键开放问题的期望成本约是1万美元。
这一数据并非算低价范畴, 且得以表明人工智能正凭借可做预想的成本朝着人类最难予以攻克的学术坚固壁垒靠近, 往昔需历经数十年进行研究的数学难题, 当下能够借助算力通过快速尝试错误的方式解决。
局限依然存在
论文还表明了模型存在的缺陷, 即它有可能构思出正确的想法, 然而却没办法转化成Lean形式的证明, 形式化验证对于逻辑严谨性有着极高的要求, 就这一环节而言, 对AI来讲仍然存有不小的困难。
此外, 68道题目当中, 有63道尚未被解开。基准测试仅仅考查解题的能力, 然而数学研究同样重视提出全新的问题。所以即便宣称AGI时代已然来临, 距离全面攻克高阶数学仍有很长的一段路程要走。
我们该如何看待
数学领域里, AI达成的突破着实让人感到振奋不已, 然而它并非是无所不能的。它具备解答题目的能力, 可是不一定能够探寻到全新的方向;它能够查验并佐证, 然而不一定可以提出全新的问题。数学研究的关键要点在于创造力, 而这恰好是机器最为难以去复制的部分。
在你看来, 人工智能最终会不会替代数学家所扮演的角色呢? 欢迎于评论区域分享你的见解, 进行点赞操作, 并进而分享给更多对人工智能予以关注的友人。