OpenAI 的 719 数学论文来自对其顾问反对意见的测试
10 月 6 日,OpenAI 将来自一个未发布内部模型的 719 篇数学论文推送至 GitHub。
一周前,其自身的顾问小组曾要求各实验室停止在专有模型上测试高级数学问题。
超过 600 份调查回复塑造了 IAS 小组 9 月 29 日的指导方针
数学与人工智能咨询小组位于新泽西州普林斯顿高等研究院。9月29日,该小组发布了建议,这些建议基于超过600份调查回复。
“我们想从一开始就明确声明:我们不认可这种做法,并要求他们停止在专有模型上测试高级数学问题,”该小组写道。
同一份文件警告称,私有内部模型可能导致一种两级体系,使某些实验室跑在领域其他参与者前面。
OpenAI 在其存储库中表示,作为模型开发的一部分,该公司会在开放研究问题上测试其模型。在其现有数学基准饱和后,它扩展了这些测试。
OpenAI 表示其与小组进行了协商,并借鉴了其关于发布的建议。该小组在 10 月 6 日发布的声明中表示,其顾问角色并非“对 OpenAI 获取这些论文的过程的认可”。
该小组将合规性的裁决权委托给更广泛的数学界。
Navier-Stokes Lean 代码所证明的结论弱于论文中的表述
OpenAI 将 719 篇论文归类为 372 个数学家族,每个家族围绕一个主要结果及其相关证明构建。该公司向专有模型提供了约 4,000 个问题,平均每个结果需要 ChatGPT Pro 约三小时的推理计算时间。
该团队要求 AI 实验室公布每个结果所使用的模型名称、提示词、简化的思维链、耗时以及计算成本。
OpenAI 发布了 10 份推理摘要,其中约 42% 的主要结果附带了 Lean 形式化验证。
Lean 是一种可用于由计算机检查证明过程的编程语言。如果代码编译成功,并不意味着代码与书面论证完全一致;它仅表明形式化陈述是正确的。
亚历山大·巴斯图尼斯、法比安·奇尔切利和安德斯·C·汉森在10月6日发布的一篇论文中考察了这一差距。他们发现,OpenAI的书面纳维-斯托克斯论文所做出的主张,比其Lean代码所证明的要强,且其中一个估计改变了输入导数的阶数。
作者们在 OpenAI 的欧拉(Euler)证明中也发现了类似的误译现象。他们在文中写道:“OpenAI 的书面证明及其他自动形式化的 Lean 证明,不应像其他证明那样,在未经同等同行评审和严格审查的情况下被轻易信任。”
纳维-斯托克斯结果由OpenAI于9月8日宣布。据Cryptopolitan报道,纽约大学数学家特里斯坦·巴克马斯特随后质疑了该工作所涉及的最小人类投入的描述。
该公司承诺为重大 AI 成果相关的研讨会、会议和特别项目提供资金支持。
10月6日,陶哲轩写道,AI提示词工程师往往在解决问题后就对该领域失去兴趣。他写道,许多人无法回答关于该成果的问题或就此发表演讲。他的帖子并未点名OpenAI。
该公司表示,其顾问对其研究进度没有发言权,Cryptopolitan于9月对此进行了报道。
不要只是阅读加密货币新闻,要真正理解它。订阅我们的通讯。 免费。









