当前位置:首页 > Deepseek最新资讯 > 正文内容

超越DeepSeek-R1,数学形式化准确率飙升至84% 字节南大开源

3个月前 (07-31)Deepseek最新资讯335

  该框架创新性地将评估模型置于核心位置。通过强化学习训练的CriticLeanGPT模型,能像数学专家一样精准判断形式化代码是否贴合原始语义,配合迭代优化机制,让生成的定理证明既符合语法规范,又忠实于数学逻辑。

  将自然语言描述的数学命题转化为机器可验证的形式化代码(如Lean 4定理),是自动化定理证明领域的基础性难题,其核心挑战不仅在于语法层面的准确转换,更在于对数学语义的深度理解与忠实还原。

  尽管现有研究在生成模型与编译有效性上取得一定进展,但在复杂问题的语义对齐上仍存在显著瓶颈,具体体现在以下三方面:

  CriticLean框架将引入强化学习的 Critic 模型,通过训练专门的语义评价模型(CriticLeanGPT)、结合 Lean 4 编译器反馈进行迭代生成。系统性解决语义对齐、评价可靠性与数据质量问题,为数学自动化形式化提供了全新范式。

  该模型能识别12类常见错误,包括类型错误(占比24.9%)、数学表示错误(23.8%)等,能够发现“代码编译通过但逻辑偏离原题”的隐性问题。

  CriticLeanBench是用于评估模型在数学形式化任务中关键推理能力的基准测试,旨在全面衡量模型将自然语言数学陈述转化为经形式验证的定理声明等方面的表现.

  CriticLeanBench 在数据收集阶段,从多个数据来源选取数学陈述及对应的Lean 4 陈述,提交Lean 4陈述到编译器。1)对于编译失败的语句,随机采样保留编译器反馈信息。2)对于编译成功的部分,通过使用 DeepSeek R1 结合专家校验的方式保留正确和错误的样本(错误的样本保留错误信息)。

  与高度偏斜的 Lean-Workbook 相比,FineLeanCorpus 提供了更透明的批判过程、更高比例的顶级问题,以及更加平衡和多样化的主题分布

  与高度偏斜的 Lean-Workbook 相比,FineLeanCorpus 提供了更透明的批判过程、更高比例的顶级问题,以及更加平衡和多样化的主题分布

  将该框架应用于自动形式化流程,配合Kimina-Autoformalizer-7B生成器,准确率从38%(单轮生成)提升至84%(多轮迭代优化),其中语义评估环节贡献了30个百分点的提升。

  特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。

  中共中央政治局召开会议 决定召开二十届四中全会 分析研究当前经济形势和经济工作 中共中央总书记习近平主持会议

  中共中央政治局召开会议 决定召开二十届四中全会 分析研究当前经济形势和经济工作 中共中央总书记习近平主持会议

标签: deepseek

“超越DeepSeek-R1,数学形式化准确率飙升至84% 字节南大开源” 的相关文章

全球竞相打卡 中国好感度持续攀升

全球竞相打卡 中国好感度持续攀升

  从甲亢哥用镜头展示了中国真实、很现代和充满活力的形象,到无语哥身穿中式服装现身故宫,与观众热情互动……   亿万外国网民通过这些镜头,看到了一个现代、友善、和平、进步...

维尔茨等球星流失!海纳:德甲越发边缘化 拜仁一直是德国队核心

维尔茨等球星流失!海纳:德甲越发边缘化 拜仁一直是德国队核心

  “当然,顶尖球员转会国外对德甲来说总是一种损失;他们对任何联赛都有益。这就是为什么德甲共同寻找解决方案以保持国际竞争力如此重要。如果我们不解决国际化等议题,我们将面临球星和潜力新星外流...

DeepSeek成了硅谷最大的“不能说的秘密”

DeepSeek成了硅谷最大的“不能说的秘密”

  与帕迪·科斯格雷夫(Paddy Cosgrave)刚见面,他就一面展示着他上一秒在DeepSeek上询问的问题一面解释,那些压根不做AI的公司,全在跑DeepSeek的本地化版本。“既...

基于Deepseek的银行客户经理实战陪练AI解决方案,日均节省客户1.5小时精

基于Deepseek的银行客户经理实战陪练AI解决方案,日均节省客户1.5小时精

  当前银行客户经理面临培训模式与实际需求脱节的挑战:传统 AI 陪练侧重督促客户经理记忆产品知识、金融专业知识等内容,难以应对真实业务中复杂的客户沟通、需求挖掘及个性化营销场景。...

闹玩呢!首届大模型对抗赛,DeepSeek、Kimi第一轮被淘汰了

闹玩呢!首届大模型对抗赛,DeepSeek、Kimi第一轮被淘汰了

  在玩游戏方面,到底哪个模型最厉害?为了回答这个问题,谷歌近日发起了首届大模型国际象棋对抗赛。   这个比赛是在一个名叫「Kaggle Game Arena」的平台上进...

10月30日DeepSeek预测:国王vs公牛,武切维奇率队捍卫主场,拉文难救主

10月30日DeepSeek预测:国王vs公牛,武切维奇率队捍卫主场,拉文难救主

  东部劲旅公牛坐镇联合中心迎战西部弱旅国王,目前公牛以3胜0负(胜率100%)高居东部第二,而国王1胜3负(胜率25%)仅列西部第13。此役若公牛取胜将巩固榜首位置,国王若再败则可能跌至...