当前位置:首页 > Deepseek应用场景 > 正文内容

DeepSeek-Prover-V2:AI 数学推理新王者,88.9% 通过率设新标杆

1个月前 (05-01)Deepseek应用场景139

IT之家 5 月 1 日消息,深度求索(DeepSeek)昨日(4 月 30 日)在 AI 开源社区 Hugging Face 上,发布名为 DeepSeek-Prover-V2-671B 的新模型,随后在 GitHub 等平台上公布了论文信息。

IT之家援引论文介绍,DeepSeek-Prover-V2 是一款专注于形式化数学推理的开源大型语言模型,基于 DeepSeek-V3-0324,通过递归定理证明管道生成初始数据。

Deepseek 推出了 DeepSeek-Prover-V2-671B(结合 V3 基础大模型)、DeepSeek-Prover-V2-7B(增强模型)两个模型,以及 DeepSeek-ProverBench 数据集。

DeepSeek-Prover-V2-671B 采用和 DeepSeek V3-0324 相同的架构,并非用于常规对话或者推理,而是用于形式化定理证明、专门增强数学能力的模型。

DeepSeek 团队首先引导 DeepSeek-V3 模型将复杂定理分解为一系列子目标(subgoals),整合非形式与形式化数学推理,在 Lean 4 平台上形式化证明步骤。

接着,利用一个较小的 7B 参数模型处理子目标的证明搜索,减轻计算负担。最终,结合完整的逐步证明与 DeepSeek-V3 的思维链(chain-of-thought),形成强化学习的“冷启动”数据。

在训练中,团队筛选出一批 7B 模型无法直接解决但子目标已被证明的难题。通过整合子目标证明,形成完整的形式化证明,并与 DeepSeek-V3 的推理过程对接,生成合成数据。

随后,模型微调这些数据,并通过强化学习进一步提升能力,以二元反馈(正确或错误)作为奖励机制。最终,DeepSeek-Prover-V2-671B 在神经定理证明领域创下新高,在 MiniF2F-test 数据集上通过率达 88.9%,在 PutnamBench 数据集中解决 658 个问题中的 49 个。

团队还发布了 ProverBench 基准数据集,包含 325 个形式化数学问题。其中,15 个问题源自近期 AIME 竞赛(AIME 24 和 25),涉及数论与代数,代表高中竞赛难度。

其余 310 个问题则来自精选教材和教学内容,涵盖线性代数、微积分、概率等多个领域。这一数据集旨在为高中竞赛和本科数学提供全面评估标准,推动模型在多样化场景下的测试与应用。

相关阅读:

《DeepSeek-Prover-V2-671B 新模型开源发布》


“DeepSeek-Prover-V2:AI 数学推理新王者,88.9% 通过率设新标杆” 的相关文章

中国电信助力泗县人民医院接入DeepSeek 智慧医疗扬帆起航

中国电信助力泗县人民医院接入DeepSeek 智慧医疗扬帆起航

3月1日,中国电信安徽泗县分公司携手泗县人民医院,将DeepSeek本地化部署智能医疗系统正式接入该医院,标志着该医院在智慧医疗领域迈出了重要一步。DeepSeek的引入将全面提升医院的诊疗效率、患者...

法律服务平台+DeepSeek!AI引领法律服务全面升级——大安市司法局打造智慧司法新标杆

法律服务平台+DeepSeek!AI引领法律服务全面升级——大安市司法局打造智慧司法新标杆

为满足群众日益增长的法治服务需求,大安市司法局率先引入DeepSeek人工智能技术,全面革新公共法律服务、普法宣传、人民调解等核心业务,推出公共法律服务掌上平台覆盖线上、公共法律服务智能终端覆盖线下,...

辽宁12345正式接入DeepSeek

辽宁12345正式接入DeepSeek

近日,辽宁12345热线平台系统已正式接入DeepSeek,通过双引擎智能驱动架构,形成“前端智能交互—中台智能治理—后台智能分析”的闭环管理体系。据了解,辽宁12345热线平台系统在接入DeepSe...

AMD与清醒异构推出免费体验版DeepSeek AI系统测试平台

AMD与清醒异构推出免费体验版DeepSeek AI系统测试平台

IT时报记者郝俊慧近日,AMD-清醒异构人工智能应用联合实验室发布AMD ROCm原生的AI系统测试体验平台。用户免费注册后,只需上传简单的训练素材文件,就可以体验DeepSeek等主流开源大模型的能...

市妇联发布《DeepSeek+妇女工作操作指南》

市妇联发布《DeepSeek+妇女工作操作指南》

随着人工智能时代的到来,“DeepSeek+政务”模式逐渐成为热潮,但如何安全高效用好AI工具,平衡好政务服务的“精度”与“温度”,又是一个崭新的难题。5月13日,杭州市妇联正式发布《DeepSeek...

全市首个!大兴人才服务平台用上DeepSeek大模型

全市首个!大兴人才服务平台用上DeepSeek大模型

 为深入推进北京高水平人才高地建设,进一步提升地区人才宣传服务质量,创新打造区级独立人才服务宣传综合展示平台,全面实施“求贤、集贤、礼贤”三大人才工程,努力实现人才服务“随时查”“掌上办”,助力区域产...