当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek超越“开放权重”AI,计划发布源代码

2个月前 (02-25)Deepseek最新资讯132

上个月,DeepSeek 通过发布一个新的、具有竞争力的模拟推理模型,在 AI 领域掀起了轩然大波。该模型可以在 MIT 许可证下免费下载和使用。现在,该公司正准备让这个模型背后的底层代码更加透明,承诺从下周开始发布五个开源代码库。

在周四晚间的社交媒体帖子中,DeepSeek 表示,其计划的"开源周"每日发布将提供对"这些在我们在线服务中的基础模块的可见性,它们已经过文档记录、部署和生产环境的实战测试。作为开源社区的一份子,我们相信每一行共享的代码都将成为推动我们共同前进的动力。"

虽然 DeepSeek 对将要分享的代码类型并未具体说明,但其配套的 GitHub 页面 "DeepSeek Open Infra" 承诺即将发布的内容将涵盖"推动我们这个小小月球计划前进的代码",并"完全透明地分享我们微小但真诚的进展"。该页面还引用了一份 2024 年的论文,详细介绍了 DeepSeek 的训练架构和软件栈。

这一举措可能会加大 DeepSeek 与 OpenAI 之间的差异,后者的市场领先产品 ChatGPT 模型仍然完全专有,其内部运作对外部用户和研究人员来说依然不透明。尽管 DeepSeek 的移动应用因隐私问题面临国际限制,但这次开源发布可能有助于提供更广泛和更便捷的访问途径。

开放究竟有多开放?

DeepSeek 最初的模型发布已经包含了所谓的"开放权重"访问权限,可以访问代表模型数十亿模拟神经元之间连接强度的底层数据。这种发布方式允许终端用户通过额外的训练数据轻松微调这些模型参数,以满足更具针对性的目的。

包括 Google 的 Gemma、Meta 的 Llama,甚至 OpenAI 早期发布的 GPT2 等主要模型都采用了这种开放权重结构。这些模型通常也会发布开源代码,涵盖响应查询时运行的推理时间指令。

目前尚不清楚 DeepSeek 计划的开源发布是否也将包括团队在训练模型时使用的代码。这种训练代码对于满足开源研究所 (OSI) 去年最终确定的"开源 AI"正式定义来说是必需的。根据 OSI 的标准,一个真正开放的 AI 还必须包括"关于用于训练系统的数据的充分详细信息,使得技术熟练的人能够构建一个实质上等效的系统"。

完全开源发布(包括训练代码)可以让研究人员更清楚地了解模型在核心层面是如何工作的,可能揭示出模型架构而非参数权重固有的偏见或局限性。完整的源代码发布还可以让人们更容易从头开始复制模型,如有必要,甚至可以使用全新的训练数据。

Elon Musk 的 xAI 在今年 3 月发布了 Grok 1 的开源推理时间代码版本,最近还承诺在未来几周内发布 Grok 2 的开源版本。但该公司表示,最近发布的 Grok 3 将暂时保持专有状态,仅供 X Premium 订阅用户使用。

本月早些时候,HuggingFace 在 OpenAI 发布专有的 "Deep Research" 功能几小时后就发布了其开源克隆版本。HuggingFace 的 Aymeric Roucher 告诉 Ars Technica,该克隆版本在发布时使用闭源权重模型"仅仅是因为它运行良好",但源代码的"开放管道"可以根据需要轻松切换到任何开放权重模型。


“DeepSeek超越“开放权重”AI,计划发布源代码” 的相关文章

DeepSeek应用基础篇:从入门到基本实操(附12个案例与分析)

DeepSeek应用基础篇:从入门到基本实操(附12个案例与分析)

DeepSeek,自2025年春节横空出世,惊艳全球。应时而动,我们积极应用AI,学习DeepSeek提升人机交互协同工作,从而降本增效,高效完成工作。郭朝刚:撰写此篇,作为DeepSeek初学者入门...

通达海已经接入DeepSeek-R1并持续进行模型优化

通达海已经接入DeepSeek-R1并持续进行模型优化

每经AI快讯,有投资者在投资者互动平台提问:董秘你好:2025年2月11日投资者关系活动记录表中说:公司已经接入DeepSeek大模型进行相关产品测试和适配,也取得一定效果。到目前是否已经成功接入了。...

“DeepSeek宿州版”部署上线

“DeepSeek宿州版”部署上线

 日前,在宿州市大数据公司子公司宿州市广云智算科技有限公司建设的淮海智算中心,随着大模型完成本地化部署并上线,国内领先的人工智能大模型正式登陆云都宿州,为助力高质量发展打开了人工智能应用之门。  De...

全国人大新闻发布会:DeepSeek等公司兴起,展现中国科技发展创新性和包容性

全国人大新闻发布会:DeepSeek等公司兴起,展现中国科技发展创新性和包容性

十四届全国人大三次会议今天(3月4日)在人民大会堂举行新闻发布会,大会发言人娄勤俭就大会议程和人大工作相关问题回答中外记者提问。在回答人工智能发展相关问题时,娄勤俭表示,DeepSeek公司取得的重大...

腾讯云:腾讯地图等四款产品接入DeepSeek

腾讯云:腾讯地图等四款产品接入DeepSeek

每经快讯,2月17日,腾讯云公布接入DeepSeek新进展:腾讯云AI代码助手、腾讯元器、腾讯乐享和腾讯地图四款产品已接入DeepSeek。其中,腾讯云AI代码助手和腾讯元器全免费、不限量开放;腾讯乐...

签约6个亿:中国电信董事长柯瑞文谈DeepSeek的高性能、低成本、轻量化和开源为人工智能发展提供前所未有发展机遇

签约6个亿:中国电信董事长柯瑞文谈DeepSeek的高性能、低成本、轻量化和开源为人工智能发展提供前所未有发展机遇

 【通信产业网讯】(记者 崔亮亮)3月25日,中国电信(601728)举行2024年度业绩说明会。针对人工智能对今后增长的提问,中国电信董事长柯瑞文表示,DeepSeek的高性能、低成本、轻量化和开源...