当前位置:首页 > DeepSeek技术交流 > 正文内容

新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练

3个月前 (03-26)DeepSeek技术交流202

明敏 发自 凹非寺

量子位 | 公众号 QbitAI

刚刚,DeepSeek官方发布DeepSeek-V3模型更新技术报告。

V3新版本在数学、代码类相关评测集成绩超过GPT-4.5!

而且这只是通过改进后训练方法实现。

DeepSeek-V3-0324和之前的DeepSeek-V3使用同样的base模型。

打破了之前传言该版本base模型是R2的传言。

新版本参数量约为660B,与此前网传的685B有所出入。

开源版本上下文长度为128K(网页端、App和API提供 64K 上下文)。

私有化部署时只需要更新checkpoint和tokenizer_config.json(tool calls相关变动)。

目前,想要体验这一版本模型,只需用户登录官方网页、APP、小程序进入对话界面后,关闭深度思考即可体验。API 接口和使用方式保持不变。

官方建议,此后非复杂推理任务使用V3新版本更好。

此外,官方还进一步展示了新版本在各个维度的能力。

前端开发

生成代码可用性更高,视觉效果也更好。

中文写作

相较于R1版有进一步优化,特别提升了中长篇的内容质量。

比如写一篇关于苏轼生平的散文:

中文搜索

联网情况下,V3新版本的搜索输出内容也更详实准确、排版更清晰美观。

现在写一份3000字的市场报告也是so easy(上下滑动查看完整内容):

此外,V3新版本在工具调用、角色扮演、问答闲聊等方面也进一步提升。

今天白天不少网友也上手实测了诸多能力,比如做个小游戏:

该版本模型采用宽松的MIT开源协议。

且可直接部署在M3 Ultra的Mac Studio上。

这意味着大模型开发应用的门槛更进一步降低。

话不多说,趁着深夜,还没睡的赶紧去体验最新版吧~


原标题:《新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练》


“新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练” 的相关文章

DeepSeek公告:DeepSeek R1网页/API不可用 随后DeepSeek更新状态显示网页故障已恢复

DeepSeek公告:DeepSeek R1网页/API不可用 随后DeepSeek更新状态显示网页故障已恢复

DeepSeek于服务状态页面公告,DeepSeek R1网页/API不可用。(本文来自第一财经)3月20日午间,DeepSeek服务状态页面显示,DeepSeek R1网页/API不可用。随后,De...

DeepSeek鲶鱼效应,掀起AI上车狂潮|封面故事:AI汽车赛道起跑

DeepSeek鲶鱼效应,掀起AI上车狂潮|封面故事:AI汽车赛道起跑

汽车纵横全媒体最近DeepSeek狂潮席卷全球,掀起了新一轮汽车行业企业AI热潮。它打破了传统大模型依赖大算力的路径,加速AI技术普及和普惠。AI赋能汽车全价值链,已成为驱动汽车智能化变革的核心引擎和...

《战争与财政》:DeepSeek重塑全球科技创新竞争格局

《战争与财政》:DeepSeek重塑全球科技创新竞争格局

《战争与财政》 徐一睿 著 浙江人民出版社《战争与财政》一书的诞生,源于我对战争与财政互动关系的长期观察与思考。在历史进程中,战争既是国家权力的博弈场,也是财政体系演进的催化剂。在写作过程中,我尝试探...

量化私募巨头纷纷宣布布局AI大模型,会有新的DeepSeek诞生吗?

量化私募巨头纷纷宣布布局AI大模型,会有新的DeepSeek诞生吗?

作为一名投资者,李萌很久之前就关注到量化私募巨头幻方量化在研究大模型,但是直到今年年初DeepSeek爆火以后,才试用到这款大模型,“原来量化私募做出来的大模型竟然这么好用”。自从DeepSeek爆火...

在DeepSeek老家发新模型,豆包怎么想的?

在DeepSeek老家发新模型,豆包怎么想的?

摘要:尽管研发模型是当前最紧要的任务,但凤凰网科技从豆包内部人士处了解到,内部对应用层的投入同样巨大,“拿的资源不比模型层少”。凤凰网科技 出品作者|徐珍编辑|董雨晴豆包的思考模型终于正式揭开面纱。4...

人工智能赋能职业教育,北京八维集团引入DeepSeek

人工智能赋能职业教育,北京八维集团引入DeepSeek

在科技飞速发展的当下,人工智能(AI)已成为推动各行业变革的核心力量,职业教育领域自然也不例外。北京八维集团作为职业教育的领军者,敏锐洞察到人工智能带来的巨大机遇,近日正式引入先进的大语言模型 Dee...