当前位置:首页 > DeepSeek技术交流 > 正文内容

DeepSeek 又上新!DeepGEMM 发布,有哪些突破点值得一看?

4个月前 (02-26)DeepSeek技术交流226

一开始,我还以为 DeepSeek 会走传统路线,比如大厂常见的蒸馏技术,搞个小参数的 Flash 模型。毕竟这种方法能有效降低计算需求,但缺点也很明显,就是小模型再怎么优化,和大模型比起来,性能还是会有损失 结果 DeepSeek 完全没按套路出牌,它不是去压缩模型,而是换了个角度,直接假设未来算力足够,然后想办法更高效地用好现有显卡架构。换句话说,不是缩小参数规模,而是在同等规模下优化计算方式,让计算更具性价比 这种思路比纯工程优化要“硬核”得多。一般来说,搞小模型是比较务实的工程方案,但 DeepGEMM 这种技术驱动的做法更有延展性。它不仅和小模型方法兼容,而且即使以后显卡更强、模型规模更大,这套技术依然能继续用,不会过时

“DeepSeek 又上新!DeepGEMM 发布,有哪些突破点值得一看?” 的相关文章

为什么作家阿来不用DeepSeek

为什么作家阿来不用DeepSeek

日前,作家、四川省作家协会主席阿来亮相复旦大学,在“人是出发点,也是目的地”主题研讨会间隙接受文汇报记者专访。原标题:《为什么作家阿来不用DeepSeek》...

建筑业真要洗牌了!中建三局已应用DeepSeek管理工程,取代人力更高效!

建筑业真要洗牌了!中建三局已应用DeepSeek管理工程,取代人力更高效!

源自丨中建三局近日,中央广播电视总台《新闻直播间》栏目播出《科技推动力·大模型“智”在何方》特别策划,其中1分多钟重点报道了中建三局系列平台产品创新应用AI大模型,为建筑业提供更多“数字方案”,探访揭...

DeepSeek爆火的启示:中国如何培植创新基因?

DeepSeek爆火的启示:中国如何培植创新基因?

“深度求索(DeepSeek)将来怎么样不得而知,但它的横空出世至少告诉世界,中国很多‘小角落’能够爆发出大能量。”在近日由盘古智库举办的研讨会上,谈及正以破圈之势引起全球巨震的国产AI大模型Deep...

天翼云加载DeepSeek应用助力区域智能升级

天翼云加载DeepSeek应用助力区域智能升级

DeepSeek作为国内AI大模型领域的重要参与者,通过技术创新和算法优化,推动了AI技术的快速发展。目前,中国电信云南公司在天翼云产品线完成DeepSeek的部署接入,为行业提供性能卓越、安全可控的...

中华保险接入Deepseek大模型 实现技术新突破

中华保险接入Deepseek大模型 实现技术新突破

近日,中华保险旗下中华财险宣布已完成基于国产大模型DeepSeek的本地化部署,标志着其在保险科技领域的进一步突破。此次部署不仅是技术上的升级,更是中华保险旗下中华财险在数字化转型中的重要一步。未来,...

DeepSeek大火,有人惊喜有人忧——突飞猛进的AI会取代人类创作吗?

DeepSeek大火,有人惊喜有人忧——突飞猛进的AI会取代人类创作吗?

春节期间,对大众来说最惊喜的有二:一个是《哪吒2》,另一个是DeepSeek。DeepSeek一问世就以其卓越的逻辑推理能力和多模态理解能力崭露头角,再次刷新了人们对AI的认知。尤其是DeepSeek...