当前位置:首页 > DeepSeek技术交流 > 正文内容

DeepSeek 又上新!DeepGEMM 发布,有哪些突破点值得一看?

7个月前 (02-26)DeepSeek技术交流515

一开始,我还以为 DeepSeek 会走传统路线,比如大厂常见的蒸馏技术,搞个小参数的 Flash 模型。毕竟这种方法能有效降低计算需求,但缺点也很明显,就是小模型再怎么优化,和大模型比起来,性能还是会有损失 结果 DeepSeek 完全没按套路出牌,它不是去压缩模型,而是换了个角度,直接假设未来算力足够,然后想办法更高效地用好现有显卡架构。换句话说,不是缩小参数规模,而是在同等规模下优化计算方式,让计算更具性价比 这种思路比纯工程优化要“硬核”得多。一般来说,搞小模型是比较务实的工程方案,但 DeepGEMM 这种技术驱动的做法更有延展性。它不仅和小模型方法兼容,而且即使以后显卡更强、模型规模更大,这套技术依然能继续用,不会过时

“DeepSeek 又上新!DeepGEMM 发布,有哪些突破点值得一看?” 的相关文章

启明创投创始人:中国创新药的“DeepSeek时刻”

启明创投创始人:中国创新药的“DeepSeek时刻”

中国AI DeepSeek引爆全球,但生物技术领域正在发生一场更为静默的革命。曾经生产仿制药的中国制药公司,现在正崛起成为快速、高效的药物发现领域的全球领导者。近日,资本市场关注到了创新药领域的这场革...

科研加速器:用DeepSeek一天精读80篇文献的30个实用指令

科研加速器:用DeepSeek一天精读80篇文献的30个实用指令

在科研与学习中,快速高效地阅读和理解大量文献是至关重要的能力。借助DeepSeeK这一强大的AI助手,我们可以将文献阅读效率提升至全新水平。以下是30个精心设计的指令,助您充分利用DeepSeeK高效...

科蓝软件:已成功将DeepSeek-R1模型整合至公司魔聚平台

科蓝软件:已成功将DeepSeek-R1模型整合至公司魔聚平台

人民财讯3月5日电,科蓝软件(300663)3月5日在互动平台表示,公司已成功将DeepSeek-R1模型整合至公司的人工智能应用平台——魔聚平台。具体来说,魔聚平台成功部署并全面投入使用了DeepS...

田间赋诗的沂蒙农民大姐吕玉霞也用过DeepSeek “有人质疑诗是DeepSeek写的 它写的话肯定会更华丽一些”

田间赋诗的沂蒙农民大姐吕玉霞也用过DeepSeek “有人质疑诗是DeepSeek写的 它写的话肯定会更华丽一些”

齐鲁网·闪电新闻3月14日讯 3月14日(采访时间),山东临沂。近日,“70后”农民大姐沂蒙二姐”吕玉霞在田间创作诗歌的视频火了。吕玉霞提到,自己有不懂的字词也会通过DeepSeek学习,但在创作上,...

全市首个!大兴人才服务平台用上DeepSeek大模型

全市首个!大兴人才服务平台用上DeepSeek大模型

4月14日,记者从北京电信获悉,公司在大兴区上线了全市首个基于DeepSeek大模型的人工智能人才服务AI助手,开创“AI+政务”服务新模式。只需输入关键词,用户就能与AI助手展开对话,找政策、办手续...

DeepSeek高校上线,智能“助教”为师生深度思考赋能

DeepSeek高校上线,智能“助教”为师生深度思考赋能

国产AI大模型DeepSeek(深度求索)的风,已经吹到了高校。近日,中国人民大学、北京师范大学、北京交通大学等多所高校发布消息,表示正在探索开展有关DeepSeek的实践应用,部分高校已在自主研发的...