DeepSeek打破大模型「不可能三角」:更强、更快、还更便宜
2026-09-10 15:05:20
币界网消息,DeepSeek宣布其v4.1 flash版本打破了大模型的「不可能三角」,实现了更强、更快和更便宜的目标。该模型主干参数达到5520亿,并外挂1960亿参数的engram条件记忆。预训练使用了45万多模态token,后训练则加入了真实agent任务和失败案例。DeepSeek v1.1的性能达到74.2%,超过了Claude Opus 5和GPT-5.6 SOL。新架构将40层模型拆分为前后两半,读取时每个token仅激活80亿参数,生成时激活160亿参数,且上下文长度从4k扩展至1m,计算量仅增加约四分之一。此外,DeepSeek通过将主缓存改为fp4和跨层复用,将每个token的全局kv降至890字节,约为v4 flash的1/4。
来源:互联网
本内容只为提供市场信息,不构成投资建议。
关注币界网官方账号,及时关注最新动态









