MiniMax预告旗舰模型M3:稀疏注意力架构,百万Token解码提速15.6倍 - 2109博客
·
上海AI实验室MiniMax预告了其下一代旗舰模型M3,采用突破性的稀疏注意力架构,有望重塑超长上下文AI的经济模型。核心创新是一种自定义稀疏注意力机制,在百万Token解码场景下可实现最高15.6倍的提速,且无需压缩键值状态。
M3核心技术规格:
| 特性 | 详情 |
|---|---|
| 架构 | MiniMax稀疏注意力(MSA) |
| 上下文窗口 | 最高100万Token |
| 解码提速 | 最高15.6倍(@1M tokens) |
| KV缓存 | 无压缩,保留完整精度 |
| 推理成本 | 预计降低90%+ |
| 预训练数据 | 超10万亿Token |
MSA(MiniMax Sparse Attention)的工作原理分为两个阶段:首先由轻量级索引分支扫描输入Token并筛选相关历史Token块,然后仅对这些选中的块执行注意力计算——使用真实、未压缩的KV状态。这种方法不同于当前主流的KV缓存量化或滑动窗口方案,没有召回率损失。

外部开发者预览显示,M3在编程、长文档理解和多轮对话任务中表现显著优于前代M2.5。在百万Token级别的"大海捞针"测试中,M3保持了近乎完美的召回率,而大多数竞品在此长度下已显著退化。
MiniMax尚未公布M3的具体发布日期和定价,但表示将通过API和开源两种方式提供。
来源:2109博客 地址:https://2109.top
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐




所有评论(0)