上海AI实验室MiniMax预告了其下一代旗舰模型M3,采用突破性的稀疏注意力架构,有望重塑超长上下文AI的经济模型。核心创新是一种自定义稀疏注意力机制,在百万Token解码场景下可实现最高15.6倍的提速,且无需压缩键值状态。

M3核心技术规格:

特性 详情
架构 MiniMax稀疏注意力(MSA)
上下文窗口 最高100万Token
解码提速 最高15.6倍(@1M tokens)
KV缓存 无压缩,保留完整精度
推理成本 预计降低90%+
预训练数据 超10万亿Token

MSA(MiniMax Sparse Attention)的工作原理分为两个阶段:首先由轻量级索引分支扫描输入Token并筛选相关历史Token块,然后仅对这些选中的块执行注意力计算——使用真实、未压缩的KV状态。这种方法不同于当前主流的KV缓存量化或滑动窗口方案,没有召回率损失。

外部开发者预览显示,M3在编程、长文档理解和多轮对话任务中表现显著优于前代M2.5。在百万Token级别的"大海捞针"测试中,M3保持了近乎完美的召回率,而大多数竞品在此长度下已显著退化。

MiniMax尚未公布M3的具体发布日期和定价,但表示将通过API和开源两种方式提供。

来源:2109博客 地址:https://2109.top

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐