MiniMax-01:为 AI Agent 时代打造的开源 4M Token LLM
一款 4560 亿参数的 MoE,搭载 Lightning Attention 和 4M token 上下文——这就是它对 agent 构建者重要的原因

大多数“长上下文”模型的工作记忆仍然只在几十万 token 的量级。MiniMax-01 直接把它提升到了“百万”级别。它是中国 AI 公司 MiniMax 推出的新一代开源基础模型系列,围绕超长上下文、高效注意力和 AI-agent 工作负载设计——单次推理可支持高达 400 万 token。(arXiv)
本指南将拆解 MiniMax-01 到底是什么、支撑其上下文窗口的 Lightning Attention 架构、它的基准表现、价格、与其他长上下文模型相比的优劣,以及构建者如何将它应用到 Eigent 这样的 agent 平台中。
什么是 MiniMax-01?
MiniMax-01 是一个模型系列,而不是单一模型。它包括 MiniMax-Text-01,一款面向文本和工具的大语言模型,以及 MiniMax-VL-01,一个在同样骨干网络上增加视觉理解能力的多模态变体。(arXiv)
这两个模型都以 GitHub 和 Hugging Face 上的开源权重形式提供,同时也可以通过 MiniMax 自有 API 以及 Hailuo AI 等合作平台调用——开发者可以在自托管和托管访问之间自由选择。(GitHub)
如果你关注过 MiniMax 后续的发布,这就是其模型谱系的基础。我们在 Eigent Meets MiniMax M2.1 中实测了这个家族里更近期的成员;MiniMax-01 则是这一家族中长上下文能力的源头。
亮点功能:4M Token 上下文窗口
MiniMax-01 之所以受到关注,主要原因在于它的 推理阶段上下文窗口最高可达 400 万 token——大约是当前大多数前沿生产模型的 20–32 倍。MiniMax-Text-01 在最长 100 万 token 的序列上训练,并在推理阶段外推到 400 万,同时仍保持有竞争力的表现。(DeepNet)
从实际应用看,这意味着你可以把 整个代码库、多本书的语料,或大型文档库放进一个单一上下文窗口,而不必依赖 RAG 进行频繁、激进的分块和检索。在 4M token 的 Needle-in-a-Haystack 等长上下文基准上,MiniMax-01 据称能达到 接近完美的检索准确率,并且随着序列长度增长几乎没有明显退化。(VentureBeat)
内部原理:4560 亿参数 + Lightning Attention
MiniMax-Text-01 是一款 4560 亿参数的 Mixture-of-Experts(MoE)模型,借助 top-2 MoE 路由,每个 token 激活 459 亿参数。从架构上看,它融合了三个关键组成部分:(Open Laboratory)
- Lightning Attention —— 一种线性时间注意力变体,相比标准的二次复杂度自注意力,它对序列长度的扩展要平滑得多。(Neurohive)
- Softmax attention blocks —— 周期性插入(大约每 8 层 1 次),用于保持高质量的全局检索和推理能力。(Model Card)
- 带优化并行性的 MoE —— 32 个专家、all-to-all 通信、varlen ring attention,以及定制 CUDA kernels,让数百万 token 级别的上下文在计算上变得可行。(arXiv)
正是这种混合设计,让 MiniMax 能够宣称 100 万 token 的训练序列和 400 万 token 的推理能力都能以“可负担”的成本实现,同时在广泛的文本基准上仍能与 GPT-4o 和 Claude 3.5 Sonnet 持平甚至更强。(VentureBeat)
多模态:用于视觉语言任务的 MiniMax-VL-01
在文本模型之上,MiniMax 还发布了 MiniMax-VL-01,这是一个多模态变体,将 Vision Transformer 编码器与 Text-01 骨干网络结合。图像会在不同分辨率网格上动态缩放并转化为 patch tokens,然后通过轻量级 MLP 投影到语言模型中——这与其他现代 VLM 类似。(Open Laboratory)
MiniMax-VL-01 经过分阶段训练——视觉预训练、对齐和联合微调——因此不仅支持 文档理解、UI/截图理解以及多模态推理,也不只是图像描述。对于需要读取 PDF、仪表盘和产品 UI 的 AI agent 团队来说,这使 MiniMax-01 成为一个 同时覆盖文本与视觉的单一家族,并采用开源权重许可。(Adam Holter)
性能:MiniMax-01 表现如何?
在技术报告和早期报道中,MiniMax 将 MiniMax-01 定位为在标准推理、编程和语言基准上与 GPT-4o 和 Claude 3.5 Sonnet 具有可比性——而在长上下文测试上则更具优势。第三方分析指出,MiniMax-01:(Neurohive)
- 在 RULER 风格的长上下文基准上保持高分(约 0.91–0.96),覆盖从几千 token 到 100 万 token 的不同长度。(Neurohive)
- 在 4M token 的 Needle-in-a-Haystack 检索中达到 100% 准确率,而其他模型在极端长度下会显著退化。(VentureBeat)
- 在编程和推理任务上与许多开源和闭源模型表现相当甚至更好——在多项测试中经常能匹敌 DeepSeek V3,并击败 Llama 3.1。(YouTube)
对于主要以 短上下文聊天或小段代码 评估模型的团队来说,MiniMax-01 的体感会与其他前沿级 LLM 大体相似。它真正的差异化优势会在你开始处理 长文档、大型代码库,或包含大量工作集的多步 agent 工作流 时显现出来。(arXiv)
价格与成本效率
虽然 MiniMax-01 是开源权重,但很多开发者会先通过 API 使用。早期生态文档和评测显示,MiniMax-01 的 API 价格约为每百万输入 token $0.2、每百万输出 token 约 $1.1–1.2——显著低于典型的 GPT-4 级别定价。(Puter)
结合线性时间的 Lightning Attention 和 MoE 带来的效率收益,MiniMax-01 对于 agentic 和长上下文工作负载 尤其有吸引力,因为这些场景的 token 消耗会迅速膨胀(例如全仓库分析、数小时会议日志等)。对于愿意自托管的团队,GitHub 和 Hugging Face 上的开源权重让你可以使用自己的 GPU 和推理栈,从而获得更强的成本控制。(vLLM)
为什么 MiniMax-01 对 AI Agent 很重要
MiniMax-01 真正出彩的地方,是作为 AI agent 的底座,尤其是在当前上下文碎片化已经成为瓶颈的场景中:
- 全仓库代码 agent —— 将 monorepo 的大部分或全部内容加载到单一 prompt 中,跨文件推理依赖关系,并在持续运行的重构或迁移计划中保持上下文,而不必不断重新填充上下文。(VentureBeat)
- 文档密集型 copilot —— 将整本政策手册、多本知识库或多年内部文档直接放入上下文,实现高保真、无需检索的推理。(Adam Holter)
- 研究与分析 agent —— 让一个 agent 同时在内存中容纳数十个 PDF、论文和数据集,降低 RAG 流水线与工具编排的复杂度。(arXiv)
由于 MiniMax-01 同时具备开源和 API 托管两种形态,它非常适合 混合架构:先用托管 API 做原型,等工作负载稳定后,再把热点路径迁移到与 vLLM 等框架集成的自托管集群。(Puter)
MiniMax-01 与其他长上下文 LLM 相比如何?
如果你已经熟悉 Gemini 1.5 Pro、Claude 3.5、DeepSeek 或 Qwen 等长上下文模型,MiniMax-01 处在一个很有意思的竞争位置:
- 对比 Gemini 1.5 Pro —— Gemini 1.5 支持最高 200 万 token;MiniMax-01 将其翻倍至 400 万,而且是开源权重,而不是纯 API 绑定。(arXiv)
- 对比 Claude 3.5 —— Claude 强调安全性、对齐和工具使用体验;MiniMax-01 则聚焦于原始上下文长度和高性价比扩展,通用能力相近,但更偏基础设施、也更适合自托管。(Neurohive)
- 对比 DeepSeek / Qwen —— 两者都提供了强大的开源权重模型,但 MiniMax-01 目前在极端上下文长度上领先,这在一定程度上得益于 Lightning Attention 和深度 MoE 优化。(VentureBeat)
对于大多数产品团队来说,问题不是“MiniMax-01 还是其他全部模型?”而是 哪个模型最适合每一种工作负载 —— 而 MiniMax-01 对于 agent 后端来说是尤其强的候选,因为 500K–4M token 的上下文能显著简化系统设计。这个逻辑也适用于其他开源权重、长上下文的新进入者,例如 Zhipu 的 GLM-5.2:更优的做法是把每个任务路由到最合适的模型,而不是把整个技术栈押注在单一模型上。
如何开始使用 MiniMax-01
如果你今天就想尝试 MiniMax-01,可以走几条直接的路径:
- 体验托管演示和 API。 Hailuo AI 和 MiniMax 自有平台都通过类似聊天的界面和 API 提供 MiniMax-01,并提供免费或低成本套餐用于试验。(Hailuo AI) 其他第三方平台也将其列入支持范围,提供即开即用的 playground 和标准 OpenAI 风格 API。(Together AI)
- 运行开源权重。 从 GitHub 或 Hugging Face 下载 MiniMax-Text-01 和 MiniMax-VL-01,官方仓库和 model card 中包含规格、许可证和使用示例。(GitHub) 随着支持逐步落地,你可以接入 vLLM 等推理框架,或者根据官方实现中的 Lightning Attention 定制 CUDA kernels,以获得最高效率。(vLLM)
- 先从一个具体的长上下文用例开始。 先把一个单独的 agent——例如“全仓库重构助手”或“公司政策顾问”——迁移到 MiniMax-01,作为试验场,再决定是否将整个技术栈切换过去。
MiniMax-01 是否已准备好用于生产?
MiniMax-01 之所以重要,是因为它 重新定义了“长上下文”的边界——而且它以面向 AI agent 的开源权重形式出现,而不仅仅是聊天机器人。4M token 上下文、4560 亿参数 MoE、Lightning Attention 和有竞争力的定价组合在一起,使它成为下一代自主系统和 AI 同事平台最有吸引力的底座之一。(Neurohive)
如果你正在构建 AI agent、开发工具或工作流 copilot,MiniMax-01 值得与你现有的 GPT-4 级和 DeepSeek 基线一起进行认真基准测试。最大的收益会出现在 上下文限制——而不是原始推理质量——才是当前瓶颈 的地方。(arXiv)
这正是 模型无关、支持多 agent 的基础设施 的典型场景。模型格局变化很快,真正赢的会是那些能够在合适的工作负载上接入像 MiniMax-01 这样的模型、同时又无需重构整个技术栈的平台。如果这正是你正在搭建的基础设施,欢迎了解开源的多 agent 平台 Eigent,看看它如何帮助你在真实业务流程中编排专用模型。
常见问题
什么是 MiniMax-01?
MiniMax-01 是 MiniMax 推出的开源基础模型系列,面向超长上下文和 AI-agent 工作负载。它包括 MiniMax-Text-01(一个 4560 亿参数的 Mixture-of-Experts LLM,每个 token 约激活 459 亿参数)以及 MiniMax-VL-01(一个增加视觉能力的多模态变体)。权重可在 GitHub 和 Hugging Face 上获取。
MiniMax-01 的上下文窗口有多长?
MiniMax-01 在推理阶段最高支持 400 万 token 的上下文窗口——大约是大多数生产中的前沿模型的 20–32 倍。MiniMax-Text-01 在最长 100 万 token 的序列上训练,并在推理阶段外推到 400 万,同时保持有竞争力的表现。
什么是 Lightning Attention?
Lightning Attention 是一种线性时间注意力变体,相比标准的二次复杂度自注意力,它对序列长度的扩展要平滑得多。MiniMax-01 将它与周期性的 softmax attention blocks 交错使用(大约每 8 层 1 次),以在保持全局检索和推理质量的同时,让数百万 token 的上下文在计算上可行。
MiniMax-01 是开源的吗?
是的。MiniMax-Text-01 和 MiniMax-VL-01 都以开源权重形式在 GitHub 和 Hugging Face 上发布,并附有官方 model card 和许可证。MiniMax 也通过自有平台和 Hailuo AI 等合作伙伴提供托管 API 访问,因此你可以选择自托管或使用托管端点。
MiniMax-01 多少钱?
早期生态定价显示,MiniMax-01 通过 API 的费用约为每百万输入 token $0.2、每百万输出 token 约 $1.1–1.2——明显比典型 GPT-4 级模型更便宜。自托管开源权重还能让你在自己的 GPU 上获得更强的成本控制。
我可以在 Eigent 中使用 MiniMax-01 吗?
可以。Eigent 的模型无关、多 agent 架构允许你通过其 MCP tools 和 Skills framework 将任务路由到 MiniMax-01——利用它的 4M token 上下文处理全仓库和文档密集型工作,同时让其他模型承担日常任务。
Recent Posts

ChatGPT in Chrome: Side Chat, Open Tabs, and Browser History Explained
ChatGPT now works inside Chrome with a Side Chat, open-tab context, YouTube and highlight-to-ask, plus desktop URL suggestions and browser history — here's how.

Claude Opus 5:以一半成本实现接近前沿的智能
Claude Opus 5 以 Fable 5 一半的成本提供接近前沿的智能,并配备努力调节旋钮,可用计算量换取节省。规格、定价及对智能体的影响。

Cursor 替代品(免费且开源):属于你自己的工作空间
在 SpaceX 收购事件后,正在寻找免费开源 Cursor 替代品?对比成本、自托管、模型选择和数据驻留方案,并了解迁移路径。