logo
  • 环境
  • 企业版
  • 价格
Blogs
行业|Jun 18, 2026

MiniMax-01:为 AI Agent 时代打造的开源 4M Token LLM

一款 4560 亿参数的 MoE,搭载 Lightning Attention 和 4M token 上下文——这就是它对 agent 构建者重要的原因

Douglas LaiDouglas Lai
Share to
MiniMax-01:为 AI Agent 时代打造的开源 4M Token LLM
  • 什么是 MiniMax-01?
  • 亮点功能:4M Token 上下文窗口
  • 内部原理:4560 亿参数 + Lightning Attention
  • 多模态:用于视觉语言任务的 MiniMax-VL-01
  • 性能:MiniMax-01 表现如何?
  • 价格与成本效率
  • 为什么 MiniMax-01 对 AI Agent 很重要
  • MiniMax-01 与其他长上下文 LLM 相比如何?
  • 如何开始使用 MiniMax-01
  • MiniMax-01 是否已准备好用于生产?
  • 常见问题
Automate Everything with
AI Workforce on Desktop
Download Eigent

大多数“长上下文”模型的工作记忆仍然只在几十万 token 的量级。MiniMax-01 直接把它提升到了“百万”级别。它是中国 AI 公司 MiniMax 推出的新一代开源基础模型系列,围绕超长上下文、高效注意力和 AI-agent 工作负载设计——单次推理可支持高达 400 万 token。(arXiv)

本指南将拆解 MiniMax-01 到底是什么、支撑其上下文窗口的 Lightning Attention 架构、它的基准表现、价格、与其他长上下文模型相比的优劣,以及构建者如何将它应用到 Eigent 这样的 agent 平台中。

什么是 MiniMax-01?

MiniMax-01 是一个模型系列,而不是单一模型。它包括 MiniMax-Text-01,一款面向文本和工具的大语言模型,以及 MiniMax-VL-01,一个在同样骨干网络上增加视觉理解能力的多模态变体。(arXiv)

这两个模型都以 GitHub 和 Hugging Face 上的开源权重形式提供,同时也可以通过 MiniMax 自有 API 以及 Hailuo AI 等合作平台调用——开发者可以在自托管和托管访问之间自由选择。(GitHub)

如果你关注过 MiniMax 后续的发布,这就是其模型谱系的基础。我们在 Eigent Meets MiniMax M2.1 中实测了这个家族里更近期的成员;MiniMax-01 则是这一家族中长上下文能力的源头。

亮点功能:4M Token 上下文窗口

MiniMax-01 之所以受到关注,主要原因在于它的 推理阶段上下文窗口最高可达 400 万 token——大约是当前大多数前沿生产模型的 20–32 倍。MiniMax-Text-01 在最长 100 万 token 的序列上训练,并在推理阶段外推到 400 万,同时仍保持有竞争力的表现。(DeepNet)

从实际应用看,这意味着你可以把 整个代码库、多本书的语料,或大型文档库放进一个单一上下文窗口,而不必依赖 RAG 进行频繁、激进的分块和检索。在 4M token 的 Needle-in-a-Haystack 等长上下文基准上,MiniMax-01 据称能达到 接近完美的检索准确率,并且随着序列长度增长几乎没有明显退化。(VentureBeat)

内部原理:4560 亿参数 + Lightning Attention

MiniMax-Text-01 是一款 4560 亿参数的 Mixture-of-Experts(MoE)模型,借助 top-2 MoE 路由,每个 token 激活 459 亿参数。从架构上看,它融合了三个关键组成部分:(Open Laboratory)

  • Lightning Attention —— 一种线性时间注意力变体,相比标准的二次复杂度自注意力,它对序列长度的扩展要平滑得多。(Neurohive)
  • Softmax attention blocks —— 周期性插入(大约每 8 层 1 次),用于保持高质量的全局检索和推理能力。(Model Card)
  • 带优化并行性的 MoE —— 32 个专家、all-to-all 通信、varlen ring attention,以及定制 CUDA kernels,让数百万 token 级别的上下文在计算上变得可行。(arXiv)

正是这种混合设计,让 MiniMax 能够宣称 100 万 token 的训练序列和 400 万 token 的推理能力都能以“可负担”的成本实现,同时在广泛的文本基准上仍能与 GPT-4o 和 Claude 3.5 Sonnet 持平甚至更强。(VentureBeat)

多模态:用于视觉语言任务的 MiniMax-VL-01

在文本模型之上,MiniMax 还发布了 MiniMax-VL-01,这是一个多模态变体,将 Vision Transformer 编码器与 Text-01 骨干网络结合。图像会在不同分辨率网格上动态缩放并转化为 patch tokens,然后通过轻量级 MLP 投影到语言模型中——这与其他现代 VLM 类似。(Open Laboratory)

MiniMax-VL-01 经过分阶段训练——视觉预训练、对齐和联合微调——因此不仅支持 文档理解、UI/截图理解以及多模态推理,也不只是图像描述。对于需要读取 PDF、仪表盘和产品 UI 的 AI agent 团队来说,这使 MiniMax-01 成为一个 同时覆盖文本与视觉的单一家族,并采用开源权重许可。(Adam Holter)

性能:MiniMax-01 表现如何?

在技术报告和早期报道中,MiniMax 将 MiniMax-01 定位为在标准推理、编程和语言基准上与 GPT-4o 和 Claude 3.5 Sonnet 具有可比性——而在长上下文测试上则更具优势。第三方分析指出,MiniMax-01:(Neurohive)

  • 在 RULER 风格的长上下文基准上保持高分(约 0.91–0.96),覆盖从几千 token 到 100 万 token 的不同长度。(Neurohive)
  • 在 4M token 的 Needle-in-a-Haystack 检索中达到 100% 准确率,而其他模型在极端长度下会显著退化。(VentureBeat)
  • 在编程和推理任务上与许多开源和闭源模型表现相当甚至更好——在多项测试中经常能匹敌 DeepSeek V3,并击败 Llama 3.1。(YouTube)

对于主要以 短上下文聊天或小段代码 评估模型的团队来说,MiniMax-01 的体感会与其他前沿级 LLM 大体相似。它真正的差异化优势会在你开始处理 长文档、大型代码库,或包含大量工作集的多步 agent 工作流 时显现出来。(arXiv)

价格与成本效率

虽然 MiniMax-01 是开源权重,但很多开发者会先通过 API 使用。早期生态文档和评测显示,MiniMax-01 的 API 价格约为每百万输入 token $0.2、每百万输出 token 约 $1.1–1.2——显著低于典型的 GPT-4 级别定价。(Puter)

结合线性时间的 Lightning Attention 和 MoE 带来的效率收益,MiniMax-01 对于 agentic 和长上下文工作负载 尤其有吸引力,因为这些场景的 token 消耗会迅速膨胀(例如全仓库分析、数小时会议日志等)。对于愿意自托管的团队,GitHub 和 Hugging Face 上的开源权重让你可以使用自己的 GPU 和推理栈,从而获得更强的成本控制。(vLLM)

为什么 MiniMax-01 对 AI Agent 很重要

MiniMax-01 真正出彩的地方,是作为 AI agent 的底座,尤其是在当前上下文碎片化已经成为瓶颈的场景中:

  • 全仓库代码 agent —— 将 monorepo 的大部分或全部内容加载到单一 prompt 中,跨文件推理依赖关系,并在持续运行的重构或迁移计划中保持上下文,而不必不断重新填充上下文。(VentureBeat)
  • 文档密集型 copilot —— 将整本政策手册、多本知识库或多年内部文档直接放入上下文,实现高保真、无需检索的推理。(Adam Holter)
  • 研究与分析 agent —— 让一个 agent 同时在内存中容纳数十个 PDF、论文和数据集,降低 RAG 流水线与工具编排的复杂度。(arXiv)

由于 MiniMax-01 同时具备开源和 API 托管两种形态,它非常适合 混合架构:先用托管 API 做原型,等工作负载稳定后,再把热点路径迁移到与 vLLM 等框架集成的自托管集群。(Puter)

MiniMax-01 与其他长上下文 LLM 相比如何?

如果你已经熟悉 Gemini 1.5 Pro、Claude 3.5、DeepSeek 或 Qwen 等长上下文模型,MiniMax-01 处在一个很有意思的竞争位置:

  • 对比 Gemini 1.5 Pro —— Gemini 1.5 支持最高 200 万 token;MiniMax-01 将其翻倍至 400 万,而且是开源权重,而不是纯 API 绑定。(arXiv)
  • 对比 Claude 3.5 —— Claude 强调安全性、对齐和工具使用体验;MiniMax-01 则聚焦于原始上下文长度和高性价比扩展,通用能力相近,但更偏基础设施、也更适合自托管。(Neurohive)
  • 对比 DeepSeek / Qwen —— 两者都提供了强大的开源权重模型,但 MiniMax-01 目前在极端上下文长度上领先,这在一定程度上得益于 Lightning Attention 和深度 MoE 优化。(VentureBeat)

对于大多数产品团队来说,问题不是“MiniMax-01 还是其他全部模型?”而是 哪个模型最适合每一种工作负载 —— 而 MiniMax-01 对于 agent 后端来说是尤其强的候选,因为 500K–4M token 的上下文能显著简化系统设计。这个逻辑也适用于其他开源权重、长上下文的新进入者,例如 Zhipu 的 GLM-5.2:更优的做法是把每个任务路由到最合适的模型,而不是把整个技术栈押注在单一模型上。

如何开始使用 MiniMax-01

如果你今天就想尝试 MiniMax-01,可以走几条直接的路径:

  1. 体验托管演示和 API。 Hailuo AI 和 MiniMax 自有平台都通过类似聊天的界面和 API 提供 MiniMax-01,并提供免费或低成本套餐用于试验。(Hailuo AI) 其他第三方平台也将其列入支持范围,提供即开即用的 playground 和标准 OpenAI 风格 API。(Together AI)
  2. 运行开源权重。 从 GitHub 或 Hugging Face 下载 MiniMax-Text-01 和 MiniMax-VL-01,官方仓库和 model card 中包含规格、许可证和使用示例。(GitHub) 随着支持逐步落地,你可以接入 vLLM 等推理框架,或者根据官方实现中的 Lightning Attention 定制 CUDA kernels,以获得最高效率。(vLLM)
  3. 先从一个具体的长上下文用例开始。 先把一个单独的 agent——例如“全仓库重构助手”或“公司政策顾问”——迁移到 MiniMax-01,作为试验场,再决定是否将整个技术栈切换过去。

MiniMax-01 是否已准备好用于生产?

MiniMax-01 之所以重要,是因为它 重新定义了“长上下文”的边界——而且它以面向 AI agent 的开源权重形式出现,而不仅仅是聊天机器人。4M token 上下文、4560 亿参数 MoE、Lightning Attention 和有竞争力的定价组合在一起,使它成为下一代自主系统和 AI 同事平台最有吸引力的底座之一。(Neurohive)

如果你正在构建 AI agent、开发工具或工作流 copilot,MiniMax-01 值得与你现有的 GPT-4 级和 DeepSeek 基线一起进行认真基准测试。最大的收益会出现在 上下文限制——而不是原始推理质量——才是当前瓶颈 的地方。(arXiv)

这正是 模型无关、支持多 agent 的基础设施 的典型场景。模型格局变化很快,真正赢的会是那些能够在合适的工作负载上接入像 MiniMax-01 这样的模型、同时又无需重构整个技术栈的平台。如果这正是你正在搭建的基础设施,欢迎了解开源的多 agent 平台 Eigent,看看它如何帮助你在真实业务流程中编排专用模型。

常见问题

什么是 MiniMax-01?

MiniMax-01 是 MiniMax 推出的开源基础模型系列,面向超长上下文和 AI-agent 工作负载。它包括 MiniMax-Text-01(一个 4560 亿参数的 Mixture-of-Experts LLM,每个 token 约激活 459 亿参数)以及 MiniMax-VL-01(一个增加视觉能力的多模态变体)。权重可在 GitHub 和 Hugging Face 上获取。

MiniMax-01 的上下文窗口有多长?

MiniMax-01 在推理阶段最高支持 400 万 token 的上下文窗口——大约是大多数生产中的前沿模型的 20–32 倍。MiniMax-Text-01 在最长 100 万 token 的序列上训练,并在推理阶段外推到 400 万,同时保持有竞争力的表现。

什么是 Lightning Attention?

Lightning Attention 是一种线性时间注意力变体,相比标准的二次复杂度自注意力,它对序列长度的扩展要平滑得多。MiniMax-01 将它与周期性的 softmax attention blocks 交错使用(大约每 8 层 1 次),以在保持全局检索和推理质量的同时,让数百万 token 的上下文在计算上可行。

MiniMax-01 是开源的吗?

是的。MiniMax-Text-01 和 MiniMax-VL-01 都以开源权重形式在 GitHub 和 Hugging Face 上发布,并附有官方 model card 和许可证。MiniMax 也通过自有平台和 Hailuo AI 等合作伙伴提供托管 API 访问,因此你可以选择自托管或使用托管端点。

MiniMax-01 多少钱?

早期生态定价显示,MiniMax-01 通过 API 的费用约为每百万输入 token $0.2、每百万输出 token 约 $1.1–1.2——明显比典型 GPT-4 级模型更便宜。自托管开源权重还能让你在自己的 GPU 上获得更强的成本控制。

我可以在 Eigent 中使用 MiniMax-01 吗?

可以。Eigent 的模型无关、多 agent 架构允许你通过其 MCP tools 和 Skills framework 将任务路由到 MiniMax-01——利用它的 4M token 上下文处理全仓库和文档密集型工作,同时让其他模型承担日常任务。

Recent Posts

ChatGPT in Chrome: Side Chat, Open Tabs, and Browser History Explained
行业Jul 31, 2026

ChatGPT in Chrome: Side Chat, Open Tabs, and Browser History Explained

ChatGPT now works inside Chrome with a Side Chat, open-tab context, YouTube and highlight-to-ask, plus desktop URL suggestions and browser history — here's how.

Douglas LaiDouglas Lai
Claude Opus 5:以一半成本实现接近前沿的智能
Jul 28, 2026

Claude Opus 5:以一半成本实现接近前沿的智能

Claude Opus 5 以 Fable 5 一半的成本提供接近前沿的智能,并配备努力调节旋钮,可用计算量换取节省。规格、定价及对智能体的影响。

Douglas LaiDouglas Lai
Cursor 替代品(免费且开源):属于你自己的工作空间
Jul 23, 2026

Cursor 替代品(免费且开源):属于你自己的工作空间

在 SpaceX 收购事件后,正在寻找免费开源 Cursor 替代品?对比成本、自托管、模型选择和数据驻留方案,并了解迁移路径。

Douglas LaiDouglas Lai
Automate everything with AI workforce on desktop
Download Eigent

立即体验 Eigent

下载开源桌面应用,在本地用 AI 工作团队开始自动化。

下载 Eigent
Eigent

获取关于 AI 员工自动化的最新更新和教程。

产品Eigent环境定价企业版
探索解决方案使用场景技能插件博客
开发者文档GitHubCAMEL-AI开源基金合作伙伴
下载开源版
公司关于我们品牌加入我们使用条款隐私政策安全与信任Cookie 政策退款与试用政策

保留所有权利 © 2026 EIGENT UK LTD

Eigent 1.0 新版本发布!download