MiniMax-01:為 AI Agent 時代而生的開源 4M Token LLM
具備 Lightning Attention 與 4M token 上下文的 456B 參數 MoE——為何這對 agent 開發者至關重要

大多數「長上下文」模型的工作記憶仍然只到數十萬 token 的低位。MiniMax-01 則是以百萬 token 為單位。這是中國 AI 公司 MiniMax 推出的全新開源基礎模型系列,圍繞超長上下文、高效 attention,以及 AI-agent 工作負載而設計——而且在單次推理中可承載高達 4 million tokens。(arXiv)
本指南會拆解 MiniMax-01 究竟是什麼、支撐其上下文窗口的 Lightning Attention 架構、它的基準表現、價格、與其他長上下文模型相比如何,以及開發者如何將它應用在 Eigent 這類 agent 平台中。
什麼是 MiniMax-01?
MiniMax-01 是一個模型 系列,而不是單一模型。它包括 MiniMax-Text-01,一款用於文字與工具的大型語言模型,以及 MiniMax-VL-01,一款在相同骨幹上加入視覺理解能力的多模態版本。(arXiv)
兩個模型都以 GitHub 和 Hugging Face 上的 open weights 形式提供,同時也可透過 MiniMax 自家的 API 以及 Hailuo AI 等合作平台存取——讓開發者可在自託管與託管服務之間自由選擇。(GitHub)
如果你有關注 MiniMax 後續的版本,這就是整條技術脈絡的基礎。我們曾在 Eigent Meets MiniMax M2.1 對這個家族中的較新成員進行實測;MiniMax-01 就是這個家族樹中負責長上下文的根基。
重點功能:4M Token 上下文窗口
MiniMax-01 引人注目的主要原因,是它在推理時可支援 高達 4 million tokens 的上下文窗口——大約比現時生產環境中大多數前沿模型長 20–32 倍。MiniMax-Text-01 在訓練時使用長達 1 million tokens 的序列,然後在推理時外推到 4 million,同時維持具競爭力的表現。(DeepNet)
從實際角度看,這代表你可以把 整個 codebase、多本書籍語料,或大型文件庫 放進單一上下文窗口,而不需要依賴 RAG 做激進的 chunk-and-fetch。根據 4M token 下的 Needle-in-a-Haystack 等長上下文基準,MiniMax-01 據報可達到 接近完美的檢索準確度,而且隨著序列長度增加,表現下降非常有限。(VentureBeat)
內部架構:456B 參數 + Lightning Attention
MiniMax-Text-01 是一款 4560 億參數的 Mixture-of-Experts(MoE)模型,並透過 top-2 MoE routing,使每個 token 只需啟動 459 億參數。從架構上,它結合了三個關鍵要素:(Open Laboratory)
- Lightning Attention — 一種線性時間的 attention 變體,對序列長度的擴展性遠勝於標準的二次方 self-attention。(Neurohive)
- Softmax attention blocks — 週期性插入(大約每 8 層有 1 層),以維持高品質的全局檢索與推理。(Model Card)
- 具最佳化平行處理的 MoE — 32 個 experts、all-to-all communication、varlen ring attention,以及自訂 CUDA kernels,令百萬級 token 上下文在計算上變得可行。(arXiv)
這種混合設計,正是 MiniMax 能夠主張 1M-token 訓練序列與 4M-token 推理,而且成本「可負擔」 的原因,同時在多個文字基準上仍能與 GPT-4o 和 Claude 3.5 Sonnet 相匹敵甚至超越。(VentureBeat)
多模態:用於視覺語言任務的 MiniMax-VL-01
在文字模型之外,MiniMax 還推出了 MiniMax-VL-01,一款將 Vision Transformer encoder 與 Text-01 backbone 結合的多模態版本。圖片會以不同解析度的網格動態縮放,轉換成 patch tokens,再透過輕量級 MLP 投射到語言模型中——這與其他現代 VLM 的做法相似。(Open Laboratory)
MiniMax-VL-01 分階段訓練——包括視覺預訓練、對齊,以及聯合微調——不只支援 image captioning,還支援 文件理解、UI/截圖理解,以及多模態推理。對需要讀取 PDF、dashboard 與產品 UI 的 AI agent 團隊而言,這讓 MiniMax-01 成為一個 以 open-weight 授權同時覆蓋文字與視覺的單一系列。(Adam Holter)
性能:MiniMax-01 表現如何?
在技術報告與早期報導中,MiniMax 將 MiniMax-01 定位為在標準推理、編程與語言基準上 可與 GPT-4o 和 Claude 3.5 Sonnet 競爭——而在長上下文測試中則有明顯優勢。第三方分析指出 MiniMax-01:(Neurohive)
- 在從幾千 token 到 1M token 的 RULER 類長上下文基準上,維持高分(≈0.91–0.96)。(Neurohive)
- 在 4M token 的 Needle-in-a-Haystack 檢索任務中,達到 100% 準確率,而其他模型在極端長度下則明顯退化。(VentureBeat)
- 在編程與推理上與多個開源及閉源模型表現相若甚至更佳——在多項測試中經常與 DeepSeek V3 持平,並勝過 Llama 3.1。(YouTube)
對於主要以 短上下文對話或少量 code snippet 評估模型的團隊來說,MiniMax-01 會與其他前沿級 LLM 表現得大致相似。它真正的差異化,會在你開始處理 長文件、大型 codebase,或需要龐大工作集的多步驟 agent workflow 時才顯現。(arXiv)
定價與成本效益
雖然 MiniMax-01 採用 open weights,但許多開發者會先透過 API 上手。早期生態文件與評測將 MiniMax-01 的 API 定價 估算為約每百萬 input tokens $0.2、每百萬 output tokens 約 $1.1–1.2——明顯低於一般 GPT-4 級別的定價。(Puter)
配合線性時間的 Lightning Attention 與 MoE 節省,MiniMax-01 對 agentic 與長上下文工作負載 特別有吸引力,因為這些場景的 token 使用量會暴增(例如完整 repository 分析、數小時會議紀錄等)。對願意自託管的團隊而言,GitHub 和 Hugging Face 上的 open weights 讓你可以用自己的 GPU 與推理堆疊,進一步加強成本控制。(vLLM)
為何 MiniMax-01 對 AI Agents 重要
MiniMax-01 真正發揮威力的地方,是作為 AI agents 的骨幹,尤其適合目前受限於上下文碎片化的場景:
- 整個 repo 的程式碼 agent — 可將 monorepo 的大部分或全部載入單一 prompt,對跨檔案依賴進行推理,並在長時間 refactoring 或 migration 計劃中持續運作,而不必不停重新載入上下文。(VentureBeat)
- 文件密集型 copilot — 直接把整本政策手冊、多本知識庫,或多年內部文件放入上下文,進行高保真、無需檢索的推理。(Adam Holter)
- 研究與分析 agent — 讓單一 agent 同時在記憶中保留數十份 PDF、論文與資料集,降低 RAG pipeline 與工具編排的複雜度。(arXiv)
由於 MiniMax-01 同時是開源與 API 託管,十分適合 混合式架構:先用 hosted API 做原型,待工作負載穩定後,再遷移到與 vLLM 等框架整合的自託管叢集。(Puter)
MiniMax-01 與其他長上下文 LLM 的比較
如果你已經熟悉 Gemini 1.5 Pro、Claude 3.5、DeepSeek 或 Qwen 等長上下文模型,MiniMax-01 位於一個頗有競爭力的位置:
- 對比 Gemini 1.5 Pro — Gemini 1.5 最多支援 2M tokens;MiniMax-01 則翻倍至 4M,而且是 open weights,而不是純 API 限定。(arXiv)
- 對比 Claude 3.5 — Claude 著重安全性、對齊與工具使用體驗;MiniMax-01 則聚焦於原始上下文長度與成本效益擴展,在通用性能相近的同時,更偏向基礎設施與自託管的敘事。(Neurohive)
- 對比 DeepSeek / Qwen — 兩者都提供強大的 open-weight 方案,但 MiniMax-01 目前在 極端 上下文長度方面領先,部分原因是 Lightning Attention 與大量 MoE 最佳化。(VentureBeat)
對大多數產品團隊來說,問題不在於「MiniMax-01 還是其他全部?」而是 哪個模型最適合每一種工作負載——而 MiniMax-01 對於 agent backend 來說尤其出色,因為 500K–4M token 的上下文可以簡化系統設計。相同邏輯也適用於其他 open-weight、長上下文的新進者,例如 Zhipu's GLM-5.2:贏的方法是將每項任務路由到最合適的模型,而不是把整個技術棧押在單一模型上。
如何開始使用 MiniMax-01
如果你想今天就試用 MiniMax-01,可以採用幾個直接的方法:
- 先玩 hosted demo 和 API。 Hailuo AI 與 MiniMax 自家平台都透過類聊天介面與 API 提供 MiniMax-01,並有免費或低成本方案可供試驗。(Hailuo AI) 另外,一些第三方平台也提供即用型 playground 與標準 OpenAI 風格 API。(Together AI)
- 運行開源 weights。 從 GitHub 或 Hugging Face 下載 MiniMax-Text-01 與 MiniMax-VL-01,官方倉庫與 model card 會列出規格、授權與使用範例。(GitHub) 當支援到位後,可整合 vLLM 等推理框架,或直接改用官方實作中的自訂 Lightning Attention kernels,以獲得最高效率。(vLLM)
- 先從一個具體的長上下文使用案例開始。 先把單一 agent——例如「repo-wide refactor assistant」或「company-policy advisor」——遷移到 MiniMax-01 作為測試場景,再考慮是否全面採用。
MiniMax-01 是否已準備好投入生產?
MiniMax-01 的重要性,在於它 重新定義了「長上下文」的邊界——而且是以明確面向 AI agents 的 open-weight 方案來做到,而不只是聊天機械人。4M-token 上下文、456B 參數 MoE、Lightning Attention,以及具競爭力的定價,讓它成為下一代自主系統與 AI 協作平台最具吸引力的骨幹之一。(Neurohive)
如果你正在打造 AI agents、devtools 或 workflow copilots,MiniMax-01 值得與你現有的 GPT-4 級別與 DeepSeek 基準一起認真評測。最大的優勢,會出現在 上下文限制——而非原始推理質素——才是目前瓶頸 的地方。(arXiv)
這正是 model-agnostic、multi-agent 基礎設施 的典型場景。模型格局變化很快,真正勝出的平台,是能夠把像 MiniMax-01 這樣的模型,放到它最擅長的工作負載上,而無需重構整個技術棧。如果這正是你正在建立的基礎,歡迎了解開源、多 agent 平台 Eigent 如何讓你在真實工作流程中編排專門模型。
常見問題
什麼是 MiniMax-01?
MiniMax-01 是 MiniMax 推出的開源基礎模型系列,專為超長上下文與 AI-agent 工作負載而設。它包括 MiniMax-Text-01(456B 參數的 Mixture-of-Experts LLM,每個 token 約啟動 45.9B 參數)以及 MiniMax-VL-01(加入視覺能力的多模態版本)。weights 可於 GitHub 與 Hugging Face 取得。
MiniMax-01 的上下文窗口有多長?
MiniMax-01 在推理時支援高達 4 million token 的上下文窗口——大約比大多數現時生產中的前沿模型長 20–32 倍。MiniMax-Text-01 在長達 1M tokens 的序列上訓練,並在推理時外推至 4M,同時維持具競爭力的表現。
什麼是 Lightning Attention?
Lightning Attention 是一種線性時間的 attention 變體,對序列長度的擴展性遠勝於標準二次方 self-attention。MiniMax-01 會將它與週期性的 softmax attention blocks 交錯使用(大約每 8 層有 1 層),在維持高品質全局檢索與推理的同時,令百萬級 token 上下文在計算上可行。
MiniMax-01 是開源嗎?
是。MiniMax-Text-01 與 MiniMax-VL-01 以 open weights 形式在 GitHub 與 Hugging Face 發布,並附有官方 model cards 與授權條款。MiniMax 亦透過自家平台與 Hailuo AI 等合作夥伴提供託管 API 存取,因此你可以自託管,或使用受管理的 endpoint。
MiniMax-01 的費用是多少?
早期生態定價顯示,MiniMax-01 透過 API 的價格約為每百萬 input tokens $0.2、每百萬 output tokens 約 $1.1–1.2——比一般 GPT-4 級別模型便宜得多。自託管 open weights 則可讓你在自己的 GPU 上進一步控制成本。
我可以在 Eigent 中使用 MiniMax-01 嗎?
可以。Eigent 的 model-agnostic、多 agent 架構可讓你透過其 MCP tools 與 Skills framework 將任務路由到 MiniMax-01——利用其 4M-token 上下文處理整個 repo 與文件密集型工作,同時保留其他模型處理日常任務。
Recent Posts

Qwen3.8-Max:阿里巴巴的 2.4T 開放權重編程模型
Qwen3.8-Max 是阿里巴巴面向編程及代理工作的 2.4T 參數開放權重模型。了解規格、定價、已確認資料及值得留意的後續發展。

Thinking Machines Inkling-Small:一個超越其更大兄弟的 276B 模型
Thinking Machines Lab 的 Inkling-Small 是一個 276B 開放權重 MoE,以四分之一的規模媲美 Inkling。規格、基準測試、定價及其重要性。

Augment Code 替代方案
從目前定價、共享用量、上下文品質、原始碼存取、自行託管部署、安全性與團隊適配度,比較大型程式碼庫的 Augment Code 替代方案。