Kimi K3:Moonshot AI 的 2.8T 開放權重前沿模型,專為智能體編程而生
有史以來發布的最大開放權重模型——2.8T 參數、100 萬 token 上下文,以及針對編程和長程智能體的前三名基準測試成績

Kimi K3 是 Moonshot AI 全新旗艦大型語言模型——擁有 2.8 兆參數,是迄今為止發布的最大開放權重模型。於 2026 年 7 月 16 日正式推出,它將前沿級混合專家(Mixture-of-Experts,MoE)架構與 100 萬 token 上下文窗口相結合,並以智能體優先的方式專注於編程和長程知識工作。其值得關注之處不僅在於規模:Moonshot 發布了完整權重,讓自托管智能體真正能夠觸及前沿性能。以下是 K3 的實際情況、基準測試表現、定價,以及其適用場景。
本指南涵蓋 K3 的架構、基準測試、定價、與 K2 系列的比較,以及開發者已在其上運行的具體工作流程。
什麼是 Kimi K3?
Kimi K3 是北京 Moonshot AI 推出的開放權重、智能體優先前沿模型,於 2026 年 7 月 16 日發布,是 Kimi K2 系列的繼任者。Moonshot 將其描述為公司迄今最強大的開源編程模型,專為持續長時間工程作業、導航大型代碼庫以及在最少人工監督下協調終端工具而構建。(Fortune)
最引人注目的數字是規模。K3 在稀疏 MoE 架構中擁有 2.8 兆總參數——約為 K2.6 的 2.8 倍,並大於 DeepSeek V4 Pro(約 1.6T)和智譜 GLM-5 系列等中國競爭對手。按 Moonshot 的說法,這使其成為有史以來構建的最大開放權重模型。(VentureBeat)
關鍵在於,這些權重不會被鎖定。Moonshot 已計劃於 2026 年 7 月 27 日發布完整開放權重,這意味著開發者將能夠檢查、修改和自托管該模型,而不僅僅是調用托管 API。(Axios)
規格與架構
K3 延續了 K2 系列以 OpenAI 風格、智能體優先的設計理念,並在各個維度上突破上限。
- 2.8T 參數稀疏 MoE——數百個專家採用稀疏激活,每個 token 只有一小部分網絡運行。其規模著眼於廣度和專業化,針對長程推理和複雜工具使用進行了調優。(VentureBeat)
- 100 萬 token 上下文窗口——足以將整個代碼庫、設計系統或研究語料庫「盡收眼底」,無需繁瑣的分塊處理。(Axios)
- Kimi Delta Attention(KDA)——一種混合線性注意力機制,由 Moonshot 作為開放研究首次發布,旨在使超長序列易於處理,同時避免標準注意力機制的成本爆炸問題。(VentureBeat)
- Attention Residuals(AttnRes)——Moonshot 將其描述為殘差連接的即插即用替代方案,能帶來一致的擴展增益。(VentureBeat)
- 原生多模態輸入——支持文本和圖像的視覺理解,以及 Moonshot 稱之為「思考模式」的常駐推理模式。(Axios)
- 兼容 OpenAI SDK——API 與 OpenAI 接口一致,因此已在 OpenAI 或 Anthropic 工具鏈上構建的團隊可以以最少的改動完成集成。(VentureBeat)
KDA 和 AttnRes 此前均已作為開放研究發布於 GitHub——這表明 K3 的效率提升來自架構創新,而非單純的暴力擴展。(VentureBeat)
基準測試:K3 的表現
K3 首次亮相即登上 Artificial Analysis 排行榜第 3 位,僅次於 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol——但領先於其他所有模型,並在部分實際測試中位居榜首。(Wikipedia)
以下是發布分析中幾個突出的結果:
- GDPval-AA v2(涵蓋 44 個職業和 9 個行業的真實世界任務):K3 得分 1,687,總體排名第三,落後於 Claude Fable 5 Max(1,815)和 GPT-5.6 Sol Max(1,747.8),領先於 Claude Opus 4.8(1,600)。(VentureBeat)
- AA-Briefcase(私有長程知識工作基準測試):K3 以 1,527 分位居第二,超越 GPT-5.6 Sol Max,僅次於 Fable 5 Max。(VentureBeat)
- 任務自動化:K3 在八項基準測試中的四項排名第一——包括 Automation Bench、SpreadsheetBench 2 和 BrowseComp——在其他大多數測試中位居 Fable 5 之後的第二名。(VentureBeat)
- 前端編程:在評估平台 Arena 的盲測中,開發者在前端編程方面更偏好 K3,勝過所有領先的美國模型,包括 Fable 5 和 GPT-5.6 Sol。(Axios)
對於智能體開發者而言,有一個細節值得關注:Moonshot 表示,這些自動化成績是在單智能體設置下使用 100 萬 token 上下文實現的——無需上下文壓縮或外部上下文管理技巧。這暗示原始上下文長度加上強大的檢索能力,可以媲美複雜的多智能體解決方案。(VentureBeat)
需要注意的是:K3 公開僅數日,病毒式傳播的演示和早期基準測試可能誇大了模型在真實生產工作中的穩定表現。請將排行榜數字視為有希望的起點,而非定論。(Axios)
定價與訪問方式
K3 現已可通過 kimi.com 界面、移動應用程序以及 platform.moonshot.ai 的 Moonshot 平台 API 使用。托管定價約為每百萬輸入 token 3 美元,每百萬輸出 token 15 美元。(MLQ)
這是中國 AI 實驗室中定價最高的——與 Moonshot 早期模型以深度折扣著稱的形象截然不同。作為參考,這遠高於智譜 GLM-5.2(輸出 $4.40/M)和 DeepSeek V4(輸出 $0.87/M),但仍遠低於美國前沿模型:Claude Fable 同等工作的輸出費用約為每百萬 token 50 美元。(Fortune)
在制定預算前,有兩點實際注意事項:
- K3 目前僅提供一個推理力度級別(「max」),獨立測試人員報告推理 token 消耗量很高——有人指出生成一個簡單 SVG 大約消耗了 13,241 個 token(約 0.25 美元)。長鏈任務費用累積很快。(MLQ)
- 一旦權重於 7 月 27 日發布,對於需要數據駐留或希望大規模控制成本的團隊,自托管將成為一個選項——這與我們在 Moonshot 開放權重發布中看到的從托管到自托管的路徑相同。(Axios)
K3 對比 K2.5 / K2.6 / K2.7:有何變化
如果你曾使用過 K2 系列,K3 與其說是全新的 API,不如說是在各方面突破上限。該平台保持相同的 OpenAI 風格接口和工具調用語義,因此升級路徑依然簡單直接。
| 模型 | 重點 | 規模 / 上下文 | 核心特性 |
|---|---|---|---|
| K2.5 | 視覺智能體智能 | 1T MoE,256k 上下文 | Agent Swarm(最多約 100 個子智能體) |
| K2.6 | 長程編程 + 群體協作 | 1T MoE,256k 上下文 | 超過 12 小時的自主任務 |
| K2.7 Code | 編程專家 | 1T MoE,256k 上下文 | 推理 token 比 K2.6 減少約 30% |
| K3 | 前沿智能體編程 + 知識工作 | 2.8T MoE,1M 上下文 | 最大開放權重模型;前三名基準測試 |
相較於 K2.x 的主要差異化優勢:參數量近 3 倍、上下文窗口延長 4 倍(1M 對比 256k)、全新的 KDA + AttnRes 架構,以及更強的多模態推理能力。Moonshot 還報告稱,K3 在同等任務上比 K2.6 減少約 21% 的輸出 token——延續了 Kimi K2.7 Code 的效率提升趨勢。(MLQ)
開發者和團隊的真實應用場景
K3 結合了前沿性能、超大上下文和開放權重,使其成為嚴肅智能體工作的候選核心骨幹:
- 自主編程智能體,能夠負責完整功能——持續長時間工程作業、導航龐大代碼庫,並在最少監督下協調終端工具。(Fortune)
- 代碼庫規模的遷移和原型開發——將產品需求文檔(PRD)、設計文件和遺留文檔轉化為可運行的腳手架,同時在 100 萬 token 窗口中保持完整的項目上下文。
- 金融、法律和諮詢領域的文件密集型知識工作,大上下文加上原生視覺能力有助於處理密集報告,而開放權重讓你日後可以將敏感工作流程遷移到自托管基礎設施。
這並非假設性的採用。Moonshot 的早期模型已被整合進西方產品——Cursor 使用 Kimi 幫助構建其 Composer 2 編程智能體,DoorDash 的 CTO 表示公司將「低層次工作委託給 Kimi K2.6」。K3 提升了這些團隊所構建的上限。(Fortune)
K3 對 AI 格局的意義
從戰略角度看,K3 是 Moonshot 證明開放權重模型能夠在最高價值領域——複雜編程、長程推理和多模態研究——與閉源系統正面競爭的嘗試。分析師將此次發布定性為一個證據,表明架構創新加上預訓練擴展,仍能在硬件限制下為中國實驗室帶來跨越式進步。(CNBC)
這也是一次競爭衝擊。此次發布——時間恰好在 2026 年上海世界人工智能大會前夕——被廣泛解讀為開源已不再落後於閉源模型數月之久的證據。對於評估前沿模型的開發者而言,這意味著 K3 應與 Claude 和 GPT-5.x 一同列入候選名單,尤其是如果你的路線圖包含自托管智能體和多模態工作流程。(VentureBeat)
從更廣泛的開放權重視角來看,K3 與我們追蹤的其他前沿發布並列:DeepSeek V4 Pro、智譜 GLM-5.2 和 MiniMax-01。
將 Kimi K3 這樣的模型投入你自己的 AI 工作團隊
K3 的真正價值在於將前沿模型接入實際工作流程——代碼庫、文檔、終端和多步驟計劃——而非僅僅是一個聊天框。這正是模型無關的多智能體平台的用武之地:將長程編程任務路由到 K3 這樣的模型,讓其他模型處理常規任務,並在真實工作中協調它們。Eigent 是一款開源協作桌面應用,在本地運行多智能體 AI 工作團隊,讓你可以為每個任務選用最佳模型,並將敏感數據保留在自己的機器上。了解智能體如何端到端地審查 GitHub PR,然後下載 Eigent 親身體驗。
常見問題
什麼是 Kimi K3?
Kimi K3 是 Moonshot AI 的前沿大型語言模型,於 2026 年 7 月 16 日發布——這是一個擁有 2.8 兆參數的稀疏混合專家模型,具備 100 萬 token 上下文窗口和原生多模態輸入。Moonshot 稱其為有史以來發布的最大開放權重模型,也是其迄今最強大的開源編程模型。
Kimi K3 是開源的嗎?
Moonshot 已承諾於 2026 年 7 月 27 日發布 K3 的完整權重,屆時開發者可以檢查、修改和自托管該模型。在此之前,K3 可通過托管的 kimi.com 界面、移動應用程序和 Moonshot 平台 API 訪問。
Kimi K3 與 Claude 和 GPT-5 相比如何?
K3 發布時在 Artificial Analysis 排行榜上位居第 3,落後於 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol,但在部分實際測試中領先——包括 Arena 的盲測前端編程評估,開發者在該測試中更偏好 K3 而非兩者。它在八項任務自動化基準測試中的四項排名第一。
Kimi K3 的費用是多少?
托管定價約為每百萬輸入 token 3 美元,每百萬輸出 token 15 美元——是中國任何 AI 實驗室中最高的,但仍遠低於 Claude Fable 等美國前沿模型。K3 目前僅提供單一「max」推理級別,測試人員報告推理 token 使用量很高,因此長鏈任務費用可能相當可觀。
K3 相比 K2 系列有何新變化?
K3 將參數量從 K2 的 1T 擴展至 2.8T,將上下文窗口從 256k 延伸至 1M token,並新增了兩項架構技術——Kimi Delta Attention 和 Attention Residuals。它還報告在同等任務上比 K2.6 減少約 21% 的輸出 token,同時具備更強的多模態推理能力。
我可以在 Eigent 這樣的多智能體平台上使用 Kimi K3 嗎?
可以。由於 K3 兼容 OpenAI SDK,且(自 7 月 27 日起)支持自托管,像 Eigent 這樣的模型無關平台可以將長程編程和知識工作任務路由到 K3,同時使用其他模型處理常規步驟——在需要時將數據保留在本地。
Recent Posts

Eigent v1.0.3 版本更新說明:持久任務、Git 支援的空間與工作區套件
Eigent v1.0.3 新增持久任務恢復、Git 支援的空間、工作階段內工具、檔案變更審查、工作區套件、分層記憶以及 Ant Ling 支援。

Doubao Work 與 AI 辦公室大戰:全面比較各大工作智能體
Doubao Work 加入 ChatGPT Work、Claude Cowork、WorkBuddy 及 Qwen Office 的行列。深入了解各 AI 工作智能體的功能、差異,以及如何選擇最適合的方案。

GLM-5.3-Flash:Z.ai 的多模態模型,售價僅為十分之一
GLM-5.3-Flash 詳解:Z.ai 首個原生多模態 GLM-5 模型,涵蓋 320B-A18B 混合架構、MIT 授權、100 萬 token 上下文、基準測試及定價。