Kimi K3 来了 - 最大的开源模型,2.8 万亿参数、100 万上下文,全新的注意力机制
學習筆記:Kimi K3 發佈 - 2.8 兆參數與百萬上下文的開源巨獸
TL;DR
Kimi K3 是 Moonshot AI 推出的 2.8 兆參數開源大模型,憑藉創新的 K3 Attention 機制實現了 100 萬字元的流暢長上下文處理,在程式編碼與深度推理任務上表現優異,目標挑戰頂尖閉源模型。
快速結論
- 極致規模與技術創新:K3 擁有 2.8 兆(2.8 Trillion)參數,是目前最大的開源模型之一。採用 MoE(混合專家)架構(總計 896 個專家,每次活化 16 個),並引入 K3 Attention 與 Attention Residue 機制,顯著提升了長上下文的解碼速度(最高快 6.3 倍)與訓練效率。
- 定位於長周期智能體與工程任務:該模型專為軟體工程、知識工作和深度推理設計。在程式碼優化與 3D 視覺生成等實際案例中表現出色,能自主進行多次迭代以達成目標(如將計算核優化速度提升近 20 倍)。
- 開發者友好的接入與定價策略:K3 完全相容 OpenAI 接口,並採行「扁平化定價」模式,不因上下文變長而加價。特別是緩存命中(Cache Hit)的輸入成本極低(約 2 元台幣/百萬 tokens),對於頻繁讀取相同文件或代碼庫的場景非常具備競爭力。
- 開源與性能瓶頸的誠實揭露:官方將於 7 月 27 日發佈完整權重。雖然在編碼與長文本檢索(Long Context)上能超越部分頂級模型,但官方坦言其綜合智能水平仍略遜於 GPT-4o 或 Claude 3.5 Sonnet,且在視覺輸入與聯網搜索上仍有改進空間。
這支影片在說什麼
這支影片介紹了 Moonshot AI 最新發佈的旗艦模型 Kimi K3 的核心規格、架構創新、開發者接入細節及跑分表現。影片旨在幫助 AI 應用開發者與技術愛好者快速理解 K3 的優勢(如長上下文與推理能力)與限制(如固定採樣參數),並提供實際應用的操作建議。
最重要的 5 個重點
- 架構突破(MoE + 新注意力機制):K3 透過 Stable Latent MoE 框架提升擴展效率,並利用 K3 Attention 解決了長文本下全注意力機制運算過於昂貴的問題,使得 100 萬 token 的處理變得高效且經濟。
- 程式編碼與工程實戰力:在 Programbench 與專案優化任務中,K3 展現了強大的自我迭代能力,能連續 15 小時自主優化演算法,性能接近閉源頂級模型。
- API 接入細節與限制:支援工具調用(Tool Use)與 JSON 格式化輸出。注意其採樣參數(如 Temperature)目前是固定的不可自定義,且推理模式強制開啟(Reasoning Effort 固定為 Max)。
- 跑分表現分析:在長文本馬拉松(Swim Marathon)與編碼測試中領先,但在一般常識推理與視覺項目上仍有進步空間,整體處於「開源最強、逼近閉源頂尖」的位置。
- 定價與成本優勢:輸入成本為 $0.3 - $3 / 1M tokens,輸出為 $15 / 1M tokens。對於長對話應用,利用快取命中功能可大幅降低成本,且定價表不分階梯,方便開發者預估預算。
知識架構
- 模型規格
- 參數規模:2.8 兆。
- 架構:MoE (總 896 專家,活化 16 個)。
- 上下文:100 萬 Token。
- 核心技術創新
- K3 Attention:高效處理長序列。
- Attention Residue:在深度上有選擇性地提取表示。
- 量化感知訓練:監督微調階段即採用 MXFP8/MXFP6。
- 效能評估 (Benchmarks)
- 優勢:編碼、長文本檢索、智能體任務。
- 劣勢:綜合智能感、視覺細節、一般推理。
- 開發者生態
- 接口:OpenAI 兼容。
- 功能:Tool Call, JSON Output, 局部續寫。
關鍵概念
- K3 Attention & Attention Residue:相對於傳統的全注意力機制,這組技術能在處理百萬級上下文時,大幅減少計算開銷並提升訓練與推理速度。
- Stable Latent MoE:一種改良的混合專家架構,旨在提高模型在大規模參數下的擴展效率。
- 扁平化定價 (Flat Pricing):不論上下文長度,每百萬 token 的單價保持一致,這與許多模型(隨長度增加而加價)不同。
- 量化感知訓練 (Quantization-aware Training):在訓練階段就考慮到後續量化的損失,有助於在大參數模型上保持性能同時優化記憶體佔用。
重要例子與細節
- 工程優化案例:K3 被要求優化一個訓練用的計算核(Kernel),在不改數值精度的情況下,將時間從 283.6ms 壓縮至 14.4ms,展現其在軟體工程上的深度推理能力。
- 3D 視覺生成:K3 能將圖片或描述轉化為可交互的 3D 場景,透過「寫代碼」與「看截圖」的循環反饋進行自我修正。
- 價格數據:
- 輸入(命中快取):$0.3 / 1M tokens (約 NT$10)。
- 輸入(未命中):$3 / 1M tokens (約 NT$100)。
- 輸出:$15 / 1M tokens (約 NT$500)。
- 開源時間表:預計 2024 年 7 月 27 日發佈完整權重,並支援 VLLM。
可學習的洞察
- 架構比單純堆參數更重要:K3 證明了透過改進注意力機制與專家路由,可以在維持極大規模參數的同時,顯著降低運算成本。
- 垂直領域的局部超越:雖然綜合智能尚不及 GPT-4o,但在特定任務(如長文本工程、代碼優化)上,開源模型已能達到或超越閉源頂尖水準。
- 「快取」是降低 AI 成本的關鍵:開發者應善用 Context Caching,這在 K3 的定價模型中可帶來高達 10 倍的成本節省。
- 模型自我迭代的潛力:K3 在優化計算核的過程中展現了「長時間自主思考與修正」的能力,這是未來 AI Agent 的核心競爭力。
可行動的整理
- 立即測試:前往 Kimi Playground 選擇 K3 模型進行對話測試。
- API 遷移:若現有專案使用 OpenAI API,可直接更換 Base URL 至
api.moonshot.cn(需注意採樣參數需省略)。 - 開發建議:
- 由於
Reasoning Effort目前固定為Max,適合處理複雜邏輯,簡單任務可能顯得「過度思考」。 - 視覺輸入應使用 Base64 或文件 ID,不支援公共連結。
- 由於
- 日程關注:7 月 27 日關注官方發佈的權重文件,評估本地部署(Local Inference)的可能性。
複習問題
- Kimi K3 的參數規模與最大上下文長度分別是多少?
- K3 採用了哪兩種關鍵技術來解決長上下文下的運算效率問題?
- 在定價方面,K3 的「扁平化定價」與其他模型有何主要差異?
- 根據官方跑分,K3 在哪些類型的任務上表現優於或接近 GPT-4o 與 Claude 3.5 Sonnet?
- 開發者在透過 API 接入 K3 時,關於採樣參數(如 Temperature)有哪些需要注意的約束?
待確認資訊
- 推理模式檔位:官方表示除了目前的
Max檔位,其他檔位(如低推理強度)仍在開發中。 - 聯網搜索穩定性:官方暫不建議在生產環境使用其內建的聯網工具,需關注後續更新。
- 硬體需求:2.8 兆參數模型本地部署所需的具體顯存與硬體規格,需待 7/27 權重發佈後確認。 [資訊不足]