2026年7月18日 下午04:55

Kimi K3 来了 - 最大的开源模型,2.8 万亿参数、100 万上下文,全新的注意力机制

學習筆記:Kimi K3 發佈 - 2.8 兆參數與百萬上下文的開源巨獸

TL;DR

Kimi K3 是 Moonshot AI 推出的 2.8 兆參數開源大模型,憑藉創新的 K3 Attention 機制實現了 100 萬字元的流暢長上下文處理,在程式編碼與深度推理任務上表現優異,目標挑戰頂尖閉源模型。

快速結論

  1. 極致規模與技術創新:K3 擁有 2.8 兆(2.8 Trillion)參數,是目前最大的開源模型之一。採用 MoE(混合專家)架構(總計 896 個專家,每次活化 16 個),並引入 K3 Attention 與 Attention Residue 機制,顯著提升了長上下文的解碼速度(最高快 6.3 倍)與訓練效率。
  2. 定位於長周期智能體與工程任務:該模型專為軟體工程、知識工作和深度推理設計。在程式碼優化與 3D 視覺生成等實際案例中表現出色,能自主進行多次迭代以達成目標(如將計算核優化速度提升近 20 倍)。
  3. 開發者友好的接入與定價策略:K3 完全相容 OpenAI 接口,並採行「扁平化定價」模式,不因上下文變長而加價。特別是緩存命中(Cache Hit)的輸入成本極低(約 2 元台幣/百萬 tokens),對於頻繁讀取相同文件或代碼庫的場景非常具備競爭力。
  4. 開源與性能瓶頸的誠實揭露:官方將於 7 月 27 日發佈完整權重。雖然在編碼與長文本檢索(Long Context)上能超越部分頂級模型,但官方坦言其綜合智能水平仍略遜於 GPT-4o 或 Claude 3.5 Sonnet,且在視覺輸入與聯網搜索上仍有改進空間。

這支影片在說什麼

這支影片介紹了 Moonshot AI 最新發佈的旗艦模型 Kimi K3 的核心規格、架構創新、開發者接入細節及跑分表現。影片旨在幫助 AI 應用開發者與技術愛好者快速理解 K3 的優勢(如長上下文與推理能力)與限制(如固定採樣參數),並提供實際應用的操作建議。

最重要的 5 個重點

  1. 架構突破(MoE + 新注意力機制):K3 透過 Stable Latent MoE 框架提升擴展效率,並利用 K3 Attention 解決了長文本下全注意力機制運算過於昂貴的問題,使得 100 萬 token 的處理變得高效且經濟。
  2. 程式編碼與工程實戰力:在 Programbench 與專案優化任務中,K3 展現了強大的自我迭代能力,能連續 15 小時自主優化演算法,性能接近閉源頂級模型。
  3. API 接入細節與限制:支援工具調用(Tool Use)與 JSON 格式化輸出。注意其採樣參數(如 Temperature)目前是固定的不可自定義,且推理模式強制開啟(Reasoning Effort 固定為 Max)。
  4. 跑分表現分析:在長文本馬拉松(Swim Marathon)與編碼測試中領先,但在一般常識推理與視覺項目上仍有進步空間,整體處於「開源最強、逼近閉源頂尖」的位置。
  5. 定價與成本優勢:輸入成本為 $0.3 - $3 / 1M tokens,輸出為 $15 / 1M tokens。對於長對話應用,利用快取命中功能可大幅降低成本,且定價表不分階梯,方便開發者預估預算。

知識架構

  • 模型規格
    • 參數規模:2.8 兆。
    • 架構:MoE (總 896 專家,活化 16 個)。
    • 上下文:100 萬 Token。
  • 核心技術創新
    • K3 Attention:高效處理長序列。
    • Attention Residue:在深度上有選擇性地提取表示。
    • 量化感知訓練:監督微調階段即採用 MXFP8/MXFP6。
  • 效能評估 (Benchmarks)
    • 優勢:編碼、長文本檢索、智能體任務。
    • 劣勢:綜合智能感、視覺細節、一般推理。
  • 開發者生態
    • 接口:OpenAI 兼容。
    • 功能:Tool Call, JSON Output, 局部續寫。

關鍵概念

  • K3 Attention & Attention Residue:相對於傳統的全注意力機制,這組技術能在處理百萬級上下文時,大幅減少計算開銷並提升訓練與推理速度。
  • Stable Latent MoE:一種改良的混合專家架構,旨在提高模型在大規模參數下的擴展效率。
  • 扁平化定價 (Flat Pricing):不論上下文長度,每百萬 token 的單價保持一致,這與許多模型(隨長度增加而加價)不同。
  • 量化感知訓練 (Quantization-aware Training):在訓練階段就考慮到後續量化的損失,有助於在大參數模型上保持性能同時優化記憶體佔用。

重要例子與細節

  • 工程優化案例:K3 被要求優化一個訓練用的計算核(Kernel),在不改數值精度的情況下,將時間從 283.6ms 壓縮至 14.4ms,展現其在軟體工程上的深度推理能力。
  • 3D 視覺生成:K3 能將圖片或描述轉化為可交互的 3D 場景,透過「寫代碼」與「看截圖」的循環反饋進行自我修正。
  • 價格數據
    • 輸入(命中快取):$0.3 / 1M tokens (約 NT$10)。
    • 輸入(未命中):$3 / 1M tokens (約 NT$100)。
    • 輸出:$15 / 1M tokens (約 NT$500)。
  • 開源時間表:預計 2024 年 7 月 27 日發佈完整權重,並支援 VLLM。

可學習的洞察

  1. 架構比單純堆參數更重要:K3 證明了透過改進注意力機制與專家路由,可以在維持極大規模參數的同時,顯著降低運算成本。
  2. 垂直領域的局部超越:雖然綜合智能尚不及 GPT-4o,但在特定任務(如長文本工程、代碼優化)上,開源模型已能達到或超越閉源頂尖水準。
  3. 「快取」是降低 AI 成本的關鍵:開發者應善用 Context Caching,這在 K3 的定價模型中可帶來高達 10 倍的成本節省。
  4. 模型自我迭代的潛力:K3 在優化計算核的過程中展現了「長時間自主思考與修正」的能力,這是未來 AI Agent 的核心競爭力。

可行動的整理

  • 立即測試:前往 Kimi Playground 選擇 K3 模型進行對話測試。
  • API 遷移:若現有專案使用 OpenAI API,可直接更換 Base URL 至 api.moonshot.cn(需注意採樣參數需省略)。
  • 開發建議
    • 由於 Reasoning Effort 目前固定為 Max,適合處理複雜邏輯,簡單任務可能顯得「過度思考」。
    • 視覺輸入應使用 Base64 或文件 ID,不支援公共連結。
  • 日程關注:7 月 27 日關注官方發佈的權重文件,評估本地部署(Local Inference)的可能性。

複習問題

  1. Kimi K3 的參數規模與最大上下文長度分別是多少?
  2. K3 採用了哪兩種關鍵技術來解決長上下文下的運算效率問題?
  3. 在定價方面,K3 的「扁平化定價」與其他模型有何主要差異?
  4. 根據官方跑分,K3 在哪些類型的任務上表現優於或接近 GPT-4o 與 Claude 3.5 Sonnet?
  5. 開發者在透過 API 接入 K3 時,關於採樣參數(如 Temperature)有哪些需要注意的約束?

待確認資訊

  • 推理模式檔位:官方表示除了目前的 Max 檔位,其他檔位(如低推理強度)仍在開發中。
  • 聯網搜索穩定性:官方暫不建議在生產環境使用其內建的聯網工具,需關注後續更新。
  • 硬體需求:2.8 兆參數模型本地部署所需的具體顯存與硬體規格,需待 7/27 權重發佈後確認。 [資訊不足]

觀看原始影片