🚀Kimi K3编程能力倍增!在Claude Code中全方位实测代码能力,从零开发原生macOS和iOS App、2D、3D游戏,能否超越Fable 5和GPT-5.6?国产模型是否跻身世界第一梯队
學習筆記
TL;DR
Kimi K3 在程式開發能力上展現顯著提升,尤其在處理複雜、耗時的長任務方面表現優異,並在多項測試中超越或接近GPT-3.5及Code Llama等模型。
快速結論
Kimi K3 在程式開發能力方面取得了巨大進步,能夠滿足複雜的開發需求並有效執行長任務。它在多項基準測試中得分非常高,甚至在特定項目超越GPT-3.5,並在前端動畫和邏輯推理方面展現出優於先前模型的精確性與細緻度。
Kimi K3不僅限於前端表現,在原生macOS和iOS應用程式開發上也能有強勁表現,成功建構出具備基本功能和良好UI介面的音樂播放器、2D/3D遊戲和背單字應用,顯示其處理複雜專案架構和UI/UX設計的能力。這些成果表明Kimi K3在很大程度上,有望取代Code Llama 5和GPT-3.5等模型。
儘管模型仍存在一些局限性,例如在遊戲中某些動物會「倒著走」、無法精準打擊飛行目標或未完全實現無限地圖生成等,但整體而言,Kimi K3所開發出的應用程式和遊戲效果仍令人印象深刻。這顯示大型語言模型在軟體開發領域的潛力正持續擴大,能大幅加速開發流程。
這支影片在說什麼
這支影片旨在全面測試Kimi K3大型模型在程式開發方面的能力。影片透過Kimi K3的官方網頁版測試其前端能力,並在Code Llama環境中執行更複雜的任務,包含原生macOS和iOS應用及遊戲開發。影片同時將Kimi K3的表現與GPT-3.5、Code Llama 5等其他模型進行比較,適合對AI程式開發、大型模型能力評估或新一代AI應用開發有興趣的讀者。
最重要的 3-5 個重點
- 頂尖的基準測試成績與知識庫更新: Kimi K3擁有2.8兆參數和100萬上下文窗口,在Termino、Program、SWMailer等多項基準測試中得分極高,部分超越O44.8億及GPT5.6送模型。其知識庫更新至2026年初,非常新穎。
- 前端動畫與推理能力表現卓越: 在官方網頁版中,Kimi K3能一次性且無瑕疵地完成複雜的手繪動畫(如燈籠)和需要推理的過河謎題動畫,其細節處理(如船、農夫、動物)明顯優於GPT-3.5。
- 原生macOS/iOS應用與遊戲開發能力強勁: Kimi K3在Code Llama環境下,成功開發了具備基礎功能和良好UI的原生macOS音樂播放器、接近3D效果的2D macOS坦克設計遊戲,以及UI美觀的iOS背單字應用,展現其處理跨平台複雜開發任務的能力。
- Unity 3D遊戲開發展現潛力: Kimi K3使用Unity引擎開發出模仿Minecraft的第一人稱沙盒3D遊戲,畫面效果令人驚艷,細節處理優於GPT-6060。儘管仍有如無法瞄準飛行物、世界無法無限加載等Bug,但整體功能實現度高。
- 有望取代現有主流開發模型: 影片結論指出,Kimi K3的綜合程式開發能力,特別是執行複雜長任務的表現,使其在很大程度上能取代Code Llama 5和GPT-3.5等模型。
知識架構
一、Kimi K3 模型概述
- 模型參數與特性: 2.8兆參數,100萬上下文窗口。
- 基準測試表現:
- Termino:得分超越O44.8億,僅次於GPT5.6送。
- Program:已超越GPT5.6送及O44.8億。
- SWMailer:領先O44.8億及GPT5.6送。
- 知識截止日期: 更新至2026年初。
- 使用方式: 官方網頁版或Code Llama(透過修改環境變數)。
二、Kimi K3 程式開發能力測試
-
測試平台:
- Kimi K3 官方網頁版 (前端與推理能力)
- Code Llama (複雜任務,原生應用開發)
-
官方網頁版測試案例 (前端與推理)
- 手繪動畫效果 (燈籠): SVG生成,動畫細節,一次完成。
- 過河步驟動畫 (推理能力): SVG生成,多步驟邏輯,細緻動畫,與GPT-3.5比較。
南宋武俠風格街景遊戲 (前端遊戲開發): 動作(行走、跳躍、輕功)、武器(劍、飛鏢)、敵人(黑衣人)、NPC、場景細節。 4. 工程設計特寫鏡頭 (SVG繪圖): 與GPT-3.5及FeiBoWu比較,有無錯誤。 5. 土星鳥類自行車比賽 (SVG繪圖): 細節處理,與GPT-3.5比較。
- Code Llama 測試案例 (原生應用與遊戲開發)
- macOS 原生音樂播放器應用 (SwiftUI):
- 開發要求:仿Apple Music風格(無版權內容),核心功能。
- 功能實現:搜尋、歌單、專輯、歌曲、播放列表、最愛、最近播放、播放控制、迷你播放器。
- 額外功能:新增無版權音樂文件。
- macOS 原生2D/3D坦克設計遊戲 (Xcode):
- 遊戲類型:侏羅紀風格坦克射擊,接近3D的2D遊戲。
- 遊戲元素:坦克炮塔控制、射擊恐龍、翼龍、UFO、開砲效果。
- 遊戲特點:遠處細節、UFO打擊。
- iOS 原生背單字應用 (Xcode):
- 開發要求:單字卡功能、學習進度、打卡天數、練習、設置。
- UI/UX:介面均衡、卡片翻轉(發音、中文解釋)、滑動邏輯、學習統計、獎章、設置(每日目標、外觀)。
- 與FeiBoWu比較:UI美學與功能細節。
- Unity 3D 第一人稱沙盒遊戲 (模仿Minecraft):
- 遊戲引擎:Unity (格鬥遊戲引輕)。
- 遊戲類型:第一人稱沙盒、挖掘/放置方塊、資源收集、探索、生存壓力(選配)。
- 世界設定:侏羅紀恐龍、飛行翼龍。
- 工具:加坦靈(挖地、狩獵、防禦)。
- macOS 原生音樂播放器應用 (SwiftUI):
三、總結與比較
- Kimi K3 優勢: 滿足複雜開發需求、執行長任務效果佳、前端動畫細緻、推理能力強、原生應用UI美學佳。
- Kimi K3 限制/Bug: 遊戲中動物倒著走、工具無法瞄準飛行目標、未實現無限地圖加載。
- 取代潛力: 很大程度上取代Code Llama 5及GPT-3.5。
- 資源消耗: 完成所有測試消耗訂閱套餐的20% (月費199)。
關鍵概念
- Kimi K3: 月之艾面發布的最新大型模型,具備2.8兆參數和100萬上下文窗口。
- Code Llama (柯老的扣的): 一個用於程式碼生成與開發的平台或模型,在此影片中作為Kimi K3進行複雜開發任務的環境。
- 原生應用 (Native App): 專為特定作業系統(如macOS、iOS)開發的應用程式,能充分利用該系統的特性與性能。
- SVG (Scalable Vector Graphics): 一種基於XML的2D向量圖形格式,可用於在網頁上建立互動式、可縮放的圖像和動畫。
- Unity (格鬥遊戲引輕): 一款廣泛使用的跨平台遊戲引擎,可開發2D、3D、VR等遊戲。
- 基準測試 (Benchmark): 用於評估模型性能的標準化測試,如Termino、Program、SWMailer。
- 上下文窗口 (Context Window): 大型語言模型在單次處理中可以接收和理解的文字量上限。
- 知識截止日期 (Knowledge Cutoff Date): 模型訓練資料的最新時間點,影響模型對最新事件或技術的了解程度。
重要例子與細節
- Kimi K3 模型規格: 擁有2.8兆參數,100萬上下文窗口,知識更新至2026年初。
- 基準測試分數:
- Termino:Kimi K3得分超越O44.8億,僅次於GPT5.6送。
- Program:Kimi K3得分已超越GPT5.6送及O44.
8億。 * SWMailer:Kimi K3得分領先O44.8億及GPT5.6送。
- 前端測試成果:
- 手繪動畫: 成功繪製燈籠圖案,包含光影效果,一次完成無須修改。
- 過河謎題動畫: 完美呈現過河步驟,如手繪般細緻,連追溯船、農夫、動物的細節都到位。GPT-3.5在相同測試中曾出現「農復道歷者」(農夫倒著走)的錯誤。
- 南宋武俠遊戲: 可行走、跳躍、輕功、使用劍和飛鏢攻擊黑衣人,街景中有路人、小販、商鋪。缺點是遠處的恐鳥會倒著走。
- 工程設計圖: 繪製的「公片」放反了,與GPT-3.5相同,但特寫動畫效果不錯。
- 鳥類自行車比賽: 土星背景,鳥類在比賽,細節比GPT-3.5更精緻。
- Code Llama 中原生應用/遊戲開發成果:
- macOS 音樂播放器: 主介面包含搜尋、歌單、專輯、歌曲、播放列表、最愛、最近播放等,底部有迷你播放器,並成功加入5首無版權音樂播放。
- macOS 2D/3D坦克遊戲: 近似3D的2D遊戲,可控制炮塔移動與設計恐龍、翼龍、UFO。缺點是遠處的恐鳥也是倒著走。
- iOS 背單字應用: 介面UI平衡感好,比FeiBoWu開發的UI更好看。具備學習進度、連續打卡天數、單字卡(發音、翻轉、中譯)、練習、統計、設定(每日目標、外觀模式)。功能細節不如FeiBoWu開發的精細,但大結構功能皆實現。
- Unity 3D Minecraft類遊戲: 畫面體驗驚艷,優於GPT-6060。具備挖掘/放置方塊、跳入水中、水下效果佳。主要Bug為玩家無法命中飛行翼龍,加坦靈(工具)無法瞄準,且畫面中未出現其他朋友、無法無限加載地圖。
- 總體測試資源消耗: 完成所有測試消耗了訂閱套餐(每月199)的20%。
可學習的洞察
- AI模型在複雜程式開發的潛力巨大: Kimi K3在原生應用和遊戲開發上的表現,顯示大型語言模型已能處理多步驟、多組件的複雜開發任務,大幅提升開發效率。
- 注重細節與邏輯推理是關鍵優勢: 在前端動畫和推理題的精準度上,Kimi K3超越了GPT-3.5,說明模型在理解複雜指令和生成精確結果方面的進步是其核心競爭力。
- UI/UX美學成為模型新戰場: Kimi K3在iOS應用開發中展現出優異的UI平衡感和美學設計,這將是未來模型在應用程式開發領域的重要能力指標。
- 模型仍需人類協作與迭代優化: 儘管Kimi K3表現出色,但仍有特定Bug(如角色動作邏輯、遊戲機制缺陷)和未實現的功能,凸顯了人類開發者在模型輔助下的除錯、完善與創意實現的重要性。
- 跨平台開發能力的重要性: 透過在Code Llama中測試macOS、iOS甚至Unity遊戲開發,證明Kimi K3具備跨平台生成程式碼的能力,這對多平台產品開發者而言具有極高價值。
可行動的整理
- 試用Kimi K3進行前端開發: 若有SVG動畫、網頁遊戲或需要精細UI的網頁專案,可嘗試利用Kimi K3的官方網頁版或Code Llama來加速開發。
- 探索Kimi K3在原生應用原型上的應用: 對於macOS或iOS的應用程式/遊戲開發者,可以利用Kimi K3進行快速原型開發、核心功能建構或UI介面設計,以驗證概念。
- 為模型生成程式碼預留驗證和除錯時間: 即使模型表現優異,仍需投入時間對其產出的程式碼進行測試、除錯和功能完善,特別是針對遊戲邏輯或物理互動。
- 記錄模型的優點與限制: 將Kimi K3在特定任務上的優勢(如UI美學、動畫細節)和限制(如角色動作Bug、無限生成問題)記錄下來,作為未來選擇工具或制定開發策略的參考。
- 關注Kimi K3的成本效益: 根據影片中提及的資源消耗,評估Kimi K3的訂閱費用與其帶來的開發效率提升是否符合個人或團隊的預算和需求。
複習問題
- Kimi K3在多項基準測試中的表現如何?它與GPT-3
.5和O44.8億相比有何優勢? 2. 在前端動畫測試中,Kimi K3在「過河步驟」動畫上的表現與GPT-3.5有何不同? 3. Kimi K3在開發macOS原生音樂播放器時,主要實現了哪些功能?它與Apple Music的風格關係為何? 4. 在開發iOS背單字應用時,Kimi K3在UI設計和功能細節方面各有哪些表現? 5. Kimi K3在開發Unity 3D模仿Minecraft遊戲時,實現了哪些核心功能,又存在哪些待改進的Bug或未實現的設計?
待確認資訊
- 「O44.8億」和「GPT5.6送」這兩個模型的確切名稱和身份,影片中直接提及,但未提供更詳細解釋,可能為特定型號或口語代稱。
- 在Code Llama中測試Unity遊戲時,影片中將Unity稱為「格鬥遊戲引輕」,其是否為對「遊戲引擎」或特定類型引擎的語音識別誤譯。