乍一看,進入本地人工智慧領域似乎是一項艱鉅的任務,但實際上我們正處於黃金時代。你不再需要地下室資料中心來進行模型推理;如今,只要擁有一支配置完善的團隊,你就能擁有自己的私人助手,它不依賴雲端,也不需支付月費。
當我們談到在本地運行模型時,我們主要指的是推理階段,也就是訓練好的模型處理新資料並給出答案的過程。與需要數千個GPU的龐大訓練任務不同,推理更容易管理,而蘋果晶片憑藉其高效的電源管理和創新的架構,在這方面發揮了重要作用。
成功的秘訣:統一記憶
如果說Mac電腦有什麼與眾不同之處,那就是統一記憶體架構(UMA)。在傳統的PC上,資料必須從系統記憶體(RAM)傳送到顯示卡的記憶體(VRAM),而這正是浪費寶貴時間的地方。而M4、M3 Ultra以及類似的晶片,使得CPU和GPU共享同一個記憶體池,從而大幅降低了處理張量時的延遲。
當我們想要載入中型或大型語言模型(LLM)時,這一點至關重要。例如,一台配備充足記憶體的 Mac Studio 可以運行在 PC 上需要多張 NVIDIA A6000 顯示卡才能運行的模型,從而大幅節省成本,尤其是電費,因為其功耗僅為遊戲桌上型電腦的幾分之一。
量化和格式:如何使模型擬合
為了防止擁有 70 兆個參數的模型導致機器崩潰,我們使用量化技術。本質上,這涉及到降低數值的精度(從 FP32 降到 INT8 甚至 4 位元),從而縮小模型規模並加快響應速度,同時又不會使其「笨拙」或失去一致性。
- GGUF: 對於使用 CPU 或 CPU 與 GPU 組合的使用者來說,這是首選格式。它是一個包含所有必要資訊的單一文件,也是標準格式。 調用.cpp.
- GPTQ: 專為在GPU上運作而設計,優化處理速度。
- Safetensors: 與傳統的 .bin 檔案相比,這是一個更安全的選擇,因為它能防止在載入模型時執行惡意程式碼。
設定環境所需的基本工具
如果您不想一開始就費力地使用終端,有一些非常簡單易用的選項。 LM Studio可能是最用戶友好的工具:它是一個功能齊全的解決方案,具有圖形介面,可讓您在本地運行 AI 模型並一鍵啟動。您甚至可以設定本地OpenAI 相容的 API 伺服器,將 AI 整合到您自己的應用程式中。
另一方面,Ollama是那些偏好輕量級或命令列介面的使用者的首選。它是開源的,並且與Open WebUI無縫集成,讓您擁有與 ChatGPT 完全相同的介面,但完全運行在您的硬體上。我們還提供了使用 Ollama 運行本地 LLM 的快速指南。對於那些追求 macOS 極致性能的用戶來說, Apple 的 MLX框架是充分利用其晶片性能的最佳選擇。
硬體難題:便攜性還是強大效能?
許多研究人員和開發人員在兩種選擇之間猶豫不決。第一種選擇是直接購買配備大容量記憶體(例如 128GB)的MacBook Pro M4 Max 。其優點在於迭代速度快:你可以在咖啡館或飛機上測試 RAG(恢復增強生成)流程,而無需依賴遠端連線。
另一個選擇是Mac Studio搭配一台輕薄筆記型電腦。 Studio的散熱性能非常出色;即使長時間運行推理程序,風扇也不會像噴射發動機起飛那樣發出噪音。然而,這會帶來遠端存取的麻煩,需要你在兩台不同的機器之間同步環境和數據,這可能會打斷你的創作想法。
實際應用案例和局限性
使用 Mac Mini M4 或配置齊全的 MacBook Pro,您可以建立基於ChromaDB 或 Qdrant 等向量資料庫的RAG 系統,使用 Aider 建立本機程式碼助手,或利用本機 AI 自動轉錄影片以擷取特徵。這非常適合對參數量在 70 億到 7 億之間的量化模型進行原型設計和效能評估。
然而,不要抱持過高的期望。高強度的模型訓練或複雜的微調並非這些機器的強項。如果你的工作流程嚴重依賴NVIDIA CUDA 生態系統,你將會遇到一些障礙,因為 Metal(蘋果的 API)並非完美的替代品,儘管在推理方面兩者之間的差距已經大大縮小。
對字節世界和一般技術充滿熱情的作家。我喜歡透過寫作分享我的知識,這就是我在這個部落格中要做的,向您展示有關小工具、軟體、硬體、技術趨勢等的所有最有趣的事情。我的目標是幫助您以簡單有趣的方式暢遊數位世界。



