- LLM 是基於 Transformer 的語言模型,透過對大量文字進行訓練來預測下一個詞元並產生連貫的自然語言。
- 它的運作依賴於標記、嵌入、自我注意機制以及透過深度學習調整的數十億個參數。
- 有封閉式、開放式權重模型和利基模型,可以在雲端或本地運行,並使用量化等技術來適應可用的硬體。
- 雖然它們在產生和分析文本方面非常強大,但它們也存在一些重大局限性,例如幻覺、偏見和對提示的依賴性,因此需要批判性和監督性地使用。
大型語言模型(LLM)就像智慧型手機一樣,悄悄地融入了我們的日常對話:幾乎難以察覺,卻徹底改變了我們的工作方式、資訊搜尋方式以及與科技的互動方式。它們是 ChatGPT、Gemini、Claude 和 Copilot 等工具的基礎,也是幾乎所有現代智慧助理背後的驅動力。
如果您曾經想知道LLM 究竟是什麼,它的內部工作原理是什麼,它與經典 AI 模型有何不同,或者為什麼人們如此熱衷於談論參數、標記、上下文視窗或量化,那麼在這裡您將找到一個詳盡的解釋,但語言清晰易懂,又不失技術嚴謹性。
什麼是LLM語言模型?
大型語言模型 (LLM)是一種基於深度學習的人工智慧模型,它透過對大量文字進行訓練,能夠理解、產生和轉換人類語言,其流暢度與真人非常接近。
從本質上講,LLM 是一個系統,給定一個輸入文本,根據它透過閱讀數十億個範例(書籍、文章、網站、技術文件、對話、程式碼和其他文本資源)所學習到的模式,預測下一個文本(標記)應該是什麼。
「大」這個字既指訓練資料量,也指模型的參數數量:它可以有數億、數十億甚至數千億個參數來定義模型如何回應每個輸入。
與基於規則或簡單統計的經典系統不同,語言學習模型能夠捕捉語言中的深層關係:它們理解細微差別、語境、一定程度的諷刺、複雜的指令以及更豐富的推理結構。
從GPT和Transformer到現代LLM
當我們談論像GPT-4、Claude 或 Llama 這樣的模型時,我們實際上指的是基於 Transformer 架構的語言學習模型 (LLM),該架構於 2017 年在著名的論文《Attention Is All You Need》中提出。這項架構標誌著自然語言處理的轉折點。
GPT是「生成式預訓練 Transformer」的縮寫:也就是說,它是一個生成模型(生成新內容),經過預訓練(首先使用大型文字語料庫進行大規模訓練),並且基於Transformer,即使現代 LLM 成為可能的神經網路架構。
Transformer 模型與循環神經網路 (RNN) 等傳統模型的主要區別在於,它能夠借助注意力機制並行處理整個文本序列,而不是像傳統模型那樣嚴格地按順序逐步處理。這使得訓練過程更加高效且可擴展。
現代語言學習模型將這種概念發揮到了極致:擁有數十億個參數的模型,經過海量文本的訓練,能夠在許多語言任務中接近人類的表現,並在翻譯、摘要、代碼生成或大量文本分析方面超越經典系統。
令牌:LLM「看到」的最小單位
對 LLM 來說,文字不是作為單字或不一定是作為完整的單字來處理,而是作為標記來處理,標記是文字的小單元,可以是短單字、單字的一部分、標點符號,甚至是空格。
例如,「strawberry」(草莓)這個字可以分成「straw」(草莓)和「berry」(莓果)兩個詞元。模型不會識別單個字母,也不會計算“r”的數量:它只識別這兩個詞元。因此,如果你問它“strawberry”裡有多少個“r”,它可能會答錯;這並不是說它“不會數”,而是因為它不是在字母級別操作,而是在詞元級別操作。
在預處理階段,整個訓練文字被分解成詞元(token),每個詞元都由一個數值標識符表示。模型處理的是這些標識符的序列,而不是原始文本,這使得它能夠系統地處理任何語言或混合語言。
嵌入和向量表示
文字被分割成詞元後,每個詞元都會被轉換成一個稱為詞元嵌入的數值向量,它是詞元意義及其在不同上下文中的用法的數學表示。
這些嵌入是高維向量,其中每個分量都捕捉了某些語義或句法方面:出現在相似上下文中的詞元最終會在該向量空間中具有相近的表示。因此,當上下文指的是寵物時,「狗」和「吠叫」這樣的概念會比「樹皮」和「樹」更接近。
除了表示語義之外,這些模型還添加了位置編碼,用於指示每個詞元在序列中的位置。這樣,模型不僅知道哪個詞元存在,還知道它出現在哪裡以及它與句子中其他詞元的關係。
內部引擎:Transformer架構與自我護理
現代語言學習模式的核心是Transformer網絡,它是由多層人工神經元所構成。每一層都會對輸入嵌入進行轉換,從而產生越來越豐富且具有上下文意義的文字表示。
關鍵組件是自註意力機制,它允許模型在處理每個詞元時「決定」應該更加關注文本的哪些部分。這是透過將每個詞元嵌入投影到三個向量上來實現的:查詢向量、鍵向量和值向量,這些向量是透過使用訓練過程中學習到的權重矩陣而獲得的。
查詢表示詞元「搜尋」的內容,鍵捕獲每個詞元「提供」的訊息,值包含將被加權和組合的表示形式。模型計算查詢和鍵之間的相似度得分,以確定哪些詞元與每個位置相關。
這些分數經過歸一化處理後得到注意力權重,該權重表示每個詞元(透過其值)的資訊量對最終詞元表示的貢獻程度。因此,模型可以專注於相關的關鍵字,而「忽略」或降低不太重要的詞項(例如限定詞或中性連接詞)的權重。
該機制在序列中的所有標記之間創建了一個加權關係網絡,並且它是並行執行的,這使得該架構與傳統的循環網絡相比非常有效率。
模型參數、重量和容量
LLM 由大量的權重或參數組成,這些權重或參數是訓練期間調整的內部變量,決定了資訊在每一層中的轉換方式。
在 LLM 領域,擁有 70 億個參數 (7B) 的模型被認為是相對較小的,而擁有 7.000 億個參數 (70.000B) 的模型已經屬於大型模型,超過 400.000 億個參數的模型是真正的巨型模型,需要資料中心硬體基礎設施。
實際上,參數數量可以粗略衡量模型的「智能能力」:參數越多,模型能夠學習的語言模式就越複雜,推理能力也越強。然而,並非所有情況下參數越多越好:資料品質、架構和微調等因素也發揮作用。
較小的模型,稱為小型 LLM,非常適合在資源有限的設備或本地環境中運行,犧牲一些推理能力以換取輕量級和隱私性。
如何培育法學碩士
訓練對數模型(LLM)需要讀取海量文本,並根據前面的詞元學習預測序列中的下一個詞元。在此過程中,模型會接觸到來自其訓練語料庫的數百萬甚至數十億個範例。
在每個步驟中,模型都會對下一個詞元進行預測;然後將該預測與實際詞元進行比較,並計算損失函數來量化誤差。之後,使用反向傳播和梯度下降法更新模型權重,對每個參數進行微調以減少誤差。
這種預測、測量誤差和調整的循環會不斷重複,直到模型收斂到一組權重,使其能夠產生連貫的文本,具有良好的語法、一定的推理能力以及從數據中學到的事實知識。
在 GPT-4 及之後的模型中,除了大量的訓練之外,還增加了一個帶有人類反饋的強化學習階段,在這個階段中,人們(有時是其他模型)會評估反應,並幫助調整行為,使其更好地符合人類的偏好,盡可能避免有害的、不正確的或恰當的反應。
生成過程:LLM 如何寫作
當你與 LLM 互動時(例如,在聊天機器人中輸入提示訊息),其內部處理過程是一種強大的自動完成功能。你輸入的文字會被分詞,轉換成詞嵌入,然後透過轉換器的各個層處理。
此模型逐層調整這些詞嵌入,並藉助自註意力機制考慮上下文和詞元之間的關係。最終,它產生一個關於所有可能後續詞元的機率分佈。
基於這種分佈,系統採用一種或多或少具有確定性的取樣策略來選擇下一個詞元。如果溫度設定為 0.0,模型幾乎總是選擇最有可能的詞元,從而產生非常穩定且缺乏創造性的反應,非常適合編碼或數值任務。
當溫度較高(0,8–1,0)時,選擇風險會增加:模型會探索機率較低但種類較多的詞元,從而產生更具創造性的反應,這對於腦力激盪、敘事寫作或廣告製作非常有用。如果溫度過高(高於約 1,5),輸出結果可能會變得語無倫次,出現「胡言亂語」或毫無意義的短語。
這個過程逐一重複:每個新標記都會加入輸入序列中,模型會重新計算輸出,直到達到最大長度或特殊的完成標記。
情境視窗:模型的短期記憶
使用低階記憶機器人(LLM)體驗的關鍵在於其上下文窗口,即它們一次能夠接收的最大資訊量。實際上,這相當於它們的短期記憶。
早期模型處理的上下文視窗約為 4.000 個字元,大致相當於 3.000 個單字的文字。在這種容量下,模型可以處理相對較短的對話或中等長度的文檔,但無法處理冗長的分析。
最新的高端型號已經能夠處理數十萬甚至數百萬個代幣。這使得上傳整本書、大量的技術文件和大型知識庫成為可能,使LLM能夠在不脫離上下文的情況下,像分析師一樣處理您自己的文件。
上下文視窗並非永久記憶:超出其範圍時,部分文字必須進行概括或刪減。但在這範圍內,保持邏輯連貫性並記住之前說過的內容的能力,是決定互動品質的最重要因素之一。
模型類型:封閉式、開放式和利基式。
法學碩士(LLM)生態系統已分化為幾種理念迥異的模式。一方面,存在一些封閉式或專有模式,例如大型公司開發並以雲端服務形式提供的GPT、Gemini或Claude。
這些模型通常在推理能力、規模和上下文視窗方面最為強大,並且運行在配備專用GPU的超級電腦上。然而,它們就像「黑盒子」一樣運作:它們的具體架構未知,訓練資料的細節也不明確,而且你無法完全控制你提交的資料是如何被使用的。
另一方面,還有一些開放權重模型,例如Llama 3、Mistral 或 Qwen,開發者會發布模型的權重,任何人都可以下載並在自己的硬體上運行。這些模型通常不包含訓練代碼或原始數據,但它們允許非常靈活地進行本地和私人使用。
還有一些真正的開源項目,例如 OLMo,它們不僅共享權重,還共享程式碼,並在可能的情況下共享資料詳情。這些模型對於科學研究、透明度和審計尤其有價值。
最後,還有一些針對特定領域(例如醫學、法律、程式設計或金融)進行訓練或微調的利基模型。雖然它們可能比通用型巨型模型小得多,但在各自的特定領域,它們的準確性和實用性卻可以超越規模更大的模型。
如何解讀模型的“名稱”
如果你瀏覽像 Hugging Face 這樣的程式碼庫,你會看到一些看起來像核密鑰的模型名稱,例如: Llama-3-70b-Instruct-v1-GGUF-q4_k_m該名稱的每個部分都提供了有關該型號的有用資訊。
第一部分Llama-3表示系列和基礎架構,在本例中指的是 Meta 公司的 Llama 3 型號。數字70b表示大小:70.000 億個參數,這可以讓你了解所需的硬體(非常高階的顯示卡或具有大量記憶體的伺服器)。
「Instruct」標籤表示模型經過精心調校,能夠聽懂指令並進行自然對話。如果您想將LLM用作助手,模型名稱中必須包含「Instruct」或類似字樣;否則,該模型可能會表現得像一個普通的文字填充工具,無法很好地回答您的問題。
GGUF片段是一種文件格式,尤其適用於在 CPU 或蘋果設備上運行的模型。其他格式,例如 EXL2、GPTQ 或 AWQ,通常是為 NVIDIA GPU 設計的,並提供不同的效能最佳化。
最後,q4_k_m描述了量化等級(本例中為 4 位元)和具體方法(K-Quants),這會影響磁碟大小、所需記憶體以及為了在更一般的硬體上運行模型而可接受的少量精度損失。
量化:壓縮巨型大腦
最先進的車型以其原始格式可能佔用數十甚至數百GB的空間,並且需要超出家用PC能力的大量記憶體(VRAM)。這就是量化技術發揮作用的地方。
完整的LLM通常以16位元精度(FP16)儲存權重,具有許多小數位,可以進行非常精細的計算。量化會減少位數,例如從16位減少到4位,對數值進行四捨五入,從而大大減少佔用空間和運行所需的記憶體。
令人驚訝的是,對於許多聊天、寫作或總結任務而言,從 16 位到 4 位幾乎不會影響感知品質:最近的研究表明,Q4 中的模型可以保持其在一般用途中約 98% 的實際推理能力,同時權重降低高達 70%。
更激進的量化方式,例如 Q2 或 IQ2,可以將龐大的模型放入非常有限的設備中,但代價很高:在要求更高的邏輯任務中,尤其是在數學和複雜編程中,會出現明顯的相干性損失、循環、重複或故障。
如果你的目標是處理精細的技術任務,建議使用硬體支援的最高量化等級(Q6、Q8,甚至不使用量化),而對於寫作或腦力激盪等較輕的任務,Q4 通常是大多數用戶的最佳選擇。
硬體與顯存:你的電腦效能如何?
要確定你的電腦是否能夠運行某個模型,除了查看系統記憶體之外,還需要考慮顯示卡的顯存容量。一個比較好的經驗法則是,將數十億個參數乘以大約 0,7 GB 的顯存容量(採用適度的量化方法)。
例如,第四季推出的 Llama 3 8B型號將配備約 5,6 GB 顯存,這對於目前大多數遊戲顯示卡來說都綽綽有餘。相較之下,70B型號可能需要約 49 GB 記憶體,這通常是專業顯示卡或多 GPU 配置的專屬配置。
在目前的生態系統中,本地人工智慧領域主要有兩種硬體方案。一方面是英偉達方案,即使用 CUDA 的 RTX 3000、4000 或 5000 系列 GPU,可以提供極高的文本生成速度,但其缺點是顯存價格昂貴,而且在家庭使用中很少超過 24 GB。
另一方面,還有蘋果的方案,它採用 M2、M3 或 M4 晶片和統一內存,配備 96 或 192 GB 共享內存的 Mac 可以加載單個家用 GPU 無法容納的巨型(量化)模型,儘管其生成速度通常較低。
在這兩種情況下, LM Studio或Ollama等工具都能簡化本地模型的下載、配置和執行,讓您可以調整溫度、CPU/GPU 使用率或記憶體等參數,而無需費力地使用複雜的命令列,除非您需要與其他程式進行非常精細的整合。
LLM 與其他類型的生成式人工智慧的比較
例如,當您與圖像生成器互動時,您的提示文字首先會由語言模型進行處理,該模型會理解您的請求,對意圖進行分類,並提取關鍵元素(藝術風格、物件、上下文等)。然後,這些資訊會被轉換成特定影像模型可以使用的表示形式。
這也適用於音訊或音樂生成:LLM 可以理解文字描述(「創作一首鋼琴和弦樂的安靜樂曲」),並將其轉換為專門的音訊模型再轉換為聲音的結構。
在程式碼生成中,LLM 直接參與其中:它們透過大量的原始碼庫、技術文件和使用範例進行訓練,這使得它們能夠編寫函數、解釋錯誤、在程式語言之間進行翻譯,甚至能夠根據自然語言的簡單描述,用 C# 設計像井字棋這樣的小遊戲。
LLM在日常生活中的實際應用
LLM 可以針對特定任務進行微調,從而最大限度地提高其理解和生成文字的能力,使其在個人和商業環境中得到越來越廣泛的應用。
最常見的用途包括使用ChatGPT、Gemini 或 Copilot 等對話式聊天機器人,它們可以作為通用助手,回答問題、解釋概念、幫助完成作業、撰寫電子郵件或起草報告。
另一個非常強大的類別是內容生成:電子商務產品描述、廣告文案、部落格文章、視訊腳本、新聞通訊或社交媒體帖子,所有這些都可以根據相對簡單的指令生成。
在公司中,LLM 用於回答常見問題、自動化一些客戶服務、對大量反饋(評論、調查、社交媒體評論)進行分類和標記,並提取有關品牌認知、重複出現的問題或改進機會的見解。
他們也擅長翻譯和在地化任務、文件分類、相關資訊提取、執行摘要生成,並透過對大量文本進行快速分析來加強人類團隊,從而支持決策。
法學碩士的限制和風險
儘管法學碩士(LLM)功能強大,但其也存在一些重大局限性,在使用時應牢記這些局限性,以免抱有不切實際的期望。
最廣為人知的現像是幻覺:該模型可以產生聽起來非常有說服力但實際上是錯誤或不準確的資訊。這是因為語言學習模型預測的是文本而非事實,如果缺乏足夠的上下文或提示含糊不清,它就會用看似合理但卻是捏造的內容來填補空白。
偏見也必須考慮在內。模型從人類生成的資料中學習,而這些資料必然包含偏見、刻板印象、不平等以及對世界的片面認知。如果沒有控制和校準機制,邏輯學習模型可能會複製甚至放大這些偏見。
另一個關鍵限制在於它對提示的依賴。回應的品質很大程度上取決於你如何措辭:模糊的指示會導致平庸的結果,而精心設計的提示則會產生更有用、更準確、更具可操作性的回應。
最後,低階邏輯模型(LLM)缺乏對世界的真正理解:它們缺乏直接感知,除非添加外部系統,否則它們沒有整合的長期記憶,而且除非提供者啟用,否則它們無法獲取即時資訊。它們的「知識」僅限於訓練資料中已有的內容以及符合目前上下文視窗的內容。
與商業界和工作的關係
在企業環境中,LLM 正在整合到CRM、銷售工具、服務和商務平台中,以提高生產力並改善客戶體驗。
這些模型可以自動執行重複性任務,例如回覆類似的電子郵件、產生初步合約提案、總結通話或會議以及透過即時回覆建議指導人工客服,雖然不一定能取代他們的判斷,但可以減輕很多機械性的工作量。
在行銷和銷售中,它們用於更好地細分客戶、分析大量文字資料(評論、查詢、社交媒體)、個人化訊息,以及發現原本會在成千上萬次互動中被忽略的機會。
這種對工作環境的影響讓人聯想到製造業中的工業機器人:一些單調的工作減少了,工作內容發生了改變,出現了新的功能,這些功能專注於設計、監督和將人工智慧系統整合到現有流程中。
法學碩士的未來:多模態與更強大的能力
語言學習模型的發展趨勢是朝著多模態模型方向發展,這些模型不僅能夠處理文本,還能以整合的方式處理圖像、音訊甚至視訊。這樣一來,單一系統就可以同時理解對話、分析掃描文件、解讀圖表,並對所有這些資訊進行推理。
一些模型已經開始使用文字、音訊和視訊的組合進行訓練,這為自動駕駛汽車、機器人和增強型個人助理等領域的先進應用打開了大門,這些助理可以「看」和「聽」以及閱讀。
隨著訓練技術的改進,LLM有望在準確性、減少偏差和處理最新資訊方面得到提高,並納入外部驗證機制和對即時資料來源的受控存取。
我們還將看到混合模型的整合:高性能封閉模型與專門的開放模型和本地工具相結合,從而能夠維護對最敏感資料的隱私和控制。
簡而言之,LLM(學習型管理軟體)正從一個炫目的新奇事物演變為個人和企業賴以生存的基礎生產力基礎設施。了解LLM的功能、運作方式和局限性,是有效利用LLM的關鍵,這樣才能避免過度委派超出LLM實際處理能力的任務。
對字節世界和一般技術充滿熱情的作家。我喜歡透過寫作分享我的知識,這就是我在這個部落格中要做的,向您展示有關小工具、軟體、硬體、技術趨勢等的所有最有趣的事情。我的目標是幫助您以簡單有趣的方式暢遊數位世界。