A lokális mesterséges intelligencia világába való belépés elsőre ijesztő feladatnak tűnhet, de a valóság az, hogy aranykorban élünk. Nincs többé szükség egy pinceszinti adatközpontra a modellkövetkeztetések elvégzéséhez ; ma már egy jól konfigurált csapattal saját asszisztensünk lehet, amely nem függ a felhőtől vagy a havi előfizetésektől.
Amikor modellek lokális futtatásáról beszélünk, alapvetően a következtetési fázisra utalunk , amely az, amikor egy betanított modell új adatokat dolgoz fel, hogy választ adjon nekünk. A betanítással ellentétben, amely egy monumentális feladat, amely több ezer GPU-t igényel, a következtetés sokkal kezelhetőbb, és itt érnek el nagy hatást az Apple chipek hatékony energiagazdálkodásuknak és innovatív architektúrájuknak köszönhetően.
A siker titka: az egységes memória
Ha van valami, ami megkülönbözteti a Mac gépeket, az az Unified Memory Architecture (UMA) . Egy hagyományos PC-n az adatokat a rendszer RAM-ból a grafikus kártya VRAM-jába kell áthelyezni, és itt vész el értékes idő. Az M4, M3 Ultra és hasonló chipek esetében a CPU és a GPU ugyanabból a memóriakészletből merít energiát, ami drasztikusan csökkenti a késleltetést a tenzorok kezelésekor.
Ez létfontosságú, ha közepes vagy nagyméretű LLM-eket (nagyméretű nyelvi modelleket) szeretnénk betölteni. Például egy bőséges RAM-mal rendelkező Mac Studio olyan modelleket is képes befogadni, amelyekhez a PC-s világban több NVIDIA A6000 kártyára lenne szükség , ami hatalmas költségmegtakarítást és mindenekelőtt a villanyszámlán való megtakarítást eredményez, mivel a fogyasztás töredéke annak, amit egy játéktorony fogyasztana.
Kvantálás és formátumok: Hogyan illeszthető a modell?
Annak érdekében, hogy megakadályozzuk, hogy egy 70 billió paraméterrel rendelkező modell összeomoljon a gépünkön, kvantálást használunk . Lényegében ez a számok pontosságának csökkentését jelenti (FP32-ről INT8-ra vagy akár 4 bitre), ami csökkenti a modellt és felgyorsítja a választ anélkül, hogy "butává" tenné, vagy elveszítené a koherenciáját.
- GGUF: Ez az előnyben részesített formátum azok számára, akik CPU-t vagy CPU és GPU kombinációját használják. Ez egyetlen fájl, amely mindent tartalmaz, amire szükség van, és ez a szabvány a következőkhöz: call.cpp.
- GPTQ: Kifejezetten GPU-kon való működésre tervezték, optimalizálva a feldolgozási sebességet.
- Biztonsági feszítők: Sokkal biztonságosabb megoldás, mint a hagyományos .bin fájlok, mivel megakadályozza a rosszindulatú kódok végrehajtását a modell betöltésekor.
Nélkülözhetetlen eszközök a környezet kialakításához
Ha nem szeretnél a legelejétől fogva bajlódni a terminállal, van néhány nagyon egyszerű lehetőség. Az LM Studio valószínűleg a legfelhasználóbarátabb eszköz: egy többfunkciós megoldás grafikus felülettel, amely lehetővé teszi a mesterséges intelligencia modellek helyi futtatását és egyetlen kattintással történő elindítását. Akár egy helyi , OpenAI-kompatibilis API-kiszolgálót is beállíthatsz, hogy a mesterséges intelligenciát integráld a saját alkalmazásaidba.
Másrészről ott van az Ollama , a koronaékszer azok számára, akik valami könnyebbet vagy parancssori alapút kedvelnek. Nyílt forráskódú és zökkenőmentesen integrálódik az Open WebUI- val , lehetővé téve a ChatGPT-hez hasonló, de teljes egészében a hardvereden futó felületet. Egy gyors útmutató a helyi LLM-ek Ollama-val történő futtatásához is elérhető. Azok számára, akik maximális teljesítményt keresnek macOS rendszeren, az Apple MLX keretrendszere az optimalizált megoldás, hogy a legtöbbet hozzák ki a vállalat szilíciumából.
Hardverdilemma: Hordozhatóság vagy nyers erő?
Sok kutató és fejlesztő két út között őrlődik. Az első lehetőség egy teljes értékű MacBook Pro M4 Max beszerzése bőséges memóriával (például 128 GB). Az előnye a gyors iteráció : egy kávézóban vagy egy repülőgépen tesztelhetünk egy RAG (Recovery Augmented Generation) folyamatot távoli kapcsolat nélkül.
Az alternatíva egy Mac Studio és egy pehelykönnyű laptop kombinációja. A Studio egy igazi hővadék; órákig futtathatod anélkül, hogy a ventilátor úgy hangzana, mint egy felszálló sugárhajtómű. Ez azonban magában hordozza a távoli hozzáférés súrlódását , mivel két különböző gép közötti környezetek és adatok szinkronizálását igényli, ami megzavarhatja a kreatív folyamatot.
Valós használati esetek és korlátok
Egy Mac Mini M4-gyel vagy egy jól felszerelt MacBook Próval RAG rendszereket állíthatsz be vektoradatbázisokkal, mint például a ChromaDB vagy a Qdrant, helyi kódasszisztenseket hozhatsz létre az Aiderrel, vagy automatikusan átírhatsz videókat helyi mesterséges intelligencia segítségével a jellemzők kinyeréséhez. Ideális prototípuskészítéshez és 7 és 70 milliárd közötti paraméterrel rendelkező kvantált modellek viselkedésének kiértékeléséhez.
Azonban ne várjunk csodákat. Az intenzív modelltanítás vagy az összetett finomhangolás nem ezeknek a gépeknek az erősségei. Ha a munkafolyamatunk nagymértékben az NVIDIA CUDA ökoszisztémákra támaszkodik , akkor némi akadályba ütközhetünk, mivel a Metal (az Apple API-ja) nem helyettesíti zökkenőmentesen, bár a következtetés terén a különbség jelentősen csökkent.
Szenvedélyes író a bájtok és általában a technológia világáról. Szeretem megosztani tudásomat írásban, és ezt fogom tenni ebben a blogban, megmutatom a legérdekesebb dolgokat a kütyükről, szoftverekről, hardverekről, technológiai trendekről stb. Célom, hogy egyszerű és szórakoztató módon segítsek eligazodni a digitális világban.



