Kohaliku tehisintellekti maailma sisenemine võib alguses tunduda hirmuäratava ülesandena, kuid tegelikult elame kuldajastul. Mudelijärelduste tegemiseks pole enam vaja keldrikorruse andmekeskust ; tänapäeval on hästi konfigureeritud meeskonnaga võimalik omada isiklikku assistenti, kes ei sõltu pilvest ega kuutasudest.
Kui me räägime mudelite lokaalsest käitamisest, peame silmas põhimõtteliselt järeldamisfaasi , mis toimub siis, kui treenitud mudel töötleb uusi andmeid, et meile vastust anda. Erinevalt treenimisest, mis on monumentaalne ülesanne, mis nõuab tuhandeid GPU-sid, on järeldamine palju paremini hallatav ja just siin avaldavad Apple'i kiibid tänu oma tõhusale energiahaldusele ja uuenduslikule arhitektuurile suurt mõju.
Edu saladus: ühtne mälu
Kui Mace miski eristab, siis on see ühtne mäluarhitektuur (UMA) . Traditsioonilisel PC-l tuleb andmed süsteemi muutmälust graafikakaardi videomälusse teisaldada ja just seal läheb kaduma väärtuslikku aega. M4, M3 Ultra ja sarnaste kiipide puhul kasutavad protsessor ja graafikakaart samast mälumahust, mis vähendab oluliselt latentsusaega tensorite käsitlemisel.
See on ülioluline, kui tahame laadida keskmise või suure keelega mudeleid (LLM). Näiteks mahutab suure hulga muutmäluga Mac Studio mudeleid, mis PC-maailmas vajaksid mitut NVIDIA A6000 kaarti , mille tulemuseks on tohutu kokkuhoid kuludelt ja ennekõike elektriarvelt, kuna tarbimine on murdosa sellest, mida kasutaks mängutorn.
Kvantimine ja vormingud: kuidas mudelit sobivaks muuta
Selleks, et 70 triljoni parameetriga mudel teie masinat kokku ei kukuks, kasutame kvantiseerimist . Põhimõtteliselt hõlmab see numbrite täpsuse vähendamist (FP32-lt INT8-le või isegi 4 bitile), mis vähendab mudelit ja kiirendab vastust ilma seda "rumalaks" muutmata või sidususe kaotamata.
- GGUF: See on eelistatud vorming neile, kes kasutavad protsessorit või protsessori ja graafikaprotsessori kombinatsiooni. See on üks fail, mis sisaldab kõike vajalikku ja on standardvorming call.cpp.
- GPTQ: Spetsiaalselt GPU-dega töötamiseks loodud, optimeerides töötlemiskiirust.
- Turvaelemendid: Palju turvalisem variant kui traditsioonilised .bin-failid, kuna see takistab pahatahtliku koodi käivitamist mudeli laadimisel.
Olulised tööriistad oma keskkonna loomiseks
Kui te ei soovi terminaliga algusest peale vaeva näha, on olemas mõned väga lihtsad valikud. LM Studio on ilmselt kõige kasutajasõbralikum tööriist: see on kõik-ühes lahendus graafilise liidesega, mis võimaldab teil tehisintellekti mudeleid lokaalselt käivitada ja neid ühe klõpsuga käivitada. Saate isegi seadistada kohaliku OpenAI-ga ühilduva API-serveri, et integreerida tehisintellekt oma rakendustesse.
Teisest küljest on meil Ollama , kroonijuveel neile, kes eelistavad midagi kergemat või käsureapõhist. See on avatud lähtekoodiga ja integreerub sujuvalt Open WebUI-ga , võimaldades teil kasutada ChatGPT-ga identset liidest, mis töötab täielikult teie riistvaral. Saadaval on ka kiirjuhend kohalike LLM-ide käitamiseks Ollamaga . Neile, kes otsivad macOS-is maksimaalset jõudlust, on Apple'i MLX- raamistik optimeeritud valik, et ettevõtte silikoonist maksimumi võtta.
Riistvara dilemma: kaasaskantavus või toores jõud?
Paljud teadlased ja arendajad on kahe tee vahel kahevahel. Esimene võimalus on osta MacBook Pro M4 Max , millel on palju mälu (näiteks 128 GB). Selle eeliseks on kiire iteratsioon : saate kohvikus või lennukis RAG-i (Recovery Augmented Generation) torujuhet testida ilma kaugühenduseta.
Alternatiiviks on Mac Studio ja kerge sülearvuti kombinatsioon. Studio on termiline koletis; saate jätta selle tundideks pikki arvutusi tegema, ilma et ventilaator kõlaks nagu tõusev reaktiivmootor. See aga toob kaasa kaugjuurdepääsu hõõrdumise , mis nõuab keskkondade ja andmete sünkroonimist kahe erineva masina vahel, mis võib teie loomingulist voolu häirida.
Reaalse maailma kasutusjuhud ja piirangud
Mac Mini M4 või hästi varustatud MacBook Pro abil saate seadistada RAG-süsteeme vektorandmebaasidega nagu ChromaDB või Qdrant, luua Aideriga kohalikke koodiassistente või automaatselt transkribeerida videoid, kasutades kohalikku tehisintellekti funktsioonide eraldamiseks. See on ideaalne prototüüpimiseks ja kvantiseeritud mudelite käitumise hindamiseks 7–70 miljardi parameetriga.
Siiski ärge oodake imesid. Intensiivne mudelikoolitus või keerukas peenhäälestus pole nende masinate tugevad küljed. Kui teie töövoog tugineb suuresti NVIDIA CUDA ökosüsteemidele , puutute kokku mõningate takistustega, kuna Metal (Apple'i API) ei ole sujuv asendus, kuigi järelduste osas on vahe märkimisväärselt vähenenud.
Kirglik kirjanik baitide maailmast ja üldse tehnoloogiast. Mulle meeldib jagada oma teadmisi kirjutamise kaudu ja just seda ma selles ajaveebis teengi, näitan teile kõike kõige huvitavamat vidinate, tarkvara, riistvara, tehnoloogiliste suundumuste ja muu kohta. Minu eesmärk on aidata teil digimaailmas lihtsal ja meelelahutuslikul viisil navigeerida.



