Å gå inn i den lokale kunstige intelligensens verden kan virke som en skremmende oppgave i starten, men realiteten er at vi lever i en gullalder. Du trenger ikke lenger et datasenter i kjelleren for å utføre modellinferens ; i dag, med et godt konfigurert team, kan du ha din egen private assistent som ikke er avhengig av skyen eller månedlige abonnementer.
Når vi snakker om å kjøre modeller lokalt, refererer vi i bunn og grunn til inferensfasen , som er når en trent modell behandler nye data for å gi oss et svar. I motsetning til trening, som er en monumental oppgave som krever tusenvis av GPU-er, er inferens mye mer håndterbar, og det er her Apple-brikker har en sterk innvirkning takket være effektiv strømstyring og innovativ arkitektur.
Hemmeligheten bak suksess: Enhetlig minne
Hvis det er én ting som skiller Mac-er fra andre, så er det Unified Memory Architecture (UMA) . På en tradisjonell PC må du flytte data fra system-RAM til grafikkortets VRAM, og det er der verdifull tid går tapt. Med M4, M3 Ultra og lignende brikker bruker CPU og GPU samme minnepool, noe som reduserer latensen drastisk ved håndtering av tensorer.
Dette er viktig når vi ønsker å laste inn mellomstore eller store LLM-er (store språkmodeller). For eksempel kan et Mac Studio med en generøs mengde RAM romme modeller som i PC-verdenen ville kreve flere NVIDIA A6000-kort , noe som resulterer i store besparelser i kostnader og fremfor alt på strømregningen, siden forbruket er en brøkdel av det et spilltårn ville bruke.
Kvantisering og formater: Hvordan få modellen til å passe
For å forhindre at en modell med 70 billioner parametere krasjer maskinen din, bruker vi kvantisering . I hovedsak innebærer dette å redusere presisjonen til tallene (gå fra FP32 til INT8 eller til og med 4 bit), noe som krymper modellen og øker hastigheten på responsen uten å gjøre den "dum" eller føre til at den mister koherens.
- GGUF: Det er det foretrukne formatet for de som bruker en CPU eller en kombinasjon av CPU og GPU. Det er en enkelt fil som inneholder alt som trengs, og er standarden for ring.cpp.
- GPTQ: Spesielt utviklet for å kjøre på GPU-er, og optimaliserer prosesseringshastigheten.
- Sikkerhetsspennere: Et mye tryggere alternativ enn tradisjonelle .bin-filer, ettersom det forhindrer kjøring av ondsinnet kode når modellen lastes inn.
Viktige verktøy for å sette opp miljøet ditt
Hvis du ikke vil slite med terminalen fra starten av, finnes det noen veldig enkle alternativer. LM Studio er sannsynligvis det mest brukervennlige verktøyet: det er en alt-i-ett-løsning med et grafisk grensesnitt som lar deg kjøre AI-modeller lokalt og starte dem med et enkelt klikk. Du kan til og med sette opp en lokal OpenAI-kompatibel API-server for å integrere AI i dine egne apper.
På den annen side har vi Ollama , kronjuvelen for de som foretrekker noe lettere eller kommandolinjebasert. Det er åpen kildekode og integreres sømløst med Open WebUI , slik at du får et grensesnitt identisk med ChatGPT, men som kjører utelukkende på maskinvaren din. En rask guide til å kjøre lokale LLM-er med Ollama er også tilgjengelig. For de som søker maksimal ytelse på macOS, er Apples MLX- rammeverk det optimaliserte alternativet for å få mest mulig ut av selskapets silisium.
Maskinvaredilemma: Portabilitet eller rå kraft?
Mange forskere og utviklere er splittet mellom to veier. Det første alternativet er å satse alt på en MacBook Pro M4 Max med mye minne (som 128 GB). Fordelen er rask iterasjon : du kan være på en kafé eller på et fly og teste en RAG-pipeline (Recovery Augmented Generation) uten å være avhengig av en ekstern tilkobling.
Alternativet er en Mac Studio og en lett bærbar PC-kombinasjon. Studio er et termisk beist; du kan la den kjøre lange forstyrrelser i timevis uten at viften høres ut som en jetmotor som letter. Dette introduserer imidlertid friksjonen med fjerntilgang , som krever at du synkroniserer miljøer og data mellom to forskjellige maskiner, noe som kan forstyrre den kreative flyten din.
Eksempler og begrensninger på bruk i den virkelige verden
Med en Mac Mini M4 eller en velutstyrt MacBook Pro kan du sette opp RAG-systemer med vektordatabaser som ChromaDB eller Qdrant, lage lokale kodeassistenter med Aider, eller automatisk transkribere videoer ved hjelp av lokal AI for å trekke ut funksjoner. Det er ideelt for prototyping og evaluering av oppførselen til kvantiserte modeller med mellom 7 milliarder og 70 milliarder parametere.
Forvent imidlertid ikke mirakler. Intensiv modelltrening eller kompleks finjustering er ikke disse maskinenes sterke sider. Hvis arbeidsflyten din er sterkt avhengig av NVIDIA CUDA-økosystemer , vil du støte på noen hindringer, ettersom Metal (Apples API) ikke er en sømløs erstatning, selv om gapet har blitt betydelig mindre for slutning.
Lidenskapelig forfatter om verden av bytes og teknologi generelt. Jeg elsker å dele kunnskapen min gjennom å skrive, og det er det jeg skal gjøre i denne bloggen, vise deg alle de mest interessante tingene om dingser, programvare, maskinvare, teknologiske trender og mer. Målet mitt er å hjelpe deg med å navigere i den digitale verden på en enkel og underholdende måte.



