Iš pradžių įžengti į vietinio dirbtinio intelekto pasaulį gali atrodyti kaip bauginanti užduotis, tačiau realybė tokia, kad išgyvename aukso amžių. Jums nebereikia duomenų centro rūsyje, kad atliktumėte modelio išvadas ; šiandien, turėdami gerai sukonfigūruotą komandą, galite turėti savo asmeninį asistentą, kuris nepriklauso nuo debesijos ar mėnesinių prenumeratų.
Kalbėdami apie modelių paleidimą vietoje, iš esmės turime omenyje išvadų darymo etapą , kai apmokytas modelis apdoroja naujus duomenis, kad pateiktų mums atsakymą. Skirtingai nuo mokymo, kuris yra monumentali užduotis, reikalaujanti tūkstančių GPU, išvadų darymas yra daug lengviau valdomas, ir būtent čia „Apple“ lustai daro didelę įtaką dėl savo efektyvaus energijos valdymo ir novatoriškos architektūros.
Sėkmės paslaptis: vieninga atmintis
Jei yra vienas dalykas, kuris išskiria „Mac“ kompiuterius, tai vieningoji atminties architektūra (UMA) . Tradiciniame asmeniniame kompiuteryje duomenis reikia perkelti iš sistemos RAM į vaizdo plokštės VRAM, ir čia prarandamas brangus laikas. Naudojant „M4“, „M3 Ultra“ ir panašius lustus, centrinis procesorius ir vaizdo plokštė naudoja tą patį atminties telkinį, todėl tenzorių tvarkymo delsa gerokai sumažėja .
Tai gyvybiškai svarbu, kai norime įkelti vidutinio ar didelio kalbų modelio (LLM) modelius. Pavyzdžiui, „Mac Studio“ su didele RAM atminties talpa gali palaikyti modelius, kuriems asmeninių kompiuterių pasaulyje reikėtų kelių „NVIDIA A6000“ plokščių , todėl sutaupoma daug išlaidų ir, svarbiausia, elektros energijos sąskaitos, nes suvartojimas yra tik dalis to, ką sunaudotų žaidimų bokštas.
Kvantavimas ir formatai: kaip pritaikyti modelį
Kad 70 trilijonų parametrų modelis nesugadintų jūsų kompiuterio, naudojame kvantizavimą . Iš esmės tai reiškia skaičių tikslumo sumažinimą (nuo FP32 iki INT8 ar net 4 bitų), kuris sumažina modelį ir pagreitina atsaką, nepadarydamas jo „kvailu“ ir neprarasdamas koherencijos.
- GGUF: Tai yra pageidaujamas formatas tiems, kurie naudoja centrinį procesorių arba centrinio ir grafikos procesoriaus derinį. Tai vienas failas, kuriame yra viskas, ko reikia, ir yra standartas skambinti.cpp.
- GPTQ: Sukurta specialiai veikti su GPU, optimizuojant apdorojimo greitį.
- Saugikliai: Daug saugesnis pasirinkimas nei tradiciniai .bin failai, nes jis neleidžia vykdyti kenkėjiško kodo įkeliant modelį.
Svarbiausi įrankiai jūsų aplinkai sukurti
Jei nenorite nuo pat pradžių vargti su terminalu, yra keletas labai paprastų variantų. „LM Studio“ tikriausiai yra patogiausias įrankis: tai universalus sprendimas su grafine sąsaja, leidžiančia vietoje paleisti dirbtinio intelekto modelius ir juos paleisti vienu spustelėjimu. Galite netgi nustatyti vietinį su „OpenAI“ suderinamą API serverį, kad integruotumėte dirbtinį intelektą į savo programas.
Kita vertus, turime „Ollama“ – tų, kurie renkasi ką nors lengvesnio arba pagrįsto komandine eilute, perlas. Jis yra atvirojo kodo ir sklandžiai integruojasi su „Open WebUI“ , leisdamas turėti sąsają, identišką „ChatGPT“, bet veikiančią tik jūsų aparatinėje įrangoje. Taip pat yra trumpas vadovas, kaip paleisti vietines LLM su „Ollama“ . Tiems, kurie siekia maksimalaus našumo „macOS“, „Apple MLX“ sistema yra optimizuotas pasirinkimas, kad išnaudotų visas įmonės silicio galimybes.
Aparatinės įrangos dilema: perkeliamumas ar neapdorota galia?
Daugelis tyrėjų ir kūrėjų blaškosi tarp dviejų kelių. Pirmasis variantas – įsigyti „MacBook Pro M4 Max“ su didele atminties talpa (pvz., 128 GB). Privalumas – greitas iteracijos procesas : galite kavinėje ar lėktuve išbandyti RAG (atkūrimo papildytos kartos) kanalą, nepasikliaudami nuotoliniu ryšiu.
Alternatyva – „Mac Studio“ ir lengvo nešiojamojo kompiuterio derinys. „Studio“ yra šiluminis žvėris; galite leisti jam veikti valandų valandas, o ventiliatorius neskambės kaip kylantis reaktyvinis variklis. Tačiau tai sukelia nuotolinės prieigos trintį , reikalaujančią sinchronizuoti aplinkas ir duomenis tarp dviejų skirtingų kompiuterių, o tai gali sutrikdyti jūsų kūrybinį srautą.
Realaus pasaulio naudojimo atvejai ir apribojimai
Naudodami „Mac Mini M4“ arba gerai įrengtą „MacBook Pro“, galite nustatyti RAG sistemas su vektorinėmis duomenų bazėmis, tokiomis kaip „ChromaDB“ ar „Qdrant“, kurti vietinius kodo asistentus naudodami „Aider“ arba automatiškai transkribuoti vaizdo įrašus naudodami vietinį dirbtinį intelektą , kad išskirtumėte funkcijas. Tai idealiai tinka prototipų kūrimui ir kvantinių modelių, turinčių nuo 7 iki 70 milijardų parametrų, elgsenos vertinimui.
Tačiau nesitikėkite stebuklų. Intensyvus modelių mokymas ar sudėtingas tikslus derinimas nėra šių mašinų stipriosios pusės. Jei jūsų darbo eiga labai priklauso nuo NVIDIA CUDA ekosistemų , susidursite su tam tikromis kliūtimis, nes „Metal“ („Apple“ API) nėra sklandi pakaitalas, nors skirtumas išvadų srityje gerokai sumažėjo.
Aistringas rašytojas apie baitų pasaulį ir technologijas apskritai. Man patinka dalytis savo žiniomis rašydamas, būtent tai ir darysiu šiame tinklaraštyje, parodysiu jums įdomiausius dalykus apie programėles, programinę įrangą, techninę įrangą, technologijų tendencijas ir kt. Mano tikslas – padėti jums paprastai ir smagiai naršyti skaitmeniniame pasaulyje.



