- Mažųjų kalbų modelių (SLM) diegimas ir kvantavimas, siekiant paleisti dirbtinį intelektą vietinėje įrangoje, nesiremiant debesimi.
- Naudojant RAG architektūrą ir vektorines duomenų bazes, siekiant gauti tikslius atsakymus, pagrįstus privačiais dokumentais.
- Aparatinės įrangos reikalavimai, orientuoti į NVIDIA GPU VRAM ir Apple Silicon unifikuotą atmintį.
- Privatumo ir duomenų suvereniteto pranašumai, kuriuos suteikia semantinis indeksavimas įmonės NAS serveriuose.

Įsivaizduokite, kad skaitmeninės smegenys apdoroja visą jūsų asmeninę informaciją nė sekundės neišeidamos iš biuro. Iki šiol dirbtinio intelekto sistemos diegimas namuose buvo NASA inžinieriaus galvos skausmas, kovojant su kodo priklausomybėmis ir aparatine įranga, kuri veikė karščiau nei skrudintuvas. Tačiau situacija radikaliai pasikeitė ir šiandien visiškai įmanoma diegti mažus kalbos modelius vietiniuose kompiuteriuose, paverčiant paprastą failų saugyklą išmaniuoju asistentu.
Tikroji revoliucija įvyksta susijungus prie tinklo prijungtai saugyklai (NAS) ir mašininiam mokymuisi periferijoje. Mes nebekalbame apie paprastus, neapibrėžtus įrenginius, kurie saugo tik nulius ir vienetus, o apie išmaniuosius serverius su NPU, gebančiais suprasti, kas yra nuotraukoje, ar per kelias sekundes apibendrinti teisinę sutartį. Ši galimybė apdoroti duomenis nesiremiant debesimi yra ne tik patogumo klausimas, bet ir patikimas bet kurio verslo ar individualaus vartotojo privatumo skydas, optimizuojantis vietinę saugyklą, o ne debesijos kompiuteriją.
NAS evoliucija: nuo kietojo disko iki skaitmeninių smegenų

Tradicinis duomenų saugojimas jau daugelį metų yra duomenų juodoji skylė. Mažos ir vidutinės įmonės (MVĮ) dažnai kaupia terabaitus PDF failų, vaizdų ir vaizdo įrašų, kurie galiausiai palaidojami aplankuose su absurdiškais pavadinimais, tokiais kaip „final_v2_this_is_it“. Problema ta, kad įprastas NAS negali atpažinti, kad nuotrauka yra rinkodaros demonstracija; jis mato tik failą. Čia ir praverčia dirbtiniu intelektu pagrįstas NAS , naudojantis pažangius procesorius, tokius kaip AMD Ryzen, su neuroniniais procesoriais (NPU), kad semantiškai indeksuotų turinį.
Dėl to galime įdiegti semantinę paiešką . Užuot ieškoję tikslaus failo pavadinimo, jūs paprašote serverio: „Atsiųskite man meno kūrinio lietuje nuotraukas“, o dirbtinis intelektas, kuris jau išanalizavo vaizdus naudodamas vizualinės kalbos modelius (VLM), grąžina tikslius rezultatus. Ši sistema leidžia aparatinei įrangai, tokiai kaip „Minisforum N5“ serija, atlikti objektų atpažinimą realiuoju laiku ir OCR , taip sutaupant kūrybinėms ar administracinėms komandoms valandų valandas rankinio darbo.
Mažųjų kalbų modeliai (SLM) ir milžiniškųjų kalbų modeliai (LLM)

Kad visa tai veiktų vietiniame serveryje nesugadinant sistemos, naudojami mažųjų kalbų modeliai (SLM) . Nors LLM (pvz., GPT-4) turi milijardus parametrų ir reikalauja serverių ūkių, SLM paprastai turi mažiau nei 10 milijardų parametrų. Tokie modeliai kaip „Microsoft Phi-3“, „Mistral 7B“ arba „Gemma“ idealiai tinka vietiniam diegimui, nes jie yra daug greitesni, sunaudoja mažiau RAM ir yra mažiau linkę į perkrovą.
Svarbiausia, kad šie modeliai veiktų su kuklia technine įranga, yra kvantizavimas . Ši technika apima modelio svorių tikslumo sumažinimą (pavyzdžiui, nuo FP32 iki INT8 arba INT4), o tai smarkiai sumažina atminties naudojimą nepadarant modelio neišmanaus. Tai leidžia galingam modeliui tilpti į vartotojo vaizdo plokštės VRAM arba „Mac“ unifikuotąją atmintį, pagreitinant išvadas ir užtikrinant beveik momentinius atsakymus.
Pažangios architektūros: RAG ir techninis diegimas

Siekiant užkirsti kelią dirbtinio intelekto išsigalvojimui (liūdnai pagarsėjusioms haliucinacijoms), naudojama technika, vadinama „Recall Augmented Generation“ (RAG ). Užuot vien pasikliavusi tuo, ko modelis išmoko mokymo metu, sistema suskaido jūsų vietinius dokumentus į dalis, konvertuoja juos į skaitmeninius vektorius (įterpimus) ir saugo vektorinėje duomenų bazėje, pvz., FAISS . Kai užduodate klausimą, sistema ieško jūsų failuose tinkamiausio teksto fragmento ir perduoda jį modeliui, kad šis sugeneruotų atsakymą, pagrįstą realiais, vietiniais įrodymais.
Jei mėgstate programuoti, galite sukonfigūruoti šią aplinką naudodami „FastAPI“ sąsajai ir „LangChain“ raginimams valdyti. Įprastas darbo eigas apimtų kvantinio modelio įkėlimą naudojant „Hugging Face“ „Transformers“ biblioteką, prisijungimą prie vektorinės duomenų bazės ir visko atskleidimą per REST API. Tiems, kurie nenori rašyti kodo, yra įrankių, tokių kaip vietinių LLM vykdymas naudojant „Ollama“ arba „LM Studio“, kurie valdo modelių atsisiuntimą ir vykdymą vienu spustelėjimu ir netgi leidžia perjungti vietinius modelius ir debesies paslaugas, atsižvelgiant į duomenų jautrumą.
Rekomenduojama vietinio dirbtinio intelekto aparatinė įranga

Pagrindinė kliūtis yra aparatinė įranga. Kompiuterių ekosistemoje svarbiausia yra GPU vaizdo atmintis (VRAM ); RTX 4090 su 24 GB atmintimi yra auksinis standartas patogiam modelių, turinčių iki 30 GB parametrų, veikimui. Kita vertus, „Apple Silicon“ lustai (M2/M3/M4) yra stebėtinai efektyvūs dėl suvienodintos atminties, kuri palengvina vietinio dirbtinio intelekto nustatymą „macOS“ sistemoje , leidžiantį GPU pasiekti visą sistemos RAM, todėl lengviau paleisti didesnius modelius nei įprastuose kompiuteriuose.
- Įvesties diapazonas: Sistemos su 16 GB RAM ir kukliais GPU modeliais su 3B–7B parametrais.
- Vidutinės klasės: Galingi NAS įrenginiai arba „Mac“ kompiuteriai su 32–64 GB RAM, skirti 13–20 GB modeliams su kvantavimu.
- Profesionalus asortimentas: 70B ar vėlesnių modelių darbo stotys su keliais GPU (A6000 arba 4090).
Tokie prekių ženklai kaip „QNAP“ jau integruoja tokias funkcijas kaip „Qsirch AI Mode“ , kuris sujungia VLM ir LLM, kad apibendrintų dokumentus, verstų tekstus ir nustatytų tikslius vaizdo ar garso įrašų momentus naudojant automatinę transkripciją (ASR), tuo pačiu gerbiant naudotojų teises ir duomenims neišeinant iš vietinio tinklo.
Įgyvendinimo ir saugumo strategijos
Dirbtinio intelekto sistemos diegimas įmonėje yra daugiau nei vien programinės įrangos diegimas. Labai svarbu laikytis 3-2-1 atsarginių kopijų kūrimo taisyklės (trys kopijos, dvi laikmenoje, viena ne vietoje), kad neprarastumėte dirbtinio intelekto indekso sugedus aparatinei įrangai, visada įvertinant geriausią atsarginių kopijų kūrimo strategiją tarp vietinės ir debesies saugyklos . Be to, patartina indeksuoti duomenis partijomis per naktį, kad darbuotojai dirbdami neperkrautų biuro pralaidumo.
Diegimą sudėtingesnėse aplinkose gali palaikyti „Kubernetes“ (AKS) ir operatoriai, tokie kaip KAITO, kurie automatizuoja GPU mazgų valdymą ir modelio mastelio keitimą. Tai užtikrina tvirtą infrastruktūrą ir apsaugo dirbtinį intelektą nuo gedimų, kai keli vartotojai vienu metu vykdo užklausas. Duomenų suverenitetas čia yra didžiausias privalumas: panaikindami priklausomybę nuo mėnesinių prenumeratų ir neleisdami debesijos paslaugų teikėjams mokyti savo modelių naudojant jūsų duomenis , atgaunate visišką savo intelektinės nuosavybės kontrolę.
Specializuotos aparatinės įrangos, kompaktiškų, kvantizavimo būdu optimizuotų modelių ir vietinių duomenų atkūrimo architektūrų konvergencija dabar leidžia kurti darbo ekosistemas, kuriose privatumas yra svarbiausias. Integravus šiuos įrankius į galingą NAS arba darbo stotį, informacijos valdymas transformuojamas į aktyvų ir semantinį procesą, pašalinant rankinių paieškų trintį ir užtikrinant, kad įmonės žinios visada būtų prieinamos ir apsaugotos.
Aistringas rašytojas apie baitų pasaulį ir technologijas apskritai. Man patinka dalytis savo žiniomis rašydamas, būtent tai ir darysiu šiame tinklaraštyje, parodysiu jums įdomiausius dalykus apie programėles, programinę įrangą, techninę įrangą, technologijų tendencijas ir kt. Mano tikslas – padėti jums paprastai ir smagiai naršyti skaitmeniniame pasaulyje.