การก้าวเข้าสู่โลกของปัญญาประดิษฐ์ระดับท้องถิ่นอาจดูเหมือนเป็นเรื่องที่ซับซ้อนมากในตอนแรก แต่ความจริงก็คือเราอยู่ในยุคทองแล้ว คุณไม่จำเป็นต้องมีศูนย์ข้อมูลในชั้นใต้ดินเพื่อทำเช่นนั้นอีกต่อไป การอนุมานแบบจำลองในปัจจุบัน ด้วยทีมงานที่จัดตั้งอย่างดี คุณสามารถมีผู้ช่วยส่วนตัวที่ไม่ต้องพึ่งพาระบบคลาวด์หรือค่าสมัครสมาชิกรายเดือนได้
เมื่อเราพูดถึงการรันโมเดลในเครื่อง เราหมายถึงขั้นตอนพื้นฐานของการ... การอนุมานนี่คือขั้นตอนที่โมเดลที่ได้รับการฝึกฝนมาแล้วประมวลผลข้อมูลใหม่เพื่อหาคำตอบ ต่างจากการฝึกฝนซึ่งเป็นงานใหญ่ที่ต้องใช้ GPU นับพันตัว การอนุมานนั้นจัดการได้ง่ายกว่ามาก และนี่คือจุดที่ชิปของ Apple สร้างผลกระทบอย่างมากด้วยคุณสมบัติของมัน การจัดการพลังงานอย่างมีประสิทธิภาพ และสถาปัตยกรรมที่ล้ำสมัยของมัน
เคล็ดลับสู่ความสำเร็จ: หน่วยความจำแบบรวมศูนย์
ถ้าจะมีสิ่งหนึ่งที่ทำให้ Mac โดดเด่น ก็คือ... สถาปัตยกรรมหน่วยความจำแบบรวม (UMA)ในพีซีแบบดั้งเดิม คุณต้องย้ายข้อมูลจาก RAM ของระบบไปยัง VRAM ของการ์ดจอ ซึ่งเป็นส่วนที่เสียเวลาอันมีค่าไป แต่ในชิป M4, M3 Ultra หรือชิปที่คล้ายกัน CPU และ GPU จะดึงข้อมูลจากหน่วยความจำเดียวกัน ซึ่ง... ลดเวลาแฝง อย่างมากเมื่อทำการปรับแต่งตัวปรับความตึง
สิ่งนี้สำคัญมากเมื่อเราต้องการโหลด LLM (Large Language Model) ขนาดกลางหรือขนาดใหญ่ ตัวอย่างเช่น Mac Studio ที่มี RAM จำนวนมากสามารถจัดการกับโมเดลที่ต้องการ RAM มากกว่าบนพีซีได้ การ์ด NVIDIA A6000 หลายตัวนี่เป็นการประหยัดค่าใช้จ่ายได้อย่างมหาศาล และที่สำคัญที่สุดคือประหยัดค่าไฟฟ้า เนื่องจากปริมาณการใช้พลังงานนั้นน้อยกว่าคอมพิวเตอร์สำหรับเล่นเกมทั่วไปอย่างมาก
การกำหนดปริมาณและรูปแบบ: วิธีทำให้โมเดลเหมาะสม
เพื่อป้องกันไม่ให้โมเดลที่มีพารามิเตอร์ถึง 70 ล้านล้านตัวทำให้เครื่องของคุณล่ม เราจึงใช้วิธีนี้ การหาปริมาณ. Básicamente, consiste en reducir la precisión de los números (pasar de FP32 a INT8 o incluso 4 bits), lo que encoge el modelo y acelera la respuesta sin que el modelo se vuelva «tonto» o pierda coherencia.
- GGUF: นี่คือรูปแบบที่นิยมใช้สำหรับผู้ที่ใช้ CPU หรือการใช้งานร่วมกันระหว่าง CPU และ GPU เป็นไฟล์เดียวที่บรรจุทุกอย่างที่จำเป็น และเป็นมาตรฐานสำหรับ ลามะ.cpp.
- จีพีทีคิว: ออกแบบมาโดยเฉพาะสำหรับการบินบน GPU เพื่อเพิ่มความเร็วในการประมวลผลให้เหมาะสมที่สุด
- เซฟเทนเซอร์: เป็นทางเลือกที่ปลอดภัยกว่าไฟล์ .bin แบบดั้งเดิมมาก เนื่องจากป้องกันการเรียกใช้โค้ดที่เป็นอันตรายเมื่อโหลดโมเดล
เครื่องมือสำคัญสำหรับการตั้งค่าสภาพแวดล้อมของคุณ
หากคุณไม่อยากยุ่งยากกับการใช้งานเทอร์มินัลตั้งแต่เริ่มต้น ก็มีตัวเลือกที่ง่ายกว่านั้นให้เลือกใช้ แอลเอ็ม สตูดิโอ es probablemente la herramienta más amigable: es un «todo en uno» con interfaz gráfica que te permite เรียกใช้โมเดล AI ในเครื่อง และเรียกใช้งานได้ด้วยการคลิกเพียงครั้งเดียว คุณยังสามารถตั้งค่าได้อีกด้วย เซิร์ฟเวอร์ API ในพื้นที่ ใช้งานร่วมกับ OpenAI เพื่อผสานรวม AI เข้ากับแอปพลิเคชันของคุณเองได้
ในทางกลับกันเรามี โอลามาซึ่งถือเป็นสุดยอดโปรแกรมสำหรับผู้ที่ชื่นชอบโปรแกรมที่มีน้ำหนักเบาหรือใช้งานง่ายด้วยคำสั่ง เป็นโปรแกรมโอเพนซอร์สและทำงานร่วมกับโปรแกรมอื่นๆ ได้อย่างราบรื่น เปิด WebUIทำให้คุณมีอินเทอร์เฟซที่เหมือนกับ ChatGPT ทุกประการ แต่ทำงานบนฮาร์ดแวร์ของคุณโดยสมบูรณ์ผ่านทาง คู่มือฉบับย่อสำหรับการจัดการอบรมหลักสูตรกฎหมายระดับท้องถิ่น (LLM) กับ Ollamaสำหรับผู้ที่ต้องการประสิทธิภาพสูงสุดบน macOS เฟรมเวิร์กนี้เหมาะสำหรับผู้ที่มองหาประสิทธิภาพสูงสุด แอปเปิล MLX นี่คือตัวเลือกที่เหมาะสมที่สุดเพื่อให้ได้ประโยชน์สูงสุดจากซิลิโคนของแบรนด์นี้
ปัญหาด้านฮาร์ดแวร์: พกพาสะดวก หรือ พลังประมวลผลสูง?
นักวิจัยและนักพัฒนาจำนวนมากกำลังลังเลระหว่างสองทางเลือก ทางเลือกแรกคือการทุ่มเทอย่างเต็มที่กับ MacBook Pro M4 สูงสุด มีหน่วยความจำเหลือเฟือ (เช่น 128GB) ข้อดีคือ การวนซ้ำอย่างรวดเร็วคุณสามารถทดสอบไปป์ไลน์ RAG (Recovery Augmented Generation) ได้ทั้งในร้านกาแฟหรือบนเครื่องบิน โดยไม่ต้องพึ่งพาการเชื่อมต่อระยะไกล
ทางเลือกอื่นคือการผสมผสานระหว่าง MacStudio และเป็นแล็ปท็อปน้ำหนักเบา Studio มีระบบระบายความร้อนที่ยอดเยี่ยม คุณสามารถปล่อยให้มันทำงานประมวลผลต่อเนื่องได้นานหลายชั่วโมงโดยที่พัดลมไม่ส่งเสียงดังเหมือนเครื่องบินเจ็ตกำลังขึ้นบิน อย่างไรก็ตาม นี่ก็ทำให้เกิดข้อเสียขึ้นมา อุปสรรคในการเข้าถึงระยะไกลการต้องซิงโครไนซ์สภาพแวดล้อมและข้อมูลระหว่างเครื่องคอมพิวเตอร์สองเครื่องที่แตกต่างกัน อาจขัดขวางกระบวนการสร้างสรรค์ได้
กรณีการใช้งานจริงและข้อจำกัด
ด้วย Mac Mini M4 หรือ MacBook Pro ที่มีอุปกรณ์ครบครัน คุณสามารถสร้างระบบคอมพิวเตอร์ได้ RAG ที่มีฐานข้อมูลเวกเตอร์ เช่น ChromaDB หรือ Qdrant สร้างตัวช่วยเขียนโค้ดในเครื่องด้วย Aider หรือ ถอดเสียงวิดีโอโดยอัตโนมัติโดยใช้ AI ในเครื่อง เหมาะสำหรับการสกัดเอนทิตี้ เหมาะอย่างยิ่งสำหรับการสร้างต้นแบบและประเมินพฤติกรรมของโมเดลเชิงปริมาณที่มีพารามิเตอร์ระหว่าง 7 พันล้านถึง 70 พันล้านตัว
อย่างไรก็ตาม เราไม่ควรพยายามสร้างปาฏิหาริย์ การฝึกอบรมแบบจำลองอย่างเข้มข้นหรือ... การปรับแต่งที่ซับซ้อน ทีมเหล่านี้ไม่ใช่จุดแข็ง หากขั้นตอนการทำงานของคุณขึ้นอยู่กับทีมเหล่านี้ทั้งหมด ระบบนิเวศ CUDA สำหรับการใช้งานกับ NVIDIA คุณอาจพบกับอุปสรรคบ้าง เนื่องจาก Metal (API ของ Apple) ไม่ใช่สิ่งที่จะมาทดแทนได้อย่างสมบูรณ์แบบ แม้ว่าในด้านการประมวลผลแบบอนุมาน ช่องว่างจะแคบลงอย่างมากแล้วก็ตาม
นักเขียนผู้หลงใหลเกี่ยวกับโลกแห่งไบต์และเทคโนโลยีโดยทั่วไป ฉันชอบแบ่งปันความรู้ผ่านการเขียน และนั่นคือสิ่งที่ฉันจะทำในบล็อกนี้ เพื่อแสดงให้คุณเห็นสิ่งที่น่าสนใจที่สุดเกี่ยวกับอุปกรณ์ ซอฟต์แวร์ ฮาร์ดแวร์ แนวโน้มทางเทคโนโลยี และอื่นๆ เป้าหมายของฉันคือการช่วยคุณนำทางโลกดิจิทัลด้วยวิธีที่เรียบง่ายและสนุกสนาน



