כניסה לעולם הבינה המלאכותית המקומית אולי נראית בהתחלה כמשימה מרתיעה, אבל המציאות היא שאנחנו בתור זהב. כבר לא צריך מרכז נתונים במרתף כדי לבצע הסקת מודלים ; כיום, עם צוות מוגדר היטב, אפשר שיהיה לכם עוזר פרטי משלכם שאינו תלוי בענן או במנויים חודשיים.
כשאנחנו מדברים על הרצת מודלים באופן מקומי, אנחנו בעצם מתייחסים לשלב ההסקה , שהוא הזמן שבו מודל מאומן מעבד נתונים חדשים כדי לתת לנו תשובה. בניגוד לאימון, שהוא משימה אדירה הדורשת אלפי כרטיסי מסך, ההסקה ניתנת לניהול הרבה יותר בקלות, וכאן לשבבי אפל יש השפעה חזקה הודות לניהול צריכת החשמל היעיל והארכיטקטורה החדשנית שלהם.
סוד ההצלחה: זיכרון מאוחד
אם יש דבר אחד שמייחד מחשבי מק, זו ארכיטקטורת הזיכרון המאוחדת (UMA) . במחשב אישי מסורתי, צריך להעביר נתונים מזיכרון המערכת לזיכרון ה-VRAM של כרטיס המסך, ושם מתבזבז זמן יקר. עם שבבים מסוג M4, M3 Ultra ודומיהם, המעבד והכרטיס הגרפי שואבים מאותו מאגר זיכרון, מה שמפחית באופן דרסטי את ההשהיה בעת טיפול בטנזורים.
זה חיוני כשאנחנו רוצים לטעון מודלים של LLM (Large Language Models) בינוניים או גדולים. לדוגמה, Mac Studio עם כמות נדיבה של זיכרון RAM יכול להכיל דגמים שבעולם המחשבים האישיים היו דורשים מספר כרטיסי NVIDIA A6000 , וכתוצאה מכך חיסכון עצום בעלויות ומעל הכל, בחשבון החשמל, מכיוון שהצריכה היא חלק קטן ממה שמגדל גיימינג היה צורך.
קוונטיזציה ופורמטים: כיצד להתאים את המודל
כדי למנוע ממודל עם 70 טריליון פרמטרים לקרוס את המכונה שלך, אנו משתמשים בכמונטיזציה . בעיקרון, זה כרוך בהפחתת הדיוק של המספרים (מעבר מ-FP32 ל-INT8 או אפילו 4 סיביות), מה שמקטין את המודל ומאיץ את התגובה מבלי להפוך אותו ל"טיפש" או לגרום לו לאבד קוהרנטיות.
- GGUF: זהו הפורמט המועדף עבור אלו המשתמשים במעבד או בשילוב של מעבד וכרטיס מסך. זהו קובץ יחיד המכיל את כל מה שצריך והוא הסטנדרט עבור... call.cpp.
- GPTQ: תוכנן במיוחד כדי לטוס על גבי מעבדים גרפיים, תוך אופטימיזציה של מהירות העיבוד.
- מתחי ביטחון: אפשרות בטוחה בהרבה מקבצי .bin מסורתיים, מכיוון שהיא מונעת ביצוע קוד זדוני בעת טעינת המודל.
כלים חיוניים להקמת הסביבה שלכם
אם אינכם רוצים להתקשות עם הטרמינל מההתחלה, ישנן כמה אפשרויות פשוטות מאוד. LM Studio הוא כנראה הכלי הידידותי ביותר למשתמש: זהו פתרון הכל-באחד עם ממשק גרפי המאפשר לכם להריץ מודלים של בינה מלאכותית באופן מקומי ולהפעיל אותם בלחיצה אחת. אתם יכולים אפילו להגדיר שרת API מקומי תואם OpenAI כדי לשלב בינה מלאכותית באפליקציות שלכם.
מצד שני, יש לנו את Ollama , היהלום שבכתר עבור אלו המעדיפים משהו קליל יותר או מבוסס שורת פקודה. זהו קוד פתוח ומשתלב בצורה חלקה עם Open WebUI , מה שמאפשר לכם ממשק זהה ל-ChatGPT אך פועל כולו על החומרה שלכם. מדריך מהיר להפעלת LLMs מקומיים עם Ollama זמין גם כן. עבור אלו המחפשים ביצועים מקסימליים ב-macOS, מסגרת ה-MLX של אפל היא האפשרות האופטימלית להפיק את המרב מהסיליקון של החברה.
דילמת חומרה: ניידות או כוח גולמי?
חוקרים ומפתחים רבים נקרעים בין שתי דרכים. האפשרות הראשונה היא לבחור ב- MacBook Pro M4 Max עם שפע של זיכרון (כמו 128GB). היתרון הוא איטרציה מהירה : אפשר להיות בבית קפה או במטוס ולבדוק צינור RAG (Recovery Augmented Generation) מבלי להסתמך על חיבור מרחוק.
האלטרנטיבה היא שילוב של Mac Studio ומחשב נייד קל משקל. ה-Studio הוא מפלצת תרמית; אפשר להשאיר אותו מפעיל בדיקות ארוכות במשך שעות בלי שהמאוורר יישמע כמו מנוע סילון שממריא. עם זאת, זה יוצר את החיכוך של גישה מרחוק , הדורש ממך לסנכרן סביבות ונתונים בין שתי מכונות שונות, מה שעלול לשבש את זרימת היצירה שלך.
מקרי שימוש ומגבלות בעולם האמיתי
בעזרת Mac Mini M4 או MacBook Pro מאובזר היטב, תוכלו להקים מערכות RAG עם מסדי נתונים וקטוריים כמו ChromaDB או Qdrant, ליצור עוזרי קוד מקומיים עם Aider, או לתמלל סרטונים באופן אוטומטי באמצעות בינה מלאכותית מקומית כדי לחלץ תכונות. זה אידיאלי לבניית אבות טיפוס והערכת התנהגות של מודלים כמותיים עם בין 7 מיליארד ל-70 מיליארד פרמטרים.
עם זאת, אל תצפו לניסים. אימון מודלים אינטנסיבי או כוונון עדין מורכב אינם הצד החזק של המכונות הללו. אם זרימת העבודה שלכם מסתמכת במידה רבה על מערכות אקולוגיות של NVIDIA CUDA , תיתקלו בכמה מכשולים, מכיוון ש-Metal (ה-API של אפל) אינו תחליף חלק, אם כי הפער הצטמצם במידה ניכרת לצורך הסקה.
כותב נלהב על עולם הבתים והטכנולוגיה בכלל. אני אוהב לחלוק את הידע שלי באמצעות כתיבה, וזה מה שאעשה בבלוג הזה, אראה לכם את כל הדברים הכי מעניינים על גאדג'טים, תוכנה, חומרה, טרנדים טכנולוגיים ועוד. המטרה שלי היא לעזור לך לנווט בעולם הדיגיטלי בצורה פשוטה ומשעשעת.



