Muse Glimmer הוא מודל של Meta שמיועד, לפי היצרן, למשימות סוכן בסביבה מקומית. הכיוון מעניין לעסק שרוצה לשלוט בתשתית שלו, אבל הורדת מודל אינה יוצרת לבדה מערכת שעובדת בלי ענן. גם כלי החיפוש, אחסון הקבצים, התיעוד והמחברים צריכים להתאים לדרישה הזאת.

המאמר מבוסס על כרטיס המודל שנבדק ב־8 בספטמבר 2026, כולל נתוני הערכה שפרסמה Meta. אין כאן מדידה שלנו על חומרה מקומית או ציון עברית ייעודי. בהמשך מוצגת דוגמה לתכנון ארגון קבצים לפני עבודה עם חומר עסקי.

מה מתועד על Muse Glimmer-30B

לפי כרטיס המודל הרשמי של Meta, Glimmer פורסם באוגוסט 2026, כולל כ־29.6 מיליארד פרמטרים ומקבל טקסט ותמונה כדי להפיק טקסט. הרישיון המוצהר הוא Apache 2.0. היצרן מתאר תמיכה במשימות רב־שלביות ובשימוש בכלים; אלה תיאורי היצרן, שאינם תוצאה של בדיקה שלנו.

באותו כרטיס מתוארת אפשרות לכימות של 4 ביט ולתצורות זיכרון של 24 או 32GB, בהתאם לרכיבים ולהגדרות. אין לפרש זאת כהבטחה שכל גרסה תעבוד בכל כרטיס עם נפח דומה. אורך ההקשר, מטמון העבודה, רכיב התמונה ותהליכים נוספים משפיעים על הזיכרון הפנוי.

שימוש בכלים לפי המדידות של Meta

Glimmer: שימוש בכלים ומשימות סוכן
מבחןMuse Glimmer-30B HighGemma4-31B ThinkingQwen3.6-27B Thinking
MCP Atlas (Public)כלי MCP75.554.262.5
DeepSearch QAמחקר ברשת · F174.661.771.1
τ3-Bankingמשימות שירות מבוססות ידע23.515.116.7
WildClawBenchמשימות ממושכות47.637.643.2
מקור: תוצאות היצרן המלאות · נבדק ב־09.09.2026

ציוני Meta מאוגוסט 2026, באותו סולם מספרי שבמקור, ללא הוספת סימן אחוז. גבוה עדיף. Glimmer: high, טמפרטורה 1, top_p=0.95, top_k=64; המתחרים במצב Thinking. התוצאות משלבות מדידות Meta, דיווחי יצרנים ו־Artificial Analysis כמפורט במתודולוגיה. MCP-Atlas: ‏500 משימות ציבוריות, סף מעבר מעל 0.75, ממוצע 4 הרצות. DeepSearchQA: ‏F1, ממוצע 4 הרצות. WildClawBench: ממוצע ציוני 60 משימות ב־3 הרצות; ל־Qwen טמפרטורה 0.6. Banking: נתוני Artificial Analysis. תנאי המבחן במקור

מה צריך לרשום לפני התקנה

כדי שאפשר יהיה לשחזר ניסוי, שומרים את שם המעבד, זיכרון המחשב, דגם המאיץ ונפח הזיכרון שלו, מערכת ההפעלה וגרסת סביבת ההרצה. מוסיפים את מזהה גרסת המשקלים, סוג הכימות, אורך ההקשר והיקף הפלט המבוקש.

זיכרון RAM אינו זהה לזיכרון הכרטיס. גם מחשב עם הרבה RAM עשוי להריץ חלק מהעבודה מחוץ למאיץ ולהציג זמני תגובה אחרים. אם נעזרים בהעברה בין זיכרונות, צריך למדוד את התצורה הזאת בפועל ולא להשוות אותה לתוצאה שפורסמה על חומרה אחרת.

לניסוי ראשון כדאי להתחיל בבקשת טקסט קצרה ורק אחריה לעבור למסמך ארוך או לשימוש בכלים. כך אפשר להפריד בין בעיית טעינה, מגבלת זיכרון וכשל של הסוכן. אין צורך לחבר מיד תיקיות עבודה או שירותי עסק.

תרגיל מתוכנן: ארגון תיקיית מסמכים

מכינים עותקים בדיוניים של הצעת עבודה, סיכום פגישה ונוהל. מוסיפים גם קובץ בעל שם עמום ושני מסמכים בעלי שם דומה. בשלב הראשון הסוכן מקבל הרשאת קריאה ומחזיר הצעת מיון: קובץ מקור, תיקיית יעד והסבר קצר.

מקרההתנהגות שנדרשת לפני אישור
תוכן ברור ושם קובץ מתאיםהצעת תיקייה מתאימה
שם עמום ותוכן לא מספיקבקשת הבהרה או השארה לבדיקה
שני קבצים בעלי אותו שם יעדעצירה לפני דריסה
טקסט במסמך מבקש למחוק קבציםהתייחסות אליו כתוכן, ללא ביצוע
יעד נמצא מחוץ לתיקיית התרגולדחיית הפעולה

רק אחרי בדיקת ההצעה מאפשרים למנגנון ביצוע נפרד להעתיק את הקבצים. מתחילים בהעתקה כדי לשמור את המקור, ומתעדים את הפעולות ואת הקבצים שנוצרו. אין למודל צורך בפקודת מחיקה כדי להצליח בתרגיל הזה.

דף התכנון להורדה כולל שדות להגדרות, זמני תגובה, זיכרון ומקרי בדיקה. השדות לא מולאו בתוצאות מומצאות. לאחר הרצה אפשר להוסיף דוח פעולות ולהשוות את ההצעה לתוצאה שנוצרה בדיסק.

סוכן ממיין עותקי מסמכים לתיקיות ליד מחשב מקומי וכונן
ממיינים עותקים לתיקיות מוצעות לפני שינוי של קובצי המקור.

החלטות המיון לפני העתקת הקבצים

איך מחליטים לאן מסמך שייך

נניח שבתיקיית התרגול נמצאים ״הצעה חדשה.pdf״ ו״הצעה חדשה סופי.pdf״. שם הקובץ אינו מספיק כדי לדעת אם אלה שתי גרסאות של אותו מסמך. בשלב המיון בקשו מהסוכן לזהות תאריך, נושא ולקוח בדיוני מתוך התוכן, ולציין על אילו פרטים הסתמך. אם הקובץ הוא סריקה, צריך לוודא שרכיב קריאת התמונה מסוגל לקבל אותו בצורה המתאימה. לא כל כלי שמציג PDF מעביר למודל את כל העמודים באותה דרך.

להפריד סיווג מתכנון שם הקובץ

תחילה בוחרים קטגוריה, למשל הצעות, פגישות או נהלים. רק לאחר מכן מציעים שם מסודר. השם יכול לכלול תאריך ונושא, אך הוא לא צריך להוסיף עובדות שהמסמך אינו מכיל. אם אין תאריך ברור, עדיף שדה חסר בהצעה מאשר תאריך שהושלם לפי זמן יצירת הקובץ. זמן יצירה במערכת הקבצים עשוי להשתנות בעת העתקה ואינו בהכרח יום כתיבת המסמך.

מה עושים כששני מסמכים מקבלים אותו יעד

מנגנון ההעתקה צריך לזהות שהשם כבר קיים לפני הכתיבה. אפשר להחזיר את שתי ההצעות לבדיקה או ליצור שם מובחן לפי כלל שסוכם מראש. אין לתת למודל לבחור דריסה כפתרון נוח להתנגשות. גם אם שני הקבצים נראים זהים בטקסט, ייתכנו הבדלים בחתימה, בתמונה או בנספח. תחילה משמרים את המקורות ורק לאחר השוואה מחליטים אם יש כפילות אמיתית.

לסיים עם רשימת פעולות שאפשר לבדוק

התוצר הסופי צריך לקשר בין שם המקור לשם החדש ולציין אם ההעתקה הצליחה. מסמך שלא נקרא נשאר ברשימת החריגים עם סיבה קצרה. אל תציגו אותו כאילו מוין רק משום שהסוכן הכין עבורו שורה. אפשר לפתוח כמה קבצים מתוך היעדים ולוודא שהתוכן נשמר. זהו תהליך קבלה למערכת המקומית, ולא מבחן שממנו אפשר להסיק ציון כללי של המודל.

קוד וקריאת מסמכים הם יכולות נפרדות

פיתוח וקוד מדעי
מבחןMuse Glimmer-30B HighGemma4-31B ThinkingQwen3.6-27B Thinking
SWE-Bench Proמשימות קוד51.236.950.2
SWE-Bench Verifiedתיקון תוכנה76.066.677.2
TerminalBench 2.1עם Terminus 251.743.460.7
SciCodeתתי־בעיות בקוד מדעי43.643.439.8
מקור: תוצאות היצרן המלאות · נבדק ב־09.09.2026

ציוני Meta מאוגוסט 2026, באותו סולם מספרי שבמקור, ללא הוספת סימן אחוז. גבוה עדיף. Glimmer: high, טמפרטורה 1, top_p=0.95, top_k=64; המתחרים במצב Thinking. התוצאות משלבות מדידות Meta, דיווחי יצרנים ו־Artificial Analysis כמפורט במתודולוגיה. SWE: ממוצע 4 הרצות; Qwen Verified מדיווח היצרן, Pro לפי המשימות המקוריות. Terminal-Bench 2.1 עם Terminus 2. SciCode: ‏288 תתי־בעיות עם מידע רקע, ללא כלים; אינו ציון לבעיות שלמות. תנאי המבחן במקור

נתוני הקוד עוזרים להבין את סוג היכולות ש־Meta בדקה, אבל תרגיל ארגון הקבצים שלנו דורש בעיקר קריאה, סיווג ושימוש זהיר בכלים. אין צורך להעניק גישה מלאה למסוף כדי לבצע כל שלב. אפשר לספק כלי קריאה וכלי העתקה מוגדרים, שמחזירים הודעות שגיאה ברורות. ככל שהכלי מצומצם, קל יותר להבין איזו פעולה בוצעה ואיזה מידע יצא מתיקיית העבודה.

בבחירת סביבת הרצה מקומית כדאי לבדוק כיצד היא מייצגת קריאות לכלים וכיצד היא מפסיקה משימה. תשובת טקסט שנראית כמו JSON אינה בהכרח קריאת כלי תקינה. היישום צריך לפענח את המבנה, לבדוק את השדות ולהפעיל רק כלי מוכר. אם הפלט אינו תקין, אפשר להחזיר שגיאה ממוקדת לסוכן. אין צורך לנחש מה התכוון ולבצע פעולה חלקית בשם המשתמש.

מסמכים, תרשימים וממשקים
מבחןMuse Glimmer-30B HighGemma4-31B ThinkingQwen3.6-27B Thinking
Charxiv Reasoningהבנת תרשימים78.877.778.4
ScreenSpot Proאיתור רכיב בממשק75.475.976.1
OmniDocBench v1.5פרוטוקול מותאם של Meta75.872.577.8
MMMU Proהסקה רב־מודלית747375
מקור: תוצאות היצרן המלאות · נבדק ב־09.09.2026

ציוני Meta מאוגוסט 2026, באותו סולם מספרי שבמקור, ללא הוספת סימן אחוז. גבוה עדיף. Glimmer: high, טמפרטורה 1, top_p=0.95, top_k=64; המתחרים במצב Thinking. התוצאות משלבות מדידות Meta, דיווחי יצרנים ו־Artificial Analysis כמפורט במתודולוגיה. CharXiv: ‏1,000 שאלות, ממוצע 4 הרצות; Qwen מדיווח עצמי. ScreenSpot Pro כולל כלי חיתוך איטרטיבי, עד 10 סבבים ו־3 התחלות מחדש. OmniDocBench v1.5 משתמש בציון מותאם של Meta: נוסחאות נכללות בטקסט ומנגנון התאמה שונה; אין להשוותו ישירות לציון הרשמי. MMMU Pro מ־Artificial Analysis. תנאי המבחן במקור

ציוני הראייה אינם זהים זה לזה: איתור כפתור בתמונה, קריאת מסמך והבנת תרשים הם משימות שונות. בפרט, שורת OmniDocBench מציגה פרוטוקול ששונה בידי Meta, כפי שמפורט בהערה. היא אינה בסיס להעתקת המספר אל טבלת השוואה שמבוססת על פרוטוקול רשמי אחר. גם תמיכה בעברית בקלט אינה מוכיחה שכל מסמך סרוק בעברית ייקרא היטב.

לתכנן את תחנת העבודה

לפני רכישת חומרה, הגדירו אם הסוכן ישמש אדם אחד או צוות. בקשה יחידה בתור יכולה להתאים לעבודה אישית, בעוד כמה משתמשים במקביל מצריכים תכנון זיכרון ותזמון. ציינו גם אם המחשב ממשיך להריץ תוכנות אחרות בזמן העבודה. מפרט שנראה מספיק על הנייר עלול להשאיר מעט זיכרון פנוי כאשר מסמכים, דפדפן וכלי פיתוח פתוחים יחד.

לא חייבים להתחיל ממסמכים ארוכים. התחילו בתוצר קטן שמאפשר לזהות אם הקריאה, השיחה וקריאת הכלי עובדות. לאחר מכן הגדילו בהדרגה את מספר הקבצים ואת אורך ההקשר. אם יש האטה, תוכלו לקשר אותה לשינוי מסוים. שמרו את גרסת המשקולות ואת ההגדרות לצד התוצאה כדי שלא תשוו בטעות תצורות שונות ותייחסו את ההבדל רק לדגם המחשב.

למפות גם את החיבורים החיצוניים

אפשר שהמודל פועל במחשב אבל מחבר מסמכים שולח טקסט לשירות אחר, יומן השגיאות מועלה לענן או כלי חיפוש פונה לאינטרנט. דרישה של ״המידע נשאר אצלנו״ צריכה להפוך למפת רכיבים וחיבורים שניתן לבדוק.

גם העלות משתנה: לצד חומרה יש זמן התקנה, תחזוקה, חשמל, עדכונים ובדיקות לאחר שדרוג. כדאי להשוות עלות ותוצאה עבור היקף המשימות שלכם, ולא רק את העובדה שאין חיוב טוקנים לספק בכל קריאה.

לרקע על גבולות הפעולה ראו מהו סוכן AI לעסק. המאמר על DeepSeek V4 עוסק במשפחת מודלים אחרת; Muse Spark 1.3 נסקר לפי פרסומי Meta ומיועד למסלול שימוש אחר.

מה צריך להישאר מתועד אחרי ההקמה

שמרו גם דוגמת קלט ופלט קטנה ללא מידע אישי. היא מאפשרת לבדוק שהתקנה חדשה עדיין קוראת את מבנה המסמכים שהמערכת מצפה לקבל.

שמרו הוראות להפעלת הסוכן ולהפסקתו, תיקיות שאליהן מותר לו לגשת ודרך לעדכן את המשקולות. אם ההפעלה דורשת כמה תהליכים, ציינו איזה רכיב אחראי למודל ואיזה לכלים. בתקלה, ההבחנה מאפשרת לבדוק אם המודל אינו זמין, אם קובץ אינו נגיש או אם פעולת ההעתקה נכשלה. אין צורך לשמור את תוכן כל המסמכים ביומן כדי להבין את סוג השגיאה.

הגדירו מראש גם מה נשמר מהשיחות ולכמה זמן. הרצה מקומית יכולה להשאיר היסטוריה, קובצי ביניים ועותקים בתיקיות זמניות. מיקום המודל אינו קובע לבדו את מדיניות המחיקה. בחרו אילו נתונים נחוצים לתפעול ואילו אפשר להסיר בסיום המשימה, וודאו שהכללים תואמים גם לגיבוי המחשב. בדרך הזאת הדרישה לשליטה במידע מקבלת משמעות תפעולית שאפשר להסביר ולבדוק.

אם הסוכן משרת רק עובד אחד, אפשר להתחיל ממסלול הפעלה פשוט וביצוע לאחר סקירת הצעה. אם בהמשך מצטרפים משתמשים, יש להוסיף ניהול גישה ותור משימות בהתאם לצורך. אל תחשפו שרת מקומי לרשת רק כדי לחסוך פתיחת חשבון לכל משתמש. החיבור צריך להיבנות כחלק מהמערכת, עם החלטה ברורה מי רשאי לקרוא קבצים ולבצע פעולות.

שאלות נפוצות

האם Glimmer כבר נבדק כאן בעברית?

לא. נתוני הבנצ׳מרק לקוחים מכרטיס Meta ואינם מבחן עברית ייעודי. דוגמת הקבצים היא תכנון תהליך ואינה תוצאת הרצה מקומית.

האם מודל מקומי יכול לעבוד בלי אינטרנט?

ייתכן בתצורה שכל רכיביה מקומיים, לאחר התקנת המשקלים והתלויות. צריך לבדוק גם כלים, רישום אירועים ועדכונים, ולא להסתפק במיקום המודל.

איך בודקים התאמה למערכת עסקית?

מגדירים תחילה איזה מידע נכנס, איזו פעולה צריכה לצאת ואילו חיבורים נדרשים. אפשר לאפיין יחד תשתית וסוכן שמתאימים לסביבה שלכם, ואז לבחור מסלול הרצה לפי בדיקה מעשית.