Gemini 3.8 Flash הוא מודל של Google לעבודה עם טקסט, קוד ותהליכים מרובי שלבים. הוא הוכרז ב־2 בספטמבר 2026 לצד גרסת Flash Cyber, שהיא מסלול נפרד ומוגבל. למי שבונה אוטומציה, השאלה המעשית היא האם המודל מחזיר שדות נכונים בפורמט שהמערכת יכולה לקרוא, ובאיזו עלות. המדריך משלב נתוני מקור רשמיים ודוגמה לתכנון סיווג פניות.

מה השתנה ומה לבדוק בחשבון

Google מציגה את Flash 3.8 כמודל שמתאים בין היתר לקוד, לשימוש בכלים ולמשימות ארוכות. תיעוד הדגם העדכני מפרט חלון הקשר של כמיליון טוקנים, עד 64 אלף טוקני פלט ורמות חשיבה low, medium ו־high. ברירת המחדל המתועדת היא medium. כל אלה הם מאפייני המודל, ולא התחייבות לתוצאה נכונה בכל משימה.

המודל בממשק Gemini, המודל ב־Google AI Studio וקריאת API דרך ספק אחר אינם בהכרח אותה חוויית שימוש. מגבלות, תמחור, כלי עזר והגדרות עשויים להיות שונים.

Flash Cyber אינו שם נוסף לאותו מסלול ציבורי. בהכרזה הוא מיועד לגורמי הגנה מאושרים דרך Fairwind. אין צורך לבחור בו כדי לסווג פניות או לבנות תהליך עסקי רגיל. הפרטים מופיעים בהכרזת Google.

מחיר ההיכרות מוגבל בזמן

נכון לבדיקה ב־8 בספטמבר 2026, המחיר ההתחלתי הוא 0.75 דולר למיליון טוקני קלט ו־3.75 דולר למיליון טוקני פלט. לפי ההכרזה, הוא תקף עד 31 בדצמבר 2026. החל מ־1 בינואר 2027 מצוין מחיר רגיל של 1.50 דולר לקלט ו־7.50 דולר לפלט. כדאי להכניס גם את התעריף העתידי לחישוב כדאיות של מערכת שאמורה לפעול לאורך זמן.

לצורך המחשה בלבד, 2,000 טוקני קלט ו־500 טוקני פלט בתעריף ההיכרות עולים 0.003375 דולר. בתעריף הרגיל המוצהר אותו היקף עולה 0.00675 דולר. החישוב אינו כולל תשתית, חיפוש, חיבורים, ניסיונות חוזרים או זמן טיפול אנושי.

דוגמה לתכנון סיווג פניות בעברית

מה כדאי להכין לפני קריאת המודל

הגדירו תחילה אילו קטגוריות קיימות בעסק שלכם ומה ההבדל ביניהן. בדוגמה כאן, ״פיתוח״ מתייחס לבניית מערכת, ״אוטומציה״ לחיבור תהליך חוזר ו״לימוד״ להדרכה. לקוח אינו חייב להשתמש במילים האלה. הוא יכול לכתוב ״אני רוצה שתלמד אותי לבנות מערכת״, והתוצר הרצוי יהיה פנייה ללימוד. ההגדרות צריכות להסביר את הכוונה, ולא להסתמך רק על הופעת מילת מפתח.

מפרידים בין הסיווג לבין ההמשך

המודל יכול להציע קטגוריה, אך היישום מחליט איזו פעולה מותרת בעקבותיה. פנייה על אוטומציה יכולה להפוך למשימת אפיון. היא אינה אישור לחבר חשבון של לקוח או לשנות את המערכת שלו. השלב הראשון צריך להפיק מספיק מידע כדי שאדם או תהליך המשך ידעו מה לעשות. הפרדה בין ההבנה לבין הביצוע מאפשרת לשנות את המודל בלי לשנות את כל כללי העסק.

שומרים גם אפשרות של חוסר ודאות

פנייה כמו ״יש לי משהו עם AI, תחזור אליי״ אינה בהכרח לימוד או פיתוח. אפשר להחזיר קטגוריה לא ידועה ושאלה שמבקשת לתאר את התוצאה הרצויה. אל תכפו על כל הודעה אחת משלוש אפשרויות אם המקור אינו מאפשר זאת. סיווג שגוי ובטוח בעצמו עלול לנתב את הפנייה לאדם הלא נכון ולגרום ללקוח להסביר הכול מחדש.

בודקים את השאלה שהלקוח מקבל

שאלת ההשלמה צריכה להיות קצרה ומחוברת לפנייה. אם כבר נמסר טלפון, אין צורך לבקש אותו שוב. אם הלקוח ביקש אדם, שאלון נוסף על סוג המערכת רק מעכב אותו. בדקו את רצף השיחה, ולא רק את אובייקט הנתונים: תהליך יכול להחזיר JSON תקין ועדיין להרגיש מסורבל למי שמנסה לקבל שירות.

סוכן ממיין פניות למגשי השלמה, בדיקה והעברה לאדם
פנייה מלאה, מידע חסר ובקשת נציג דורשים מסלולי המשך שונים.

ארבע פניות וארבע דרכי המשך

נבחן ארבע פניות בדיוניות לצורך המחשה. אחת ביקשה מערכת פיתוח והשאירו בה טלפון; השנייה ביקשה אוטומציה ללא טלפון; השלישית ביקשה לימוד; וברביעית הייתה בקשה מפורשת לדבר עם אדם. אלה שדות התוצאה והפעולה הרצויה בכל מקרה; הטבלה מציגה דרישות, ולא תוצאות מדידה של המודל.

מצב בפנייההתוצאה הנדרשת
בקשת פיתוח עם טלפוןdevelopment והמשך לבדיקת הפנייה
אוטומציה ללא טלפוןautomation, טלפון null ובקשת השלמה
בקשת לימוד עם טלפוןlearning והמשך לבדיקת הפנייה
בקשה לדבר עם אדםhandoff ללא המשך סיווג מיותר

טלפון שלא נמסר צריך להישאר ריק. המצאת פרטי קשר עלולה ליצור רשומה שגויה. לצד נכונות המידע יש לבדוק שהפלט תואם למבנה שהיישום מצפה לקבל.

למשימות אחרות מגדירים תנאים אחרים: בסיכום פגישה יש להפריד התחייבות מתנאי; בתיקון קוד יש לבדוק גם קלט שגוי. אלה עקרונות לתכנון המערכת, ולא ציוני בנצ׳מרק.

נתוני הבנצ׳מרק של Google

כדאי לקרוא את תוצאות הקוד בשתי שכבות. הראשונה היא השינוי ביחס ל־Flash 3.7, שמאפשר לראות את ההתקדמות בתוך אותה משפחה. השנייה היא ההשוואה ל־GPT-5.6 Sol, שמראה היכן Flash עדיין אינו מוביל. הטבלה הבאה שומרת את שמות הגרסאות כפי שפורסמו. הנתונים והמתודולוגיה נבדקו ב־9 בספטמבר 2026; לא נערכו באתר ניסויי מודלים לצורך המאמר.

פיתוח תוכנה ושימוש במחשב
מבחןGemini 3.8 FlashGemini 3.7 FlashGPT-5.6 Sol
DeepSWE v1.1הנדסת תוכנה73.7%65.3%72.7%
Terminal-Bench 2.1קוד בסביבת מסוף89.4%85.8%88.8%
Terminal-Bench 4.0גרסת מבחן נפרדת19.1%11.2%37.3%
OSWorld 2.0שימוש במחשב · ציון חלקי59.0%50.6%62.6%
מקור: Google, טבלת ההשקה המלאה · נבדק ב־09.09.2026

ציונים גבוהים עדיפים. אלו נתוני טבלת Google מ־2.9.2026, ברמות חשיבה ובסביבות שונות. DeepSWE: ‏Flash 3.8 עם mini-swe ו־high; ‏Terminal-Bench 2.1 עם Terminus 2, ו־4.0 לפי לוח המבחן. OSWorld הוא ציון חלקי; ב־Gemini נבחר המקסימום משלוש הרצות, לפני תיקון 8.8.2026, עם קריאות כלים באצווה. תנאי המבחן במקור

הפער בין Terminal-Bench 2.1 לבין 4.0 אינו ירידה של אותו מוצר בזמן. מדובר בשתי גרסאות מבחן שונות. לכן 89.4% ו־19.1% אינם שני ציונים שניתן להציב על אותו סרגל כדי לחשב מגמה. בכל שורה משווים רק בין הדגמים שנמדדו בה ובתנאים המפורטים. הדבר נכון גם כשאתם נתקלים בכותרת שמציגה ציון גבוה בלי מספר גרסה.

עבודה עם מסמכים ומשימות מקצועיות

במערכת עסקית, איכות התוצר יכולה להיות תלויה בהבנת מסמך או בהשלמת רצף ניתוח, ולא בכתיבת קוד. Google מפרסמת גם תוצאות לעבודה מקצועית. הטבלה הקצרה הבאה כוללת שני סוגי מדדים: דירוג Elo של עבודת ידע ושיעורי הצלחה במבחנים מוגדרים. אין לחבר אותם לציון כללי או להסיק מהם כמה משימות שלכם יושלמו ללא בדיקה.

עבודה מקצועית והבנת מסמכים
מבחןGemini 3.8 FlashGemini 3.7 FlashGPT-5.6 Sol
GDPVal-AA v2עבודת ידע · ציון Elo154514821710
Vals Finance Agent v2משימות ניתוח פיננסי61.4%59.0%53.8%
Harvey’s Legal Agent Benchmarkתהליכי עבודה משפטיים · all pass rate10.0%8.8%2.5%
GDP.PDFהבנת מסמכי PDF · all pass rate35.0%34.0%40.0%
מקור: Google, טבלת ההשקה המלאה · נבדק ב־09.09.2026

כל המדדים גבוהים יותר כאשר התוצאה טובה יותר. GDPVal-AA הוא ציון Elo, לא אחוז הצלחה. Google מפנה ל־Artificial Analysis ול־Vals עבור שלוש השורות הראשונות; GDP.PDF נמדד בידי Google לכל הדגמים. אלו תוצאות מבחנים שונים, ואין לחשב מהן ממוצע. תנאי המבחן במקור

Flash 3.8 מציג בטבלה תוצאות גבוהות יותר מ־3.7, אך Sol מקבל ציון גבוה יותר ב־GDPVal-AA וב־GDP.PDF. לקורא שעובד עם מסמכים, זו סיבה לברר מה בדיוק נדרש בתוצר: איתור פרט, השוואת סעיפים או הכנת מסמך החלטה. משימות שנשמעות דומות בשיחה יכולות להציב דרישות שונות למודל. גם קובץ קריא, מקורות מעודכנים והגדרת התוצר משפיעים על העבודה, בלי קשר למיקום בטבלת השקה.

מחקר והבנת מידע מורכב

ארבעת המדדים הבאים משלימים את התמונה בתחומי ידע, תרשימים ומחקר. הם אינם מעניקים למודל סמכות מקצועית, אך מסבירים איזה סוג יכולת נבדק. למשל, קריאת תרשים דורשת קשר בין טקסט למידע חזותי, בעוד משימת מחקר יכולה לכלול הפעלת כלים. אלה סביבות שונות, ולכן גם הערות המתודולוגיה הן חלק מקריאת המספרים.

מחקר, תרשימים וידע מקצועי
מבחןGemini 3.8 FlashGemini 3.7 FlashGPT-5.6 Sol
HLE-Verifiedידע וחשיבה בכמה תחומים54.9%53.6%54.5%
CharXiv Reasoningהבנת תרשימים · ללא כלים86.2%84.5%85.8%
BioMysteryBenchקבוצת Human Solvable88.8%87.1%79.5%
LABBench2משימות מחקר ביולוגי86.2%82.1%82.1%
מקור: Google, טבלת ההשקה המלאה · נבדק ב־09.09.2026

HLE-Verified מתייחס ל־1,811 פריטים מאומתים; אין להשוותו ל־HLE המלא. CharXiv נמדד ללא כלים. ב־BioMysteryBench וב־LABBench2 ניתנו מסוף וכלי מחקר; LABBench2 הוא ממוצע מאקרו של 11 משימות. התוצאות אינן מבחן עברית או המלצה מקצועית. תנאי המבחן במקור

בהכרזה על Flash 3.8 מציגה Google ציון של 54.9% ב־HLE-Verified. זו גרסה מסוימת של מבחן שאלות מורכבות. הנתון אינו ציון עברית, ואינו זהה לשיעור הצלחה בסיווג לידים.

הגרסה הציבורית Flash וגרסת Flash Cyber מופיעות באותו פרסום, אך הן דגמים שונים. יש לבדוק שהמספר שאתם קוראים שייך לגרסה שבה תשתמשו. המקור והגרפים של Google מאפשרים לבדוק את ההקשר.

איך מחברים את הסיווג לתהליך אמיתי

לפני החיבור, החליטו מהו התוצר הקטן ביותר שהמערכת חייבת לקבל. אם נדרשות קטגוריה, סיבת הסיווג ושאלה להשלמה, הגדירו אותן במפורש. תשובה חופשית ארוכה עשויה להיות נעימה בצ׳אט, אך קשה יותר לעבד אותה ביישום. מאידך, מבנה קשיח מדי עלול למחוק מידע חשוב. אפשר לשמור את נוסח הפנייה המקורי לצד השדות שחולצו, כדי שאדם יוכל לבדוק את ההקשר בלי לשחזר את השיחה.

כאשר המערכת מתחילה לעבוד, עקבו אחר המקרים שבהם נדרש תיקון ולא רק אחר הצלחות. סיווגים שגויים יכולים לגלות חפיפה בין הגדרות השירותים. בקשות השלמה חוזרות יכולות להצביע על שאלה לא ברורה. לפעמים התיקון הנכון הוא שינוי בטופס או במסמך השירות, ולא העלאת רמת החשיבה. החיבור בין הממצאים לבין תהליך העבודה חשוב יותר מהבחירה במודל חדש בכל פעם שמתפרסמת טבלת השקה.

תשובת JSON היא שלב בתהליך. לפני כתיבה למערכת הלקוחות, השרת צריך לבדוק ששדות החובה קיימים, שהערכים שייכים לרשימה המותרת ושיש מזהה ייחודי לפנייה. בקשה חוזרת לא אמורה ליצור ליד נוסף. אם המודל מחזיר שדה שלא הוגדר, אין להעביר אותו אוטומטית למערכת.

במקרה של מידע חסר, שאלו שאלה ממוקדת ושמרו את הפנייה כלא־מושלמת. במקרה של בקשת אדם, הפסיקו את שאלון הסיווג. המדריך לסינון לידים ב־WhatsApp מציג את המעבר מהשיחה לרשומה, והמדריך לסוכן AI לעסק עוזר לבחור תהליך ראשון.

שאלות נפוצות

האם צריך תמיד להפעיל חשיבה גבוהה?

לא בהכרח. בחירת רמת החשיבה תלויה במורכבות המשימה ובתקציב. ציון שפורסם בתצורה אחת אינו מוכיח שאותה תוצאה תתקבל ברמה אחרת. לפני הרצות בתשלום, הגדירו עלות מותרת ותנאי הצלחה.

האם אפשר להעביר מסמך גדול אחד במקום לבנות חיפוש?

למשימה חד־פעמית עם חומר נבחר אפשר להתחיל במסמך מצורף. לתהליך חוזר שבו מקורות מתעדכנים ומשתמשים שונים רואים מידע שונה, צריך גם ניהול מקורות וגישה. בחרו לפי אופי העבודה, ולא רק לפי המספר שמופיע בשורת חלון ההקשר.

אפשר לבחון זאת, אבל חלון הקשר אינו מטפל לבדו בגרסאות ובהרשאות. בחנו כמה מידע באמת נחוץ לכל תשובה, מי רשאי לראות אותו ואיך המערכת תציין את המקור. מסמך גדול במיוחד גם מגדיל את הקלט ואת משטח הטעות.

איך בוחרים בינו לבין מודל אחר?

משווים על המשימה שלכם. ההשוואה בין מודלים לעבודה עסקית מפרידה בין תוכן, פורמט ועלות. אם אתם עדיין מנסחים את הדרישה, התחילו במדריך לכתיבת פרומפט. לחיבור Gemini למערכת קיימת או לפיתוח תהליך מותאם, אפשר לדבר על הפרויקט שלכם.