דלג לתוכן
    חזרה לבלוג

    אותו מודל, פי שלושה תוצאות ושישית מהעלות:OpenAI חשפה את השכבה שקובעת אם סוכן ה-AI שלכם עובד

    מומחים4 דקות קריאה
    בעמוד הזה
    1. OpenAI פתחה את המנוע שמריץ את סוכן ה-AI שלה, ולא את המודל
    2. אותו מודל, פי שלושה תוצאות ושישית מהטוקנים
    3. החשבון החודשי והדיוק של סוכן AI נקבעים בעיקר מחוץ למודל
    4. מה לעשות עם זה ברבעון הזה
    5. איפה אנחנו נכנסים, וגם איפה לא
    6. שאלות נפוצות

    ב-20 באוגוסט OpenAI פתחה בקוד פתוח את Harness, המנוע שמריץ את Codex. שני שינויים בשכבה הזאת, בלי לגעת במודל, שילשו ציון והורידו את צריכת הטוקנים פי שישה. וזה בדיוק מה שקובע אם סוכן ה-AI שלכם מדויק או יקר.

    אמ;לק
    • ב-20 באוגוסט OpenAI פתחה בקוד פתוח (רישיון Apache-2.0) את Harness, המנוע שמריץ את הסוכן שלה Codex.
    • שני שינויים בשכבה הזאת בלבד, בלי לגעת במודל, שילשו ציון במבחן ARC-AGI-3 והורידו את צריכת הטוקנים פי שישה.
    • המסקנה בשבילכם: הדיוק והחשבון החודשי של סוכן AI נקבעים ברובם ב-harness, לא בבחירת המודל.
    • אם סוכן AI קיים אצלכם מדויק פחות או יקר מהצפוי, קודם בדקו את ניהול ההקשר והזיכרון, לא את המודל.
    • מי שבונה סוכן AI חדש כבר לא צריך להמציא מנוע. אפשר להתחיל ממנוע פתוח, שקוף ובדוק.

    OpenAI פתחה את המנוע שמריץ את סוכן ה-AI שלה, ולא את המודל

    מודל שפה לבדו לא עושה עבודה. הוא עונה על שאלה, אבל לא זוכר מה קרה לפני שלושה צעדים, לא מפעיל כלים ולא יודע מתי לעצור ולבקש אישור מאדם. את כל זה עושה שכבת תוכנה שעוטפת את המודל. בעולם הזה קוראים לה harness.

    ב-20 באוגוסט 2026 OpenAI פתחה בקוד פתוח את Harness, המנוע שמריץ את Codex, סוכן הקוד שלה. ההודעה הרשמית מסבירה שהמנוע מנהל את מצב השיחה, מזרים את ההרצה, מפעיל כלים, אוכף מדיניות אישורים ומעביר את העבודה בין תורים. הכל שוחרר תחת רישיון Apache-2.0, כלומר אפשר לקחת, לשנות ולשלב במוצר מסחרי בלי מגבלה.

    מה ששוחרר הוא לא צ'אט ולא ממשק, אלא שלושה רכיבים: כלי CLI בשם codex exec, ה-SDK הרשמי, ושרת הרצה בשם app-server. זה הבסיס שעליו אפשר לבנות סוכן AI משלכם.

    אותו מודל, פי שלושה תוצאות ושישית מהטוקנים

    המספר שהופך את זה מחדשה טכנית לעניין עסקי הוא זה: OpenAI לקחה מודל אחד, GPT-5.6 Sol, והריצה אותו על מבחן קשה בשם ARC-AGI-3. אחר כך שינתה שני דברים בשכבה שעוטפת את המודל, לא במודל עצמו.

    השינוי הראשון: לשמור על ההיגיון של הסוכן בין צעד לצעד במקום להתחיל כל פעם מחדש. השני: כיווץ ההקשר, כלומר לסכם ולפנות את מה שהצטבר בשיחה במקום לגרור הכל קדימה. אחרי שני השינויים האלה הציון עלה מ-13.3% ל-38.3%, וצריכת הטוקנים ירדה פי שישה.

    אותו מודל. בערך פי שלושה בתוצאה, ושישית מהעלות. כל ההבדל היה בשכבה שסביב המודל.

    • המודל לא השתנה, רק ה-harness שסביבו
    • שמירת היגיון בין צעדים העלתה את הדיוק
    • כיווץ הקשר הוריד את צריכת הטוקנים, וזה החשבון החודשי שלכם
    המודל במרכז, ה-harness מסביב: זיכרון, כלים, ניהול הקשר ואישורי אדם. שם נקבעים הדיוק והעלות.

    החשבון החודשי והדיוק של סוכן AI נקבעים בעיקר מחוץ למודל

    רוב מי שמפעיל סוכן AI מקבל החלטה אחת שנראית לו המרכזית: איזה מודל להריץ. וזה הגיוני, כי על זה מדברים. אבל השחרור הזה מראה שחור על גבי לבן שההחלטה הזאת קובעת פחות ממה שנדמה.

    המודלים הגדולים קרובים זה לזה ביכולת, וככל שהם מתקרבים, השכבה שעוטפת אותם היא זו שמכריעה אם הסוכן עובד. כפי שמנסחים את זה במקורות מהשנה: agent שווה model plus harness, וככל שהמודלים מתכנסים, ה-harness הוא המקום שבו מערכות מנצחות או נכשלות.

    יש לזה תרגום ישיר לכיס. סוכן שגורר לתוך ההקשר בכל תור את כל השיחה, כל פלט של כל כלי וכל קובץ, משלם על כל טוקן כזה, ובדרך גם מאבד דיוק. התופעה מוכרת ונקראת context rot: ככל שחלון ההקשר מתמלא, המודל נהיה פחות מדויק. כיווץ הקשר טוב פותר את שתי הבעיות בבת אחת.

    מה לעשות עם זה ברבעון הזה

    אם כבר יש לכם סוכן AI פעיל, בשירות, במכירות או בתפעול, והוא מדויק פחות ממה שקיוויתם או שהחשבון גדל, אל תמהרו להחליף מודל. קודם תבדקו את ה-harness. שאלו את מי שבנה: מה נשמר בהקשר בין תור לתור, מה מסוכם ומפונה, וכמה טוקנים כל תור באמת צורך.

    אם אתם עוד לפני סוכן, החדשה הזאת מורידה מכשול אמיתי. עד עכשיו מי שרצה סוכן היה צריך או מוצר סגור של ספק, או לבנות מנוע מאפס. עכשיו יש מנוע פתוח, שקוף ובדוק, שאפשר להתחיל ממנו ולשלב אותו בכלים שהצוות כבר עובד איתם. ההודעה הרשמית מדגישה בדיוק את זה: להביא את הסוכן אל תוך התוכנה שבנויה למשימה האמיתית, במקום לגרור את העבודה לתוך צ'אט כללי.

    הנקודה שנשארת גם אם לא תיגעו ב-Codex לעולם: לפני שבוחרים מודל, כדאי להבין מה קורה בשכבה שסביבו. שם נמצא רוב הדיוק, ושם נמצא רוב החשבון.

    • סוכן קיים שירד בדיוק או עלה בעלות: תבדקו קודם ניהול הקשר וזיכרון, לא מודל
    • סוכן חדש: אפשר להתחיל ממנוע פתוח במקום לבנות מאפס
    • בכל מקרה: תדעו כמה טוקנים כל תור צורך, זה החשבון

    איפה אנחנו נכנסים, וגם איפה לא

    אצלנו ב-Elevora זה בדיוק הפער שאנחנו סוגרים כשבונים סוכן AI. אנחנו לא רק בוחרים לכם מודל ומסיימים. אנחנו מתכננים את השכבה שסביבו: מה נכנס להקשר, מה מתועד, מתי אדם מאשר, וכמה זה עולה בכל תור. שם ההבדל בין סוכן שמרשים בהדגמה לבין סוכן שעובד חודש אחרי חודש בעלות שאתם מבינים.

    אם אתם שוקלים סוכן ולא בטוחים מה בכלל ההבדל בינו לבין צ'אטבוט, כתבנו על זה בנפרד: צ'אטבוט מול סוכן AI. ואם אתם רוצים לגשת לזה מסודר, הבריף לסוכן AI הוא נקודת התחלה טובה.

    ולא, לא צריך אותנו כדי להפיק מזה ערך. עצם ההבנה שהדיוק והעלות חיים ב-harness ולא במודל כבר משנה איך אתם קונים ומה אתם שואלים את מי שבונה.

    שאלות נפוצות

    מה זה harness בהקשר של סוכן AI?

    זו שכבת התוכנה שעוטפת את המודל והופכת אותו לסוכן שעובד: ניהול הזיכרון וההקשר בין צעדים, הפעלת כלים, אכיפת אישורי אדם, וניהול מצב השיחה. המודל מספק את החשיבה, ה-harness מספק את כל השאר.

    האם זה רלוונטי רק למי שמשתמש ב-Codex של OpenAI?

    לא. המסקנה עצמאית מהמוצר: הדיוק והעלות של כל סוכן AI נקבעים ברובם בשכבה שעוטפת את המודל, לא בבחירת המודל. השחרור של OpenAI פשוט הראה את זה במספרים ובקוד פתוח, אבל העיקרון נכון לכל סוכן.

    איך זה מוריד עלות פי שישה?

    סוכן שגורר לתוך ההקשר בכל תור את כל השיחה וכל פלט של כל כלי משלם על כל טוקן כזה. כיווץ הקשר מסכם ומפנה את מה שכבר לא נחוץ, כך שכל תור צורך פחות טוקנים. פחות טוקנים זה גם חשבון נמוך יותר וגם דיוק גבוה יותר.

    מה כדאי לעשות ראשון אם יש לי כבר סוכן?

    לבדוק עם מי שבנה מה נשמר בהקשר בין תור לתור, מה מסוכם ומפונה, וכמה טוקנים כל תור צורך בפועל. לרוב שם נמצא הפער בין סוכן מדויק וזול לסוכן שגורר עלות.

    מקורות

    תגובות

    רוצים שמישהו יתרגם את החדשות לעסק שלכם?

    מה שקראתם כאן רלוונטי גם אצלכם. בשיחה קצרה נראה לכם בדיוק איפה.