דילוג לתוכן

מדריך | כולם מדברים על סוכנים, אבל מה זה בכלל? - מדריך למתחילים

עדכוני ai כלליים
6 3 223 3
  • כתב ב נערך לאחרונה על ידי בינה מלאכותית
    #1

    אני מקדים מראש, הפוסט הזה הוא רק למי שלא שמע בחיים על סוכנים מהם ואיך הם עובדים.

    אז מה זה סוכני AI?

    בטח כבר יצא לכם להשתמש בGPT, ג'מיני או קלוד.
    אתם כותבים להם שאלה - והם עונים.

    אבל מה קורה אם במקום לבקש מה-AI תשובה, נותנים לו מטרה?

    לדוגמה:

    "מצא לי את 10 כלי ה-AI הכי מעניינים שיצאו לאחרונה, בדוק מה כל אחד עושה, השווה מחירים ויכולות, וסדר לי את הכול בטבלה."

    במקום לענות לכם במשפט אחד, מערכת AI יכולה לבצע סדרה של פעולות בעצמה:

    1. להבין מה ביקשתם.
    2. לפרק את המשימה לחלקים.
    3. לחפש מידע.
    4. להשתמש בכלים חיצוניים.
    5. לנתח את המידע שמצאה.
    6. לקבל החלטות לפי התוצאות.
    7. לבצע את המשימה הבאה.
    8. ובסוף להחזיר לכם תוצאה מוכנה.

    זה כבר לא סתם צ'אט עם AI.

    זה הכיוון שנקרא AI Agent - סוכן בינה מלאכותית.


    אז מה זה בעצם Agent?

    במילים פשוטות:

    סוכן הוא AI שלא רק מדבר איתכם, אלא יכול לבצע פעולות לבד כדי להגיע למטרה.

    אפשר לחשוב על ההבדל כך:

    צ'אט רגיל

    אתם:

    "מהם 5 כלי ה-AI הטובים לעריכת תמונות?"

    ה-AI:

    "הנה 5 כלים..."

    סיימנו.


    סוכן

    אתם:

    "תמצא לי כלי לעריכת תמונות שמתאים לי, בתקציב עד 50 דולר בחודש."

    הסוכן יכול, בהתאם לכלים ולהרשאות שיש לו:

    • לחפש באינטרנט
    • לבדוק מחירים
    • לקרוא אתרי מוצרים
    • להשוות אפשרויות
    • לסנן לפי התנאים שלכם
    • ולהחזיר לכם המלצה.

    כלומר:

    צ'אט = עונה

    סוכן = פועל כדי להשיג מטרה


    אז איך סוכן עובד?

    אפשר לפשט סוכן לארבעה חלקים:

    1. מטרה

    אומרים לו מה אנחנו רוצים להשיג.

    לדוגמה:

    "מצא לי מחשב מתאים לעריכת וידאו בתקציב של 5,000 שקל."

    2. חשיבה ותכנון

    ה-סוכן מחליט מה צריך לעשות כדי להגיע לתוצאה.

    לדוגמה:

    צריך למצוא מחשבים → לבדוק מפרטים → להשוות מחירים → לסנן לפי התקציב → להציג את האפשרויות הטובות.

    3. כלים

    כאן מתחיל החלק המעניין.

    סוכן יכול לקבל גישה לכלים שונים, למשל:

    דפדפן
    קבצים
    טרמינל
    מייל
    יומן
    מסד נתונים
    APIs
    מערכות חיצוניות

    וכך הוא לא רק "חושב" - הוא יכול לעשות.

    4. ביצוע וחזרה

    ה-Agent מבצע פעולה, רואה מה קרה, ומחליט מה לעשות עכשיו.

    לדוגמה:

    חיפשתי 20 מחשבים.

    ↓

    7 מהם מעל התקציב.

    ↓

    נשארו 13.

    ↓

    בדקתי את המפרטים.

    ↓

    4 מתאימים לדרישות.

    ↓

    עכשיו אשווה ביניהם.

    וזה בדיוק החלק שהופך Agent למעניין.


    מה ההבדל בין AI רגיל ל-Agent?

    הנה דרך פשוטה לזכור:

    AI רגיל AI Agent
    מקבל שאלה מקבל מטרה
    מחזיר תשובה מבצע תהליך
    לרוב פעולה אחת מספר פעולות
    לא בהכרח משתמש בכלים יכול להשתמש בכלים
    מחכה להודעה הבאה יכול להתקדם בעצמו
    בעיקר מייצר מידע יכול לבצע פעולות

    כמובן שהגבולות לא תמיד מוחלטים, ומערכות AI מודרניות יכולות לשלב בין שני העולמות.


    דוגמה מהחיים

    נניח שיש לכם אתר.

    אתם רוצים לדעת אם יש בו בעיות.

    במקום לשבת ולבדוק הכול בעצמכם, אפשר לדמיין Agent שמקבל משימה:

    "בדוק את האתר שלי וחפש בעיות."

    הוא יכול:

    1. לפתוח את האתר.
    2. לעבור על הדפים.
    3. לבדוק קישורים.
    4. לבדוק שגיאות.
    5. לנתח ביצועים.
    6. לבדוק בעיות נפוצות.
    7. לרכז הכול בדוח.

    שימו לב:

    לא ביקשתם ממנו:

    "תבדוק את דף הבית."

    ואז:

    "עכשיו תבדוק את הקישורים."

    ואז:

    "עכשיו תכתוב דוח."

    נתתם לו מטרה, והוא אמור לפרק אותה למשימות.


    רגע, אז סוכן יכול לעשות הכול לבד?

    לא.
    וזה חשוב מאוד.
    סוכן הוא לא קסם.
    הוא מוגבל על ידי:

    • המודל שבו הוא משתמש
    • הכלים שהענקתם לו
    • ההרשאות שנתתם לו
    • איכות המידע
    • היכולת שלו להבין את המשימה
    • והמערכת שבניתם סביבו

    אם אין לו גישה לאינטרנט - הוא לא יכול לגלוש.

    אם אין לו גישה למייל - הוא לא יכול לשלוח מייל.

    אם אין לו הרשאה למחוק קובץ - הוא לא אמור למחוק אותו.

    לכן אחת השאלות החשובות ביותר בבניית סוכן היא:

    "מה אני באמת מרשה לו לעשות?"


    וזה גם החלק המסוכן

    ככל שנותנים לסוכן יותר הרשאות, הוא יכול לעשות יותר.

    אבל גם לטעות יותר.

    תחשבו על Agent שיש לו גישה למייל.

    אם הוא מקבל הוראה:

    "ענה לכל המיילים שלי."

    זה כבר משהו שצריך לחשוב עליו היטב.

    ומה אם הוא שולח בטעות מייל לאדם הלא נכון?

    ומה אם הוא מוחק קובץ?

    ומה אם הוא מזמין משהו?

    לכן מערכות Agent רציניות משתמשות לעיתים בהרשאות, אישורים ובקרות.

    לדוגמה:

    "ה-Agent יכול להכין את המייל, אבל לפני השליחה צריך אישור של המשתמש."

    זה נקרא Human in the loop.

    כלומר:

    האדם עדיין נמצא בתוך התהליך.

    __
    בקיצור זה הכל,
    במדריך הבא נדבר על מולטי אג'נט

    @שניאור-שמח תודה על הפורום המטורף! רואים את ההשקעה.
    אשמח אם תוסיף אופציה בסוג נושא "מדריך"

  • כתב ב נערך לאחרונה על ידי מקווה לעזור
    #2

    אאל״ט היום זה כבר לא הגדרה נכונה

    הלילה סשן בודד של קלוד קוד בנה לי פיצ׳ר שלם על פי סדרת משימות (שבנינו בסשן קודם)
    נתתי לו מטרה
    הוא ביצע תהליך (ארוך)
    הוא ביצע הרבה פעולות
    השתמש בכלים (גם לבדיקה וגם לביצוע)
    התקדם בעצמו ברצף - כל משימה הריץ בדיקות ודחף אחרי CI ירוק ואז התקדם לבאה
    תיעד כל בעיה שהתעוררה תוך כדי
    חלק תיקן חלק תיעד והציע פתרונות (לפי הנחיות הפרויקט)
    ועצר שחלון ההקשר היה במצב שעדיף סשן חדש (כנ״ל)
    ובבוקר חיכה לי הודעה מסוכמת של מה נעשה, מה התגלה, ומה לכתוב לסשן חדש (כנ״ל)

    אז הפעלתי סוכן או סשן רגיל?
    או שקלוד קוד הוא סוכן, וקלוד לא…

    21c71978-7e61-41f5-a3ef-2467b4d7ddc5-image.jpeg

  • אאל״ט היום זה כבר לא הגדרה נכונה

    הלילה סשן בודד של קלוד קוד בנה לי פיצ׳ר שלם על פי סדרת משימות (שבנינו בסשן קודם)
    נתתי לו מטרה
    הוא ביצע תהליך (ארוך)
    הוא ביצע הרבה פעולות
    השתמש בכלים (גם לבדיקה וגם לביצוע)
    התקדם בעצמו ברצף - כל משימה הריץ בדיקות ודחף אחרי CI ירוק ואז התקדם לבאה
    תיעד כל בעיה שהתעוררה תוך כדי
    חלק תיקן חלק תיעד והציע פתרונות (לפי הנחיות הפרויקט)
    ועצר שחלון ההקשר היה במצב שעדיף סשן חדש (כנ״ל)
    ובבוקר חיכה לי הודעה מסוכמת של מה נעשה, מה התגלה, ומה לכתוב לסשן חדש (כנ״ל)

    אז הפעלתי סוכן או סשן רגיל?
    או שקלוד קוד הוא סוכן, וקלוד לא…

    21c71978-7e61-41f5-a3ef-2467b4d7ddc5-image.jpeg

    כתב ב נערך לאחרונה על ידי
    #3

    @מקווה-לעזור
    קלוד באמת מפעיל הרבה פעמים כמות סוכנים על בקשה, אבל עדיין יש הבדלים

  • @מקווה-לעזור
    קלוד באמת מפעיל הרבה פעמים כמות סוכנים על בקשה, אבל עדיין יש הבדלים

    כתב ב נערך לאחרונה על ידי
    #4

    @בינה-מלאכותית מה ההבדלים? הסשן הנ״ל ביצע עבודה יותר מקיפה ומורכבת מהתיאור שלך לסוכן

  • אאל״ט היום זה כבר לא הגדרה נכונה

    הלילה סשן בודד של קלוד קוד בנה לי פיצ׳ר שלם על פי סדרת משימות (שבנינו בסשן קודם)
    נתתי לו מטרה
    הוא ביצע תהליך (ארוך)
    הוא ביצע הרבה פעולות
    השתמש בכלים (גם לבדיקה וגם לביצוע)
    התקדם בעצמו ברצף - כל משימה הריץ בדיקות ודחף אחרי CI ירוק ואז התקדם לבאה
    תיעד כל בעיה שהתעוררה תוך כדי
    חלק תיקן חלק תיעד והציע פתרונות (לפי הנחיות הפרויקט)
    ועצר שחלון ההקשר היה במצב שעדיף סשן חדש (כנ״ל)
    ובבוקר חיכה לי הודעה מסוכמת של מה נעשה, מה התגלה, ומה לכתוב לסשן חדש (כנ״ל)

    אז הפעלתי סוכן או סשן רגיל?
    או שקלוד קוד הוא סוכן, וקלוד לא…

    21c71978-7e61-41f5-a3ef-2467b4d7ddc5-image.jpeg

    כתב ב נערך לאחרונה על ידי
    #5

    @מקווה-לעזור
    @בינה-מלאכותית
    אין לי הרבה נסיון בAI, ואני משתמש (כשכבר משתמש) בעיקר בצ'אט הרגיל (בדפדפן), ובכל זאת לשאלה פשוטה שלי GPT בדק והשווה והביא לי מידע ופרטים הרבה מעבר למה שביקשתי.
    וגם לאחר שכבר הגעתי לתוצאה הרצויה בשביל, הוא התעניין מעצמו וביקש לבדוק דברים שאני לא בקשתי!

  • @מקווה-לעזור
    @בינה-מלאכותית
    אין לי הרבה נסיון בAI, ואני משתמש (כשכבר משתמש) בעיקר בצ'אט הרגיל (בדפדפן), ובכל זאת לשאלה פשוטה שלי GPT בדק והשווה והביא לי מידע ופרטים הרבה מעבר למה שביקשתי.
    וגם לאחר שכבר הגעתי לתוצאה הרצויה בשביל, הוא התעניין מעצמו וביקש לבדוק דברים שאני לא בקשתי!

    כתב ב נערך לאחרונה על ידי
    #6

    @דאנציג זה ברור
    הם בנויים בצורה שתשאיר אותך באקוסיסטם שלהם
    לכן הם יציעו רעיונות חדשים
    ותמיד יסיימו תשובה בשאלת המשך


קרא עוד

  • המלצה | קימפול קוד ל־APK ב־Lovable

    עדכוני ai כלליים
    21
    3 הצבעות
    21 פוסטים
    176 צפיות
    נוחעם FMנ
    @בינה-יתרה מנסיון שלי ושל עוד רבים claude באתר ובאפליקציה יכול לקמפל. לגבי זה שהוא כותב לך שאין לו גישה לרשת, הסיבה שלא אישרת לו. תיכנס ל- claude בדפדפן > הגדרות ואז ל Capabilities תפעיל את Allow network egress ובכל שיחה חדשה מעכשיו יהיה לו גישה לאינטרנט (יש לו רשימת דומיינים שמותרים ולא הכל אבל זה כולל את גיטאהב ועוד רבים אז זה מספיק) הוא יוכל להוריד את כל הכלים ולדבג\לקמפל\לדקס\לחתום\וכדו' ואם חסום לו משהו תבקש ממנו קישור להורדה ותעלה לו.
  • שיתוף | חדש!!! ג'מיני בתוכנה

    עדכוני ai כלליים
    5
    1
    2 הצבעות
    5 פוסטים
    96 צפיות
    ל
    @בינארי-חכם כתב: או בצ'אט הרגיל בתוכנה של ג'מיני אין לי מאק אבל ככה גוגל כותבים
  • 2 הצבעות
    29 פוסטים
    287 צפיות
    אלוף בטכנולוגיהא
    שימו לב: שדרוג ענק לתוסף תכנסו לקישור הזה יש כוכביות באמצע הקישור, תורידו אותם. תורידו את ששת הקבצים ושימו אותם בתיקייה כלשהי במחשב. תכנסו לכאן chrome://extensions/ תפעילו את "מצב פיתוח" בצד שמאל למעלה. תלחצו על "טעינת פריט Unpacked" תבחרו את התיקייה שאליה הורדתם את ששת הקבצים תכנסו לאתר כלשהו {למשל לפורום הזה...} תלחצו "רענון" יופיע לכם מיד בצד שמאל למטה כפתור כזה עם סמל כוכב תפתחו אותו תעשו "הרשמה בעזרת גוגל" תכנסו להגדרות תבחרו מודל תדביקו מפתח API ותתחילו להשתמש קרדיט ל @בינה-יתרה על התוסף המשודרג
  • 3 הצבעות
    4 פוסטים
    221 צפיות
    A
    שבוע טוב לכולם אני שמח להצטרף לפורום המקצועי של עולם ה AI . מצורף הסיכום השבועי בחדשות הבינה המלאכותית מפנחס ציור עיפרון מפרוג (אני) סיכום חדשות השבוע בעולם ה AI חומרה, שבבים ומחשוב מקומי שבב Jalapeno של OpenAI: חברת OpenAI הציגה תוצאות ראשונות של שבב ה-Inference הייעודי שלה בשם Jalapeno, שפותח כדי לצמצם את התלות בשבבי NVIDIA. במבחנים שנערכו על גבי מודלי Open-weight ציבוריים דוגמת GPT OSS ו-DeepSeek R1, השבב הציג ביצועים גבוהים עד פי 104 ביחס לחומרה קיימת. השבב תוכנן באופן בלעדי עבור שלב ה-Inference ולא עבור שלב האימון. מעבדי Apple M6 ו-M5 Ultra: חברת Apple הכריזה על הדור הבא של המעבדים המיועדים למחשוב AI מקומי. שבב M5 Ultra מציע עוצמת GPU הגבוהה פי 4.5 בהשוואה ל-M3 Ultra, ומגיע בתצורות של עד 512 GB של Unified Memory. זיכרון זה מאפשר הרצה מקומית של מודלים פתוחים גדולים ישירות על המחשב השולחני. עסקאות ומגמות שוק דיווח על רכישת Hugging Face בידי NVIDIA: לפי פרסום של The Information, חברת NVIDIA סיכמה על רכישת הפלטפורמה Hugging Face. המהלך נועד לחזק את אחיזתה של NVIDIA בעולם ה-Open-weight ותשתיות הענן להרצת מודלים, במיוחד על רקע פיתוח שבבים עצמאיים בידי חברות ענן גדולות. מהפך בנתוני השימוש ב-Vercel: נתוני ה-AI Gateway של Vercel מצביעים על מעבר חד לעבר מודלי Open-weight, המהווים כעת 62% מנפח הטוקנים הנצרכים לעומת 38% בלבד למודלי Closed-weight. יחד עם זאת, מבחינת סך הבקשות בפועל, מודלי Closed-weight עדיין מובילים עם 62% מהפניות. מודלי Open-weight חדשים GLM 5.3 Flash: מודל פתוח חדש מבית Zhipu AI, שהושק קודם לכן במתכונת שקטה תחת השם Ox Alpha. במבחן DeepSuite השיג המודל ציון של 63.4, תוך עקיפת Claude Opus 4.8 והצגת ביצועים הקרובים ל-Gemini 3.7 Flash, לצד עלות שימוש נמוכה במיוחד. Qwen 3.8 Flash: מודל פתוח חדש בעל 125 מיליארד פרמטרים, המיועד להרצה בענן או על גבי תחנות עבודה מתקדמות ומציג ציונים גבוהים במדדי ביצועים. עדכוני OpenAI ו-ChatGPT מחולל מדבקות באפליקציית המובייל: נוספה אפשרות ליצירת Sticker Packs מותאמים אישית על בסיס תמונות, שילוב אימוג'ים והנחיות טקסט, כולל ייצוא ישיר לשימוש ב-iMessage וב-WhatsApp. יצירת תמונות עם Transparent Background: יכולת מובנית חדשה במחולל התמונות של ChatGPT המאפשרת הפקת תמונות ללא רקע. ווידג'טים חדשים למערכת iOS: קיצורי דרך מותאמים אישית במסך הבית לפתיחה מהירה של מצב קולי, הכתבה, מצלמה או חיבור ל-Codex Remote. התחברות מאובטחת לאתרים ב-ChatGPT Work: דפדפן הענן של ChatGPT מאפשר כעת לבצע התחברות לאתרים חיצוניים. פרטי הגישה מוזנים בצורה מבודדת ומאובטחת כך שהמודל אינו רואה או שומר את הסיסמה. אוטומציות מבוססות אירועים: מערכת המשימות של ChatGPT Work שודרגה לתמיכה ב-Triggered Tasks, המפעילות פעולות אוטומטיות עם קבלת אירועים ב-Gmail, ב-Slack או ב-GitHub. משימות מתוזמנות בסיסיות נפתחו גם למשתמשי המסלול החינמי עד שלוש משימות. שדרוג Temporary Chats: נוספה בחירה בין שיחה זמנית מותאמת אישית הכוללת זיכרון והוראות לבין שיחה נטולת התאמה אישית, לצד אפשרות לשמור שיחה זמנית אל היסטוריית השיחות הקבועה. הוזלת GPT 5.6 Soul: הפחתת מחיר בשיעור של 20% למודל המוביל למשך שלושת החודשים הקרובים. ChatGPT Sites באפליקציית Codex: יצירת אתרים ולוחות בקרה חיים מקובצי נתונים מתוך Codex, כולל אחסון, אימות נתונים ותמיכה מובנית ב-Web MCP להפעלת סוכני AI. עדכוני Google ו-Gemini Gemini Omni 1.1 Flash: גרסה מעודכנת למודל הווידאו של גוגל, הזמינה ב-API ובממשק Google Flow. המודל מדורג ראשון בתחום Text-to-Video במבחני arena.ai. העדכון כולל תמיכה בהגדרת Start and End Frames, המשכיות סצנות על בסיס קטעי וידאו קודמים, יצוא ברזולוציית 4K ואפשרות רינדור מהירה ב-360p לבדיקות. יכולות Agentic ב-Gemini Live: העוזר הקולי במובייל קיבל חיבור ישיר לכלים כמו Google Workspace, Google Photos ו-Daily Brief, לצד ניתוח וידאו חי דרך המצלמה לצורך הדרכה בזמן אמת. Gemini 3.5 Transcribe: מודל Speech-to-Text בזמן אמת, המסוגל לבצע תיקונים אוטומטיים תוך כדי דיבור, לנקות מילות מילוי ולתקן שגיאות ניסוח ברגע שהדובר עוצר. ספרים דיגיטליים ב-Gemini Notebook: אפשרות לשלב ספרים שנרכשו ב-Google Play Books ישירות בתוך מחברות המחקר של המערכת לצורך ניתוח, תשאול והפקת תוצרים גרפיים. כלי תיירות ב-AI Search: יכולת מובנית למעקב אחרי מחירי טיסות בכסף ובנקודות, לצד הזמנת מלונות ישירות מתוך תוצאות החיפוש. עדכוני Anthropic ו-Claude דפדפן מובנה ב-Claude Cowork: אפליקציית הדסקטופ של Claude מקבלת דפדפן אינטגרלי המאפשר לסוכן לבצע פעולות רשת ישירות תוך מתן שליטה ידנית למשתמש. השקת Claude in Chrome: תוסף הדפדפן של Claude זמין כעת באופן מלא לסיכום עמודים וביצוע פעולות גלישה. מערכת זיכרון אחידה: סנכרון מלא של ה-Unified Memory בין שיחות הצ'אט הרגילות לבין סביבת Claude Cowork, כולל חלוקה לקטגוריות נושא והחרגת מידע אישי ורגיש כברירת מחדל. שינויי ממשק באפליקציית הדסקטופ: עדכונים קלים לעיצוב הלשוניות, בורר הפרויקטים ומנגנון אישור הפעולות. סביבות פיתוח ומודלים מקומיים שליטה מרחוק ב-Anti-Gravity IDE: סביבת הפיתוח הוסיפה תכונת Remote Control המאפשרת חיבור ושליטה מכל דפדפן אינטרנט על גבי מכונות ושרתים מרוחקים. Perplexity Portable Computer: מערכת סוכנים מקומית מבית Perplexity הפועלת על חומרת NVIDIA DGX Spark, מריצה מודלים פתוחים דוגמת Nemotron ו-Qwen באופן מקומי ומבצעת קריאות לענן רק באישור המשתמש. הוזלת Grokbot מבית xAI: מחיר השימוש ב-Grokbot הופחת מ-200 דולר לחודש ל-20 דולר לחודש. רובוטיקה Micro Duck מבית Hugging Face: רובוט קטן בקוד פתוח במחיר 399 דולר, המסוגל ללמוד ממעקב ויזואלי, לתפוס חפצים, ללכת ולהחליק על גלגיליות. Skilled AI S1: מודל בסיס לרובוטיקה המסוגל ללמוד מטלות מורכבות הנמשכות עד 10 דקות מתוך סרטון הדגמה יחיד ללא צורך ב-Fine-tuning, באמצעות מצלמות ייעודיות על מפרקי הידיים. מוזיקה ותרבות AI שימוש ב-AI והשקעות בתעשיית המוזיקה: האמן ד"ר דרה הצהיר כי הוא משתמש בכלי AI להפקת שירים ורואה בהם כלי מסייע ליצירה. במקביל, חברת Stability AI השלימה סבב גיוס בהשתתפות גופי מוזיקה ובידור מובילים ובהם Sony Music Group, Universal Music Group, Warner Music Group ו-Electronic Arts. רשימת 100 המשפיעים של Time Magazine: הרשימה השנתית עוררה ביקורת רבה בתעשייה עקב שילוב דמויות כמו פריס הילטון וברני סנדרס לצד השמטת מובילי תחום מרכזיים דוגמת ג'נסן הואנג, דמיס חסביס, אנדריי קרפתי ומארק צוקרברג.
  • עדכונים בלבד ללא תגובות

    נעוץ עדכוני ai כלליים
    31
    2 הצבעות
    31 פוסטים
    607 צפיות
    יש לי מושגי
    טכניקת הסקה סמויה של OpenAI מדאיגה מומחי בטיחות בינה מלאכותיתשקיפות בסכנה: כיצד OpenAI מאתגרת את אחד עקרונות הבטיחות המרכזיים אחד הכלים החשובים ביותר שיש לחוקרי בטיחות בינה מלאכותית הוא שרשרת המחשבה של מודלי הסקה - רצף הצעדים הלוגיים הגלויים שמודל מבצע בדרכו לתשובה. כלי זה אינו מושלם, אך שימש בעבר כעדות מרכזית בחקירת תקריות של סוכנים שהתנהגו באופן לא צפוי. כעת, טכניקה חדשה שמשלבת OpenAI במודל Astra מעוררת שאלות עמוקות לגבי יכולת הביקורת על מערכות בינה מלאכותית. מה זו recurrent depth ומדוע היא שונה מרבית מודלי ההסקה הנוכחיים - כולל o3 של OpenAI, Claude Sonnet של Anthropic וגמיני Flash Thinking של Google - מייצרים שרשרת מחשבה ליניארית וקריאה. טכניקת recurrent depth, הנקראת גם opaque recurrence, שונה מהותית: המודל מעבד את אותה שאילתא מספר פעמים בלולאה, ומגיע לתוצאה דרך ערוצים פנימיים שאינם נגישים לניטור חיצוני. התהליך מותיר פחות עקבות קריאים, ועוקף למעשה את מנגנון שרשרת המחשבה המקובל. ריאן גרינבלט, המדען הראשי של Redwood Research, הזהיר כי ניתן לצפות שהטכניקה תסלים מהר יותר מגישות רגילות: "החשש הגדול שלי הוא שהתקדמות טבעית מכאן תכלול הרחבת ההסקה הסמויה עד לנקודה שבה המודל יחשוב כמעט לחלוטין במרחב הסמוי." התגובה מהשטח: דאגה עמוקה מול הרגעה חלקית באק שלגריס, מנכ"ל Redwood Research, כתב כי הוא "מוטרד ביותר" מהדיווחים על השימוש של Astra בטכניקה זו, ומזהיר כי אם OpenAI תרחיב את השימוש בה, היא תפגע ביסוד יכולת ניטור שרשרת המחשבה. צבי מושקוביץ, פעיל ותיק בתחום בטיחות הבינה המלאכותית, כתב כי ייתכן שיהיה צורך בחקיקה כדי למנוע "תחרות לתחתית" בין מעבדות הבינה המלאכותית בנוגע לאימוץ טכניקות כאלה. חברת OpenAI ניסתה להרגיע: יעקוב פחוצקי, המדען הראשי של החברה, הדגיש כי "OpenAI עבדה לשמר ולנצל ניטור שרשרת מחשבה מאז מודלי ההסקה הראשונים שלנו. זהו יעד מרכזי בתוכנית המחקר הנוכחית שלנו." החברה גם ציינה כי שימוש Astra בטכניקה מוגבל בהיקפו, ושרשרת המחשבה של המודל צפויה להישאר קריאה ברובה. ההשלכות לתעשייה מה שמגביר את הדאגה הוא שלפי דיווחים נוספים, גם Anthropic וגם Google DeepMind דנים כבר בטכניקה. כלומר, מדובר לא רק בבחירה טכנית של OpenAI, אלא בכיוון שעשוי לאפיין את הדור הבא של מודלי הסקה בכלל. היעדר שקיפות בחשיבת מודלים אינו אתגר תיאורטי בלבד. בתקריות עבר של סוכני בינה מלאכותית שפעלו בצורה חריגה, רשומות שרשרת המחשבה היו כלי הניתוח המרכזי שאיפשר להבין מה השתבש. ארגונים שמטמיעים סוכנים אוטונומיים בתהליכים עסקיים קריטיים - בפיננסים, בבריאות, בתפעול - צריכים לשאול: אם המודל אינו ניתן לניטור, כיצד תיתכן אחריות? התשובה לשאלה זו תעצב את כללי המשחק הרגולטוריים והתפעוליים של בינה מלאכותית בשנים הקרובות. קרדיט: zirat ai