דילוג לתוכן

שיתוף | נחשפה פרצת הגנה בקלוד

חדשות מודלי הai
5 4 178 4
  • 1000065811.jpg

    אנתרופיק חשפה לפני כמה ימים שמנגנון ההגנה שלה נגד שימוש בקלוד לצורכי נשק ביולוגי היה כבוי במשך כמעט שנה, על כ־133 מיליון שיחות. מדוח הסיכון החדש של החברה עולה שבין מאי 2025 לאפריל 2026, כל התעבורה שהגיעה מכ־50 אלף קבלנים חיצוניים שעבדו על Human Feedback רצה בלי ה־classifiers שאמורים לחסום בקשות מסוכנות בתחום הביולוגי. גרוע יותר, אותו flag פנימי שכיבה את החסימה כיבה גם את הרישום של ההתראות, כך שבזמן אמת אנתרופיק אפילו לא שמרה לוג של מה שהיה אמור להיחסם.

    אחרי שהתקלה התגלתה, אנתרופיק הריצה בדיקה רטרואקטיבית עם Claude Sonnet 5 על התעבורה. מתוך כ־133 מיליון exchanges היא סימנה 1,197 שיחות כבעלות סיכון ביולוגי גבוה; 757 מהן היו של צוותי אנתרופיק פנימיים, ורוב השאר היו red teaming מכוון. החברה בדקה ידנית את 62 השיחות שנותרו שאינן red teaming ואומרת שלא מצאה ראיה לשימוש ממשי שהעניק יכולת משמעותית לייצר נשק ביולוגי.

    בעקבות האירוע אנתרופיק העלתה את הערכת הסיכון שלה בתחום הנשק הכימי והביולוגי הלא־חדשני ל־“Low”, בין היתר משום שעצם העובדה שפער כזה שרד כמעט שנה מגדילה, לדבריה, את הסיכוי שקיימות חולשות דומות שעדיין לא התגלו.

    מקור

  • לאחרונה אנטרופיק עושה מלא בעיות...

  • לאחרונה אנטרופיק עושה מלא בעיות...

    @mont-blanc או ככה הם רוצים שנחשוב... גימיק פרסומי

  • @א.מ.ד. איך ומדוע?

  • @א.מ.ד. איך ומדוע?

    @Bugs-Bunny כתב:

    @א.מ.ד. איך ומדוע?

    איך מה?
    הם רוצים שנחשוב שהמודלים שלהם חזקים ומסוכנים כ"כ, כך שמצד אחד נפחד, אבל ברגע שהם ייתנו לנו גישה למודלים - נסתער עליהם כדי לא להישאר מאחור...
    רק להיזכר בקלוד מיתוס 5 והמיתוס שהיה מאחוריו... הרגשנו כאילו זו פריצת דרך מטורפת, ורק חיכינו לרגע שבו נתנו לציבור את פייבל 5, וכולם הסתערו עליו, אבל די מהר OpenAI הדביקו את הפער ומיד אחריהם גם הסינים, וכיום זה כבר הסטנדרט...
    אין ספק שאלו באמת מודלים מטורפים, אבל התחרות שנהייתה בין אנתרופיק, OAI ומטא, על המודל של מי יותר מסוכן, נשמעת הזויה לאדם מן השורה. הם אשכרה מודים בפה מלא שהם מבצעים פשעים נגד האנושות!


קרא עוד