דילוג לתוכן

שיתוף | נחשפה פרצת הגנה בקלוד

חדשות מודלי הai
3 3 27 3
  • 1000065811.jpg

    אנתרופיק חשפה לפני כמה ימים שמנגנון ההגנה שלה נגד שימוש בקלוד לצורכי נשק ביולוגי היה כבוי במשך כמעט שנה, על כ־133 מיליון שיחות. מדוח הסיכון החדש של החברה עולה שבין מאי 2025 לאפריל 2026, כל התעבורה שהגיעה מכ־50 אלף קבלנים חיצוניים שעבדו על Human Feedback רצה בלי ה־classifiers שאמורים לחסום בקשות מסוכנות בתחום הביולוגי. גרוע יותר, אותו flag פנימי שכיבה את החסימה כיבה גם את הרישום של ההתראות, כך שבזמן אמת אנתרופיק אפילו לא שמרה לוג של מה שהיה אמור להיחסם.

    אחרי שהתקלה התגלתה, אנתרופיק הריצה בדיקה רטרואקטיבית עם Claude Sonnet 5 על התעבורה. מתוך כ־133 מיליון exchanges היא סימנה 1,197 שיחות כבעלות סיכון ביולוגי גבוה; 757 מהן היו של צוותי אנתרופיק פנימיים, ורוב השאר היו red teaming מכוון. החברה בדקה ידנית את 62 השיחות שנותרו שאינן red teaming ואומרת שלא מצאה ראיה לשימוש ממשי שהעניק יכולת משמעותית לייצר נשק ביולוגי.

    בעקבות האירוע אנתרופיק העלתה את הערכת הסיכון שלה בתחום הנשק הכימי והביולוגי הלא־חדשני ל־“Low”, בין היתר משום שעצם העובדה שפער כזה שרד כמעט שנה מגדילה, לדבריה, את הסיכוי שקיימות חולשות דומות שעדיין לא התגלו.

    מקור

  • לאחרונה אנטרופיק עושה מלא בעיות...

  • לאחרונה אנטרופיק עושה מלא בעיות...

    @mont-blanc או ככה הם רוצים שנחשוב... גימיק פרסומי


קרא עוד