הלאמת הבינה המלאכותית: מאחורי הקלעים של השבתת פייבל 5

  


לפני ארבעה ימים בלבד הושק בקול תרועה רמה מודל פייבל 5 לקהל המנויים של קלוד כדגם בטוח למדי של מודל מיתוס יוצא הדופן. אנת'רופיק אף הזהירה את הציבור ששאילתות מסוימות לא ייענו....שימו לב לטקסט הבא: 

בין היתר הודיעה אנת'רופיק כך בהודעה הרשמית לציבור 

"היום אנו משיקים את Claude Fable 5: מודל Mythos-class1 שהפכנו לבטוח לשימוש כללי.

יכולותיו של Fable 5 עולות על אלו של כל דגם שהפכנו אי פעם לזמין באופן כללי. הוא חדיש כמעט בכל מדדי היכולות שנבדקו של בינה מלאכותית, ומציג ביצועים יוצאי דופן בהנדסת תוכנה, עבודת ידע, חזון, מחקר מדעי ותחומים רבים אחרים. ככל שהמשימה ארוכה ומורכבת יותר, כך היתרון של Fable 5 גדול יותר על פני המודלים האחרים שלנו.

שחרור מודל בעל יכולות כאלה כרוך בסיכונים. ללא אמצעי הגנה, יכולותיו של Fable 5 בתחומים כמו אבטחת סייבר עלולות להיות מנוצלות לרעה ולגרום נזק חמור. לכן השקנו את המודל עם אמצעי הגנה שמשמעותם ששאלות בנושאים מסוימים יקבלו מענה במקום זאת מהמודל הבא שלנו בעל יכולותיו, Claude Opus 4.8. כדי לשחרר את המודל בצורה בטוחה ומהירה, כוונן את אמצעי ההגנה הללו באופן שמרני - לפעמים הם יתפסו בקשות לא מזיקות, אם כי הן מופעלות, בממוצע, בפחות מ-5% מההפעלות. עם מודלים חזקים יותר שיגיעו בחודשים הקרובים, אנו פועלים לשיפור אמצעי ההגנה שלנו ולהפחתת תוצאות חיוביות שגויות מהר ככל האפשר.

עבור קבוצה קטנה של מגיני סייבר וספקי תשתיות, אנו משיקים גם את Claude Mythos 5. זהו אותו מודל בסיסי כמו Fable 5, אך עם הסרת אמצעי ההגנה באזורים מסוימים.2 Mythos 5 ייפרס בתחילה דרך Project Glasswing, בשיתוף פעולה עם ממשלת ארה"ב, כשדרוג ל- Claude Mythos Preview. יש לו את יכולות אבטחת הסייבר החזקות ביותר מכל מודל אחר בעולם. בקרוב, אנו מתכוונים להרחיב את הגישה ל-Mythos 5 באמצעות תוכנית גישה מהימנה רחבה יותר.

ליכולות של מודלים כמו Fable 5 ו-Mythos 5 יש פוטנציאל לעשות טוב עמוק לעולם. ראינו את תחילתה של זה ב- Project Glasswing, שם המודלים סייעו למגיני סייבר לאבטח תוכנה חשובה ביותר. ראינו זאת גם במחקר מדעי החיים, שם המודלים מציגים השערות חדשות ומאיצים את פיתוחן של תרופות חדשות...."

ואמנם אנשים רבים התנסו במודל והתלהבו מהיכולות חסרות התקדים של המודל. אני לא הספקתי להתנסות בו, תיארתי לעצמי שהטוקנים ייגמרו לי בשניות והייתי זקוקה להם למשימות השוטפות ולא העליתי על דעתי שתוך ימים ספורים המודל שוב לא יהיה זמין לי. 

בשבת בבוקר, שלושה ימים בלבד (שעון ארה"ב) לאחר ההשקה, נתברר שבהוראות הממשל האמריקאי הוחל איסור שימוש במודל לכל מי שאינו אזרח אמריקאי, כולל לעובדי אנת'רופיק עצמם. 

אנת'רופיק פירסמה בדף ההשקה את ההודעה הרשמית הבאה (כמובן מקצרת לכם)

"הצהרה על הנחיית ממשלת ארה"ב להשעות את הגישה ל-Fable 5 ול-Mythos 5

בהתבסס על מערך הביטחון הלאומי, ממשלת ארה"ב הוציאה דירקטיבה להשעות את כל הגישה ל-Fable 5 ול-Mythos 5 לכל אזרח זר, בתוך ארצות הברית ומחוצה לה, כולל עובדי Anthropic בעלי אזרחות זרים. התוצאה הסופית של צו זה היא שעלינו להשבית באופן פתאומי את Fable 5 ו-Mythos 5 עבור כל לקוחותינו כדי להבטיח תאימות. הגישה לכל שאר דגמי Anthropic לא תושפע....

להבנתנו נודע לממשלה על דרך לעקוף (Jailbreaking) את מנגנוני האבטחה של של Fable 5. ....

עמדתה של Anthropic בנוגע לאמצעי ההגנה של Fable, כפי שפורט בפוסט בבלוג ההשקה שלנו, היא כדלקמן:

ייסדנו אמצעי הגנה חזקים המפחיתים מאוד את הסבירות ש-Fable ינוצל לרעה, בין היתר, למשימות הקשורות לאבטחת סייבר . למעשה, אמצעי ההגנה שלנו כה חזקים עד שמשתמשים רבים התלוננו שהם רחבים מדי.

בשבועות שקדמו להשקה ובמהלך כולל של אלפי שעות, אנת'רופיק עבדה עם ממשלת ארה"ב, רשות הביטחון הבריטית (AISI), מספר ארגוני צד שלישי פרטיים וצוותים פנימיים כדי להפעיל צוות אדום של אמצעי ההגנה של Fable .

בדיקות אלו הראו שאמצעי ההגנה של Fable יעילים משמעותית מאלה של כל מודל שנפרס בעבר. אף בודק לא איתר פריצת דרך אוניברסלית - שיטת פריצה שיכולה לעקוף באופן נרחב מאוד את אמצעי ההגנה של המודל, ולבטל חסימה של מגוון רחב של יכולות סייבר.

אנו חושדים שעמידות מושלמת לפריצה אינה אפשרית כיום עבור אף ספק מודל. כל אמצעי הגנה המשמשים בתעשייה פגיעים לפריצות לא אוניברסליות (היכולות לחלץ מידע סייבר בנסיבות ספציפיות), וסביר להניח שפריצות לא אוניברסליות יימצאו בסופו של דבר בעתיד. הצהרנו זאת בבירור כאשר שחררנו את Fable 5.....


עד כה, הממשלה סיפקה לנו רק ראיות מילוליות לפריצת פריצה צרה ולא אוניברסלית פוטנציאלית, הכוללת למעשה בקשה מהמודל לקרוא בסיס קוד ספציפי ולתקן כל פגם תוכנה. הבנתנו היא שפריצת פריצה פוטנציאלית אחת שותפה עם הממשלה. סקרנו דו"ח שלדעתנו הוא הבסיס להנחיית הממשלה ואישרנו שרמת היכולת המוצגת שם זמינה באופן נרחב ממודלים אחרים (כולל GPT-5.5 של OpenAI), ומשמשת מדי יום את המגנים ששומרים על בטיחות המערכות. נשתף פרטים נוספים במהלך 24 השעות הקרובות.


אנו פועלים בהתאם להנחיית הממשלה ומסירים את הגישה ל-Fable 5 ול-Mythos 5 עבור כל המשתמשים. עם זאת, איננו מסכימים שהממצא של פריצת פריצה פוטנציאלית צרה צריך להיות סיבה לביטול מודל מסחרי שנפרס על ידי מאות מיליוני אנשים. אם תקן זה היה מיושם ברחבי התעשייה, אנו מאמינים שהוא היה למעשה עוצר את כל פריסות המודלים החדשות עבור כל ספקי המודלים המובילים.


כפי שציינו בפומבי, אנו מאמינים שלממשלה צריכה להיות היכולת לחסום פריסות לא בטוחות, כחלק מתהליך סטטוטורי שקוף, הוגן, ברור ומבוסס על עובדות טכניות. פעולה זו אינה עומדת בעקרונות אלה. אנו מתנצלים על שיבוש זה ללקוחותינו. אנו מאמינים שמדובר באי הבנה ופועלים להשיב את הגישה בהקדם האפשרי."

נקודות חשובות שיש להדגיש 

1. עידן ה-AI המולאם כבר כאן: מודלים של בינה מלאכותית הם כבר לא סתם מוצרים מסחריים. הם מוגדרים כנשק אסטרטגי לכל דבר ועניין. אנחנו נכנסים לעידן של "ITAR" (תקנות הסחר הבינלאומי בנשק של ארה"ב) עבור קוד. המודלים הללו מטופלים כעת כמו פצצות אטום או מטוסי קרב.

2. נשק זמין בכל כיס: פעולת הממשל האמריקאי מראה שלתפיסתו אפילו למודל "הבטוח למדי" יש כבר כיום יכולות המסכנות את הביטחון הלאומי של ארצות הברית וככל הנראה את האנושות. תגובת אנת'רופיק מראה כי הם מכירים באפשרות של פריצה צרה או מקומית למודל (כמו לכל מודל אחר הזמין לכלל הציבור כיום) אבל לא פריצה ברמה גלובלית / אוניברסלית 

3. מודל מסוכן מסוכן לכולם וההיפך: מה שמדאיג יותר הוא שלמרות תפיסת הממשל האמריקאי שהמודל עלול להוות סכנה לביטחון הלאומי של ארצות הברית עד כדי כך שאפילו לעובדי אנת'רופיק שאינם אזרחים אמריקאיים אסור להשתמש בו. אין להם שום חשש שאזרחים אמריקאיים ישתמשו בו...

4.  האבסורד של הדרכון - לא ברור בדיוק איך ציפו מאנת'רופיק לאפשר גישה לא על בסיס גיאוגרפי אלא על בסיס אזרחות אמריקאית.....לכן הם כמובן חסמו את הגישה לכולם. האם למי מבין מקבלי ההחלטות בממשל האמריקאי יש איזו שהיא הבנה טכנולוגית? 

5. שיתוק מוחלט של חברות הבינה: אנת'רופיק מציינת בצדק כי אם פריצה צרה ומקומית (Jailbreak) היא עילה להשבתת מודל, הרי שאף חברה לא תוכל להשיק יותר מודלים חדשים 

6. ביטחון לאומי - מילות הקסם: מההצהרה של אנת'רופיק עולה שההוכחות שהוצגו לה על ידי הממשל אינן חד משמעיות ואף קלושות, אך באיצטלה של ביטחון לאומי ניתן לעשות הכל. אז מי יוכל לבקר את הממשל ומי יבטיח לנו שהשיקולים שנשקלו הם שיקולים רלבנטיים. האם הממשל באמת זיהה סכנה קיומית, או שיש כאן "מאבק כוחות" פוליטי וניסיון להפגין שליטה מול חברות הטכנולוגיה? העובדה ש-GPT-5.5 מסוגל לעשות דברים דומים (לפי אנת'רופיק) מחזקת את החשד שמדובר בצעד פופוליסטי או נקודתי.

7. האזרחים שרויים בעלטת מידע: בין בינה העלולה לאיים על בטחון העולם לבין ממשל השומר על חשאיות ומקבל החלטות דרמטיות, פופוליסטיות (כאמור אם זה מסוכן אז זה מסוכן לכולם ), ובהיעדר שקיפות, ללא הוכחות טכניות מוצקות לציבור ואף לא לחברה הנפגעת; וכשהאינטרסים האמיתיים נשארים חסויים, האזרחים הם כרגיל האחרונים לדעת. 






Comments

Popular posts from this blog

הכלכלה הפוליטית מאחורי הבינה המלאכותית - רשמים מהרצאתה של דנה בויד

המלצת צפייה: סדרת הדוקו שפוליטיקאים היו רוצים שתשכחו