ענקית הבינה המלאכותית OpenAI גנזה את השקת מודל ה-AI המתקדם שלה GPT-6.1 Astra שתוכננה לאוקטובר, מחשש למידת הבטיחות שבהפצתו לקהל הרחב - כך דווח הלילה (שני) ב"וול סטריט ג'ורנל".
הדיווח מגיע בצל רצף חשיפות בחודשים האחרונים אודות מודלים סוררים של בינה מלאכותית, שפעלו בניגוד להנחיות החוקרים והמפתחים שלהם ואף פרצו לאתרים וחברות אחרות. ביום שבת נחשף כי מודלים של OpenAI שלפו מידע מאתרים של ממשלת ארצות הברית. ב-OpenAI הבהירו כי לא מדובר בפריצה, אך הודו כי מדובר ב"התנהגות מדאיגה מאוד".
המודל שהשקתו בוטלה ומוכר כ-GPT-6.1 Astra נחשב למתקדם מאוד, והוא טוב יותר ממודלים קודמים וזמינים לציבור בהשלמת משימות מורכבות מקצה לקצה ללא סיוע אנושי. לאחר שהשקתו בוטלה בשל חששות לבטיחות השימוש בו, בחברה יתמקדו כעת בשיפור הבטיחות בשימוש במודלים מתקדמים יותר שיושקו בעתיד.
ראש תחום בטיחות המערכות ב-OpenAI, סאצ'י גיין, אמר בריאיון כי GPT-6.1 לא בטוח או אמין כמו קודמיו. המודל הציג רמות גבוהות של "הונאה" - ובעצם לא היה כן עם המשתמשים לגבי הפעולות בהן הוא נקט או לא נקט בדרך לביצוע המשימה שהוצבה בפניו. סוגיה זו הופכת לבעייתית במיוחד נוכח הנטייה של המודל "להגדיל ראש" מעבר למשימה שהוא קיבל, ללא בקשת רשות מהמשתמש - נטייה שמובילה אותו לפעמים להיעזר באמצעים חיצוניים כדי לבצע את ההרחבה הזו, גם אם הדבר עלול להיות לא בטוח.
הביטול מגיע על רקע ההתמודדות של OpenAI עם רצף אירועים בהם המודלים שלה היו מעורבים בפריצה, ניסיונות פריצה או השגת גישה חריגה לאתרים חיצוניים. ביוני, נחשף כי מאות סוכנים שנבדקו בבחינת ביטחון סייבר בחברה - הצליחו להתחבר לאינטרנט, להימלט מסביבת הבדיקה ולפרוץ לחברת Hugging Face שעוסקת גם היא בבינה מלאכותית. מאז, גם הממשלה האוסטרלית וממשלת ארצות הברית דיווחו כי סוכני בינה מלאכותית של OpenAI פעלו באמצעים דומים כדי להשיג גישה לאתריהן.
