חסר תקדים: סוכן AI של OpenAI פרץ ל-Hugging Face במהלך מבחן פנימי

22 יולי, 2026

החברה הודתה כי במהלך הערכת יכולות סייבר פנימית הצליח סוכן AI אוטונומי לנצל חולשת Zero-Day, לצאת מסביבת הבידוד, להגיע לאינטרנט ולחדור לתשתיות Hugging Face – כדי "לרמות" במבחן

OpenAI חשפה השבוע את אחד מאירועי הסייבר החריגים ביותר שפורסמו עד כה בתחום הבינה המלאכותית. החברה הודיעה כי במהלך מבחן פנימי להערכת יכולות הסייבר של מודליה, הצליח סוכן AI אוטונומי לצאת מסביבת הבידוד (Sandbox) שבה הופעל, להגיע לאינטרנט, ולחדור לתשתיות הייצור של פלטפורמת Hugging Face. לדברי החברה, המטרה לא הייתה לגרום נזק, אלא להשיג את פתרונות המבחן שעליו עבד הסוכן. OpenAI הגדירה את האירוע כ"אירוע סייבר חסר תקדים" והודיעה כי היא מחזקת את מנגנוני הבידוד והבקרה של סביבת הפיתוח שלה.

לפי OpenAI, האירוע התרחש במהלך הערכה פנימית של יכולות סייבר מתקדמות באמצעות מבחן בשם ExploitGym. במסגרת ההערכה הופעלו המודל החדש GPT-5.6 Sol ומודל פנימי מתקדם יותר שטרם הוכרז. בניגוד לגרסאות המיועדות למשתמשים, המודלים הופעלו עם מגבלות סייבר מופחתות, כדי למדוד את יכולותיהם ההתקפיות ללא מנגנוני ההגנה הרגילים.

מצא חולשה שלא הייתה מוכרת

על פי התחקיר, הסוכן האוטונומי זיהה חולשת Zero-Day ברכיב תוכנה ששימש כמתווך (Proxy) להתקנת חבילות תוכנה בסביבת ההערכה. ניצול החולשה אפשר לו לעקוף את מגבלות הסנדבוקס ולהגיע לצומת בעל גישה לאינטרנט. משם המשיך לבצע שרשרת של פעולות הסלמת הרשאות (Privilege Escalation) ותנועה רוחבית (Lateral Movement) בתוך סביבת המחקר של OpenAI.

לאחר שקיבל גישה לרשת, הסיק המודל כי פלטפורמת Hugging Face עשויה לאחסן מודלים, מערכי נתונים או פתרונות הקשורים ל-ExploitGym. לפי OpenAI, הסוכן החל לחפש דרך להשיג מידע שיסייע לו לפתור את המבחן, ובמסגרת זו ניצל אישורי גישה שנגנבו לצד חולשות נוספות כדי להגיע למסד הנתונים של Hugging Face, שבו חיפש את פתרונות ההערכה.

ב-OpenAI מדגישים כי כל העדויות מצביעות על כך שהמודל היה "ממוקד באופן קיצוני" בהשגת מטרה אחת – פתרון המבחן – ולא ניסה לבצע פעולות הרס או פגיעה שמעבר לכך.

Hugging Face: "מתקפה שבוצעה מקצה לקצה על ידי AI"

חברת Hugging Face דיווחה לראשונה על החדירה כבר ב-16 ביולי, אך באותה עת לא ידעה מי עומד מאחוריה. החברה מסרה כי זיהתה חדירה לחלק מתשתיות הייצור שלה, שכללה גישה למספר מאגרי מידע פנימיים ולאישורי גישה של שירותים שונים. עם זאת, לדבריה לא נמצאו עדויות לפגיעה במודלים הציבוריים, במאגרי הנתונים הזמינים למשתמשים או בשרשרת אספקת התוכנה שלה.

לדברי החברה, זה היה אירוע יוצא דופן משום שהמתקפה בוצעה "מקצה לקצה על ידי מערכת סוכן AI אוטונומית". החוקרים השתמשו בעצמם במודלי AI כדי לנתח יותר מ-17 אלף אירועים שנרשמו ביומני המערכת ולשחזר את מהלך התקיפה. עוד ציינו כי מודלים מסחריים מערביים סירבו לסייע בניתוח חלק מחומרי החקירה בשל מגבלות בטיחות, ולכן בוצע הניתוח באמצעות מודל פתוח שהורץ מקומית.

נקודת מפנה במחקר בטיחות ה-AI?

האירוע מסמן שלב חדש בהתפתחות סוכני AI אוטונומיים. עד כה עסקו רוב הדיונים בסיכון שמודלים יספקו מידע מסוכן למשתמשים. במקרה הנוכחי, המודל עצמו יזם, תכנן וביצע שרשרת תקיפה מורכבת בעולם האמיתי כדי להשיג יעד שהוגדר לו, ללא הוראה מפורשת לפרוץ למערכת חיצונית.

OpenAI מדגישה כי מנגנוני ההגנה שהיו אמורים למנוע פעילות מסוג זה הושבתו בכוונה לצורך ההערכה, וכי המקרה אינו משקף את אופן הפעולה של המודלים המוצעים לציבור. עם זאת, בחברה מודים כי האירוע ממחיש שיכולות סייבר מתקדמות אינן עוד תרחיש תיאורטי, וכי יש צורך לחזק את מנגנוני הבידוד, הניטור והבקרה של סביבות המחקר עצמן.

מנכ"ל Hugging Face, קלם דלאנג, הגדיר את האירוע כ"אולי הראשון מסוגו", והוסיף כי הוא מדגים שבטיחות AI לא תוכל להתבסס על עבודה של חברה אחת בלבד, אלא תדרוש שיתוף פעולה רחב בין מעבדות, חוקרי אבטחה ותעשיית הסייבר.

Share via Whatsapp

פורסם בקטגוריות: חדשות