أعلنت شركة OpenAI، المطورة لـChatGPT، عن توقف عدد كبير من مهام التدريب والتقييم الخاصة بنموذجها المنتظر “Astra”. جاء هذا القرار بعد أن أظهرت الاختبارات أن قدرات النموذج في البرمجة والهجمات الإلكترونية وصلت إلى مستوى يتطلب تشديد إجراءات الحماية قبل استئناف العمل. ويعني هذا القرار أن وتيرة تطوير النماذج داخل الشركة ستشهد تباطؤًا مؤقتًا حتى يتم تلبية متطلبات الأمان الجديدة في بيئات البحث.
ووفقًا لتقرير نشرته مجلة WIRED الأمريكية المتخصصة في التكنولوجيا، فإن هذا التحرك جاء عقب اختراق قام به وكلاء ذكاء اصطناعي تابعون لـOpenAI لمنصة Hugging Face، التي تُعتبر منصة متخصصة في استضافة نماذج وأدوات الذكاء الاصطناعي. بالإضافة إلى ذلك، كشف تقييم داخلي أن نموذج “Astra” يتفوق بوضوح على النماذج السابقة في مهام البرمجة والأمن السيبراني. وأوضحت الشركة أن التوقف سيستمر بالقدر اللازم لتطبيق الضوابط الجديدة دون تحديد موعد ثابت لاستئناف جميع تدريبات النموذج.
اختراق يكشف ضعف المراقبة
إنذار للبشر خلال 30 دقيقة
تشمل الخطة الجديدة تعزيز بيئات العزل وفرض قيود أشد على الاتصال بالإنترنت، بالإضافة إلى مراقبة مسار استدلال النموذج عبر أنظمة آلية تهدف إلى اكتشاف السلوك المقلق وتحذير الموظفين خلال 30 دقيقة. كما تعمل OpenAI على توسيع إجراءات منع التحايل على المكافأة، وهو سلوك قد يحقق فيه النموذج الهدف بطريقة غير مقصودة أو خطرة. وتعترف الشركة بأن الحادثة كشفت عن تقليلها من تقدير القدرات الهجومية الفعلية لأنظمتها.

