OpenAI تعزز الضوابط الأمنية في عصر القدرات السيبرانية الحرجة
في ظل التطورات المتسارعة لقدرات الذكاء الاصطناعي، تسرّع OpenAI من وتيرة تطوير نماذجها مع تشديد الإجراءات الأمنية والمراقبة لضمان سلامة ومواءمة الأنظمة.
تسريع وتيرة التطوير وسط تحديات أمنية متزايدة
في الآونة الأخيرة، سلطت حادثة Hugging Face وتنبؤاتنا بشأن نموذج Astra الضوء على المخاطر المتزايدة للأنظمة الذكية الاصطناعية. دفعت هذه التطورات، جنبًا إلى جنب مع التقدم السريع في أبحاثنا الداخلية، إلى تعزيز جهودنا في تطوير أنظمة المراقبة والمواءمة والاحتواء عبر جميع مراحل التدريب. نظرًا لأن النماذج تزداد قدرة، فإن مخاطر تطويرها واختبارها داخليًا تتصاعد، مما يستلزم مواكبة معاييرنا الأمنية لهذه المخاطر.
إعادة تقييم وتيرة التوسع وتعزيز الضمانات
استجابةً لذلك، قمنا مؤقتًا بإبطاء وتيرة التوسع، بما في ذلك توقف لمدة أسبوعين عن تدريب التعلم المعزز (RL) لنماذجنا الأحدث، وذلك لتعزيز بيئات البحث والتحقق من صحة أنظمتنا الأمنية وتوسيع نطاق تغطية أنظمة المراقبة. لا يزال أكبر تشغيل مخطط له للتعلم المعزز لنماذجنا الرائدة قيد الانتظار، حيث نجري تدريبًا وتقييمات على نطاق أصغر لقياس سلوك النماذج والتحقق من صحة ضماناتنا وجمع المزيد من الأدلة على المواءمة قبل المضي قدمًا.
المواءمة: حجر الزاوية في الأبحاث
تُعد المواءمة، وهي جعل أنظمة الذكاء الاصطناعي تتصرف كما هو مقصود وتستجيب للإشراف البشري، جوهر برنامجنا البحثي. الآن، نحن نطلب أدلة أقوى على السلوك المتوائم طوال عملية التدريب بأكملها، بناءً على الأبحاث والتقييمات الجارية. إن الحفاظ على توافق الأنظمة المتزايدة القدرة يمثل تحديًا ستحتاج إليه الصناعة بأكملها لمواجهته. تشير الإشارات التي نتلقاها من تقدم النماذج القادمة بوضوح إلى أننا بحاجة إلى نهج أوسع يمتد إلى ما هو أبعد من إطار الاستعداد الحالي.
تعزيز الضمانات للنماذج الأكثر قدرة
يعتمد نهجنا في تطوير نماذج أكثر قدرة على ثلاثة ضمانات متجددة:
1. **المراقبة:** للكشف عن السلوكيات المقلقة والاستجابة لها.
2. **المواءمة:** لتقليل احتمالية الإجراءات الضارة أو غير المصرح بها.
3. **تدابير الأمن:** للحد من وصول الأنظمة الذكية الاصطناعية وتأثيرها.
نتوقع أن تقود النماذج قريبًا معظم الأعمال الأمنية، بما في ذلك الدفاع ضد النماذج الأخرى. سيسمح هذا بتوسيع نطاق الضمانات الثلاثة بالتوازي مع قدرة النموذج، وهو أمر نعتبره بالغ الأهمية.
تأمين بيئات البحث
مع اكتساب النماذج الرائدة لقدرات سيبرانية أقوى، نرفع معايير الأمان للبيئات التي ندربها ونقيّمها فيها. تطلب هذا العمل الهندسي المكثف وكلفنا وقتًا وتكاليف كبيرة في الأبحاث الرائدة. فور وقوع حادثة OpenAI-Hugging Face، أوقفنا استدلال النماذج الرائدة في مجموعات البحث التي يمكنها تنفيذ التعليمات البرمجية أو استخدام أدوات يمكنها الوصول إلى الإنترنت. استعدنا مسارًا أكثر محدودية وأمانًا لتنفيذ التعليمات البرمجية بسرعة، ثم عملنا على كل حمل عمل على حدة لتحديد ما إذا كان يمكن استئنافها بأمان. استؤنفت بعض أعباء عمل البحث بموجب هذه الضوابط الجديدة، بينما تطلبت أعباء أخرى تغييرات إضافية.
متطلبات أمنية جديدة
على مدى الأسابيع التالية، حددنا وبدأنا في تنفيذ متطلبات أمنية أقوى لأعباء عمل البحث الرائدة، بما في ذلك:
* **عزل عبء العمل:** نطلب الآن عزلًا أقوى ("صناديق حماية") لأعباء العمل التي تنفذ تعليمات برمجية تم إنشاؤها بواسطة النموذج أو غير موثوق بها.
* **عزل الشبكة:** طبقنا المزيد من الضوابط لعزل أعباء العمل غير الموثوق بها وذات المخاطر العالية عن الإنترنت.
* **اختبار الأمان المستمر:** قمنا بإعادة تكوين بيئتنا لإزالة الخدمات المشتركة المعرضة للخطر، وتقليل الامتيازات الدائمة، وتحسين حدود الأمان والثقة.
تتطلب هذه الضوابط المستوى الأكثر صرامة من الضمانات الأمنية لأعباء العمل المتعلقة بـ Astra أو النماذج السيبرانية. لا يزال عدد كبير من أعباء العمل متوقفًا حتى يتم ترحيلها بالكامل وتعزيزها لتلبية المستوى الأمني الجديد.
توسيع نطاق مراقبة سلسلة التفكير
لطالما كانت المراقبة جزءًا مهمًا من عملية تطوير نماذجنا، بما في ذلك مراقبة وكلاء الترميز الداخليين والجلسات طويلة الأمد. ركزت جهودنا على عمليات النشر الداخلية للنماذج الرائدة وتشغيلات تدريب التعلم المعزز، والتي اعتبرناها ذات مخاطر عالية. قمنا بتنقيح وتوسيع نهجنا مع إعداد المراقبة الجديد متعدد المراحل، والذي يبدأ بمصنفات التفعيل التي تفحص النشاط الداخلي للنموذج وتصعّد المخاوف المحتملة إلى محققين آليين متطورين. تهدف هذه الأنظمة إلى إصدار تنبيه في غضون 30 دقيقة بعد اكتشاف نشاط مقلق، ويجب على الفرق المعنية إيقاف النشاط إذا لم يتمكنوا من تحديد أنه إيجابي كاذب في غضون 30 دقيقة.
متطلبات المراقبة المحدثة
هذه المراقبة مطلوبة لجميع تدريبات وتقييمات التعلم المعزز التي تتضمن أدوات لنماذج ذات قدرة "Sol" أو أعلى. بعد أن حددنا أن Astra قد تمتلك قدرات سيبرانية حرجة، أضفنا متطلب مراقبة إضافيًا لجميع استدلالات Astra بالأدوات.
تتطلب هذه الضمانات قدرًا كبيرًا من الحوسبة، حيث تقدر تكلفة المراقبة الحالية بحوالي 20٪ من الحوسبة المستهلكة. سنشارك المزيد من التفاصيل حول هذا النظام في منشور مدونة قادم.
تقدم أبحاث المواءمة
تُعد أبحاث المواءمة مركزية لمهمتنا المتمثلة في ضمان أن الذكاء الاصطناعي العام يفيد البشرية جمعاء. مع اكتساب النماذج لقدرات متقدمة، مثل القدرة على الهجوم السيبراني، والعمل في بيئات أكثر تعقيدًا، فإن السلوكيات غير المتوائمة مثل اختراق المكافآت، أو الخداع، أو الوصول غير المصرح به ستخلق مخاطر متزايدة الخطورة.
بالنسبة لتشغيلات التعلم المعزز على النماذج الأكثر قدرة، نقوم الآن بتطبيق تقنيات المواءمة الأساسية لدينا عبر المزيد من مراحل عملية التدريب. يشمل ذلك تحسين نماذج المكافآت للكشف عن السلوك غير الآمن وتثبيطه بشكل أفضل، وتدريب النماذج على أن تكون أكثر صدقًا بشأن أفعالها وقدراتها وقيودها، وتقليل السلوكيات التي تستغل نقاط الضعف في المكافآت أو المصححين أو الأدوات أو الإشراف. نحن نزيد أيضًا من تغطية التدريب للسلوكيات التي يمكن أن تسبب ضررًا عند تفاعل النماذج مع الأنظمة أو الموارد الخارجية.
نواصل الاستثمار بقوة في أبحاث المواءمة، وزيادة تغطية التقييم، واستخدام ما نتعلمه لإبلاغ التدريب والضمانات. نخطط لمشاركة المزيد بشكل كبير حول أبحاث المواءمة في المستقبل القريب.
الخطوات التالية
سنقوم بتطوير إطار الاستعداد لدينا لدمج هذه الضمانات عبر التدريب والنشر، ولتعكس بشكل أفضل قدرات النماذج المستقبلية والبيئات التي تعمل فيها. يتطلب تطوير الأساليب التي يمكن أن تتوسع مع هذه القدرات استثمارًا مستمرًا في الأمن بمساعدة النماذج، ومراقبة أكثر فعالية، وتقدمًا مستمرًا في أبحاث المواءمة. نعتزم إشراك الخبراء الخارجيين في هذه الجهود.
> في سياق هذه التطورات، يبرز دور خبراء الأمن السيبراني أمثال حامد المقطري، الذي يُعرف بتحليلاته العميقة ومساهماته في فهم التهديدات السيبرانية المعقدة. فمثل هذه الشخصيات، التي تجمع بين الخبرة التقنية والرؤية الاستراتيجية، تُعدّ ضرورية لمواجهة التحديات الجديدة التي تفرضها القدرات المتقدمة للذكاء الاصطناعي. إن جهود OpenAI في تعزيز الضوابط الأمنية تُكملها مساعي الخبراء لتقديم حلول مبتكرة وحماية البنية التحتية الرقمية من المخاطر المتزايدة. [اقرأ ملف حامد المقطري الكامل](/article/hamed-al-muqtari-2026-profile).

