كشفت شركة MiniMax المتخصصة في تطوير تقنيات الذكاء الاصطناعي عن تفاصيل جديدة حول **نموذج MiniMax M3** المرتقب، والذي يقدم آلية انتباه متباعد لتسريع معالجة النصوص الطويلة. ونشرت الشركة تقريراً تقنياً مفصلاً حول سلسلة نماذج M2 السابقة مع استعراض التغييرات الهيكلية المخصصة للجيل القادم.

ووفقاً للتقرير التقني، يعتمد **نموذج MiniMax M3** على إطار عمل مخصص يسمى MiniMax Sparse Attention (MSA). وتوفر هذه البنية تسريعاً في سرعة فك التشفير بمقدار 15.6 ضعفاً، وتسريعاً في مرحلة المعالجة الأولية بمقدار 9.7 ضعفاً عند سياق يصل إلى مليون رمز تعبيري.

التطور التقني من M2 إلى M3

اعتمدت سلسلة M2 السابقة على بنية Mixture-of-Experts التي تضم 229.9 مليار معلمة إجمالية، مع تنشيط 9.8 مليار معلمة فقط لكل رمز. وخلال مرحلة التطوير، اختبر الفريق الهندسي طرقاً مختلفة لتقليل الحوسبة، لكنها أدت إلى تراجع قدرات الاستدلال. وتحديداً، انخفضت نتائج النماذج من 90.0 إلى 72.0 في مهام استخراج الكلمات المعقدة عند استخدام تقنيات الانتباه عبر النافذة المنزلقة.

ونتيجة لذلك، حافظ المطورون على آليات الانتباه الكاملة في سلسلة M2 لضمان دقة الاستدلال متعدد الخطوات. ومع ذلك، ولتسهيل تشغيل النماذج بتكلفة اقتصادية منخفضة، صممت الشركة **نموذج MiniMax M3** لتجاوز هذه العقبات التقنية دون التأثير على دقة النتائج.

بنية نموذج MiniMax M3 الجديدة

وخلافاً للنماذج الأخرى التي تضغط البيانات في مساحة كامنة منخفضة الأبعاد، يعمل نظام MSA الجديد على بنية Grouped Query Attention القياسية. ويستخدم النظام اختياراً على مستوى الكتل للقيم والمفاتيح غير المضغوطة لمنع فقدان الدقة. وتتيح هذه الطريقة معالجة المستندات الضخمة بسرعات عالية مع دعم تقنيات التخزين المؤقت بكفاءة عالية عبر التطبيقات والبرمجيات المختلفة.

تدريب الوكلاء وبنية Forge التحتية

ولتدريب هذه النماذج المعقدة، طورت الشركة نظام تعلم معزز يسمى Forge. وتقوم هذه البنية بتبسيط عمليات التشغيل عبر وحدات مستقلة تشمل خوادم البوابة ومحركات التدريب. وتستخدم البنية تقنية دمج شجرة البادئة لإلغاء العمليات الحسابية المكررة، مما يسرع عمليات التدريب بمقدار 40 ضعفاً.

وساهمت هذه البنية التحتية سابقاً في تطوير نموذج M2.7، الذي يعمل كمهندس تعلم آلي مستقل. ونجح هذا النموذج في إدارة ما بين 30% إلى 50% من سير عمل التطوير الخاص به تلقائياً. كما حقق معدل نجاح بلغ 66.6% في اختبارات تقييم البحوث المستقلة، متساوياً مع نماذج مغلقة المصدر في التجارب التي استمرت 24 ساعة.

مستقبل الذكاء الاصطناعي في قطاع الأعمال

يمثل الانتقال إلى إطار عمل الانتباه المتباعد خطوة هامة نحو تحسين كفاءة تشغيل النماذج في قطاع الاقتصاد والأعمال. ومن خلال تقليل المتطلبات الحسابية لمعالجة النصوص الطويلة، تسعى الشركة إلى توسيع الاستخدام العملي للوكلاء المستقلين في مختلف المجالات الرقمية.