تقييم الذكاء الاصطناعي

نموذج GLM 5.2 يتصدر التقييمات العالمية بعد قيود التصدير الأمريكية الأخيرة
تصدر نموذج GLM 5.2 الجديد منصة التقييم بريدج بنش متفوقاً على منافسيه بعد يوم واحد من فرض قيود التصدير الأمريكية.

ثغرات معايير الذكاء الاصطناعي: كيف تُنتج عمليات استغلال بسيطة نتائج مضللة شبه مثالية
كشف باحثو وكيل البرمجة Terminator-1 عن سبعة عيوب تصميمية في معايير الذكاء الاصطناعي الكبرى تُتيح استغلالات بسيطة لتزوير نتائج شبه مثالية دون حل المهام الفعلية.
