أطلقت OpenAI نماذج الصوت الفورية – ثلاثة نماذج مصممة لتمكين المطورين من بناء تطبيقات صوتية بقدرات التفكير والترجمة والنسخ الفوري. تمثل النماذج الجديدة، التي صدرت في 7 مايو 2026، توسعاً في عروض الواجهة البرمجية لإنشاء تجارب صوتية تستجيب بذكاء وتعمل في الوقت الفعلي.
تتضمن النماذج الثلاثة GPT-Realtime-2 الذي يجمع بين التفاعل الصوتي والقدرات المنطقية المماثلة لنماذج GPT-5. يوفر GPT-Realtime-Translate ترجمة فورية عبر 70 لغة إدخال و13 لغة إخراج. يوفر GPT-Realtime-Whisper نسخاً صوتياً فورياً منخفض الكمون.
GPT-Realtime-2: الصوت مع القدرة على التفكير
يعالج GPT-Realtime-2 محادثات صوتية أثناء التفكير من خلال الطلبات واستدعاء الأدوات والتعامل مع المقاطعات. يدعم النموذج نوافذ السياق بحجم 128 ألف رمز، ارتفاعاً من 32 ألف في الإصدارات السابقة. يمكن للمطورين تعديل مستوى التفكير عبر خمسة مستويات: أدنى وضعيف ومتوسط وعالي وعالي جداً. أظهرت تقييمات الأداء أن GPT-Realtime-2 سجل نتائج أعلى بنسبة 15.2 في المئة على Big Bench Audio لذكاء الصوت مقارنة بـ GPT-Realtime-1.5، وأعلى بنسبة 13.8 في المئة على Audio MultiChallenge لاتباع التعليمات.
يتضمن النموذج ميزات للتفاعلات الأكثر طبيعية. تتيح الديباجات للمطورين إضافة عبارات قصيرة مثل “دعني أتحقق من ذلك” قبل الردود الرئيسية. تمكن استدعاءات الأدوات المتوازية النموذج من تنفيذ إجراءات متعددة في نفس الوقت أثناء الإعلان عنها للمستخدمين. يسمح السلوك الأقوى للاسترجاع بالتعامل الرشيق مع الأخطاء والمقاطعات.
الترجمة الفورية عبر اللغات
يمكّن GPT-Realtime-Translate المطورين من بناء تطبيقات يتحدث فيها المستخدمون باللغة المفضلة لهم بينما يتلقون ترجمات فورية. يتعامل النموذج مع 70 لغة إدخال ويترجم إلى 13 لغة إخراج. أظهرت الاختبارات التي أجرتها BolnaAI عبر اللغات الهندية والتاميلية والتيلوجو معدل خطأ كلام أقل بنسبة 12.5 في المئة مقارنة بالنماذج الأخرى المختبرة، إلى جانب معدلات احتياطية أقل وكمون محادثة طبيعي.
النسخ الفوري منخفض الكمون
يوفر GPT-Realtime-Whisper نسخاً صوتياً فورياً مصمم لتحقيق نسخ منخفض الكمون. ينسخ النموذج الصوت أثناء التحدث، مما يتيح التسميات التوضيحية المباشرة وملاحظات الاجتماعات وعملاء الصوت الذين يفهمون المستخدمين بشكل مستمر. تدعم قدرة النسخ سير العمل التجاري في دعم العملاء والرعاية الصحية والمبيعات والتوظيف والتفاعلات الصوتية الأخرى ذات الحجم الكبير.
حالات الاستخدام والشركاء
تبني Zillow مساعداً صوتياً باستخدام GPT-Realtime-2 للتعامل مع طلبات العقارات، والاستماع والتفكير من خلال استفسارات معقدة مثل العثور على منازل ضمن قيود الميزانية مع تجنب مواقع محددة وجدولة الجولات. أفادت الشركة بارتفاع بمعدل 26 نقطة في معدل نجاح المكالمة على معايير الخصومة بعد تحسين الإشارات، وصولاً إلى معدل نجاح بنسبة 95 في المئة مقابل 69 في المئة سابقاً.
تختبر Deutsche Telekom نموذج GPT-Realtime-Translate لدعم العملاء متعدد اللغات حيث يمكن للوكلاء والعملاء التحدث باللغة المفضلة لهم. تطور Priceline واجهات صوتية لإدارة السفر، مما يتيح للمستخدمين البحث عن الرحلات والفنادق بشكل محادثي والتعامل مع تغييرات الحجوزات والحصول على تحديثات فورية حول ظروف المطار.
التسعير والسلامة
يتم تسعير GPT-Realtime-2 بـ 32 دولار لكل مليون رمز صوتي مدخل مع 0.40 دولار لكل مليون رمز مُخزَّن مؤقتاً، و64 دولار لكل مليون رمز صوتي مُخرج. يكلف GPT-Realtime-Translate 0.034 دولار في الدقيقة. يكلف GPT-Realtime-Whisper 0.017 دولار في الدقيقة. تتضمن واجهة Realtime API مصنّفات أمان يمكنها إيقاف المحادثات التي تنتهك إرشادات المحتوى. يمكن للمطورين إضافة حماية أمان مخصصة باستخدام Agents SDK. تدعم واجهة برمجية التطبيقات متطلبات الأمن السيبراني بما في ذلك إقامة البيانات في الاتحاد الأوروبي للتطبيقات الأوروبية.
يمكن للمطورين اختبار النماذج في الملعب أو استخدام Codex لدمج GPT-Realtime-2 في التطبيقات الموجودة. تمثل نماذج الصوت الفورية الجديدة تحولاً من مكالمات الصوت البسيطة والرد نحو واجهات صوتية قادرة على الاستماع والتفكير والترجمة والنسخ واتخاذ الإجراءات طوال المحادثة.
المصدر: OpenAI




