أطلقت Google نموذجها الصوتي الجديد Gemini 3.1 Flash Live، الذي يُعدّ الأكثر تطوراً في مجال الذكاء الاصطناعي الصوتي في الوقت الفعلي حتى الآن، إذ يجمع بين السرعة العالية والدقة المحسّنة وانخفاض زمن الاستجابة لتقديم تجربة صوتية أكثر سلاسة وطبيعية للمطورين والمؤسسات والمستخدمين العاديين.

ما هو Gemini 3.1 Flash Live؟

يصف فريق Google هذا النموذج بأنه أعلى جودة في مجال الصوت والذكاء الاصطناعي الصوتي حتى الآن. وهو متاح للمطورين في مرحلة المعاينة عبر Gemini Live API في Google AI Studio، وللمؤسسات عبر Gemini Enterprise for Customer Experience، وللمستخدمين العاديين من خلال Gemini Live وSearch Live. يهدف النموذج إلى جعل التفاعلات الصوتية أكثر سلاسة وبديهية ودقة في مختلف السياقات.

أداء Gemini 3.1 Flash Live في المعايير القياسية

دعمت Google إطلاق Gemini 3.1 Flash Live بنتائج قياسية قوية. على معيار ComplexFuncBench Audio — الذي يختبر استدعاء الوظائف متعددة الخطوات مع قيود متنوعة — حقق النموذج أعلى نتيجة بنسبة 90.8%، متفوقاً على النماذج السابقة. كما حقق نسبة 36.1% على معيار Audio MultiChallenge من Scale AI مع تفعيل وضع “التفكير”، وهو معيار يختبر اتباع التعليمات المعقدة والتفكير طويل الأمد وسط المقاطعات والتردد النموذجي في المحادثات الواقعية.

Gemini 3.1 Flash Live رسم بياني لنتائج معيار ComplexFuncBench
نتائج معيار ComplexFuncBench Audio — Gemini 3.1 Flash Live يتصدر بنسبة 90.8%
Gemini 3.1 Flash Live رسم بياني لنتائج معيار AudioMultiChallenge
معيار Audio MultiChallenge — نسبة 36.1% مع تفعيل وضع التفكير

تبني المؤسسات: Verizon وThe Home Depot وغيرهما

أبدت شركات كبرى مثل Verizon وThe Home Depot وLiveKit ردود فعل إيجابية على Gemini 3.1 Flash Live بعد دمجه في سير عملها، مشيدةً بجودة المحادثة الطبيعية المحسّنة وقدرته على التعامل مع المهام المعقدة في البيئات الصاخبة. يتميز النموذج بفهم نبرة الصوت بشكل أعمق، مما يتيح له التعرف على الفروق الصوتية الدقيقة كالطبقة والإيقاع، والتكيف ديناميكياً مع تعبيرات الإحباط أو الارتباك لدى المستخدمين — وهي قدرة محورية لتطبيقات تجربة العملاء في المؤسسات.

Gemini Live أسرع وSearch Live يتوسع عالمياً

بالنسبة للمستخدمين العاديين، يجلب Gemini 3.1 Flash Live استجابات أسرع ملحوظاً في Gemini Live، كما يستطيع النموذج الآن متابعة خيط المحادثة لضعف المدة مقارنة بالإصدار السابق، مما يُبقي النقاشات الطويلة والعصف الذهني المعقد متماسكاً. فضلاً عن ذلك، يدعم النموذج تعدد اللغات بشكل أصيل، مما أتاح التوسع العالمي الكبير لـSearch Live هذا الأسبوع، ليتمكن المستخدمون في أكثر من 200 دولة ومنطقة من إجراء محادثات متعددة الوسائط في الوقت الفعلي مع بحث Google بلغتهم المفضلة.

الأمان: علامة SynthID المائية في كل مخرجات الصوت

يتم وضع علامة مائية على جميع الصوتيات التي يولدها Gemini 3.1 Flash Live باستخدام تقنية SynthID من Google DeepMind، وهي علامة مائية غير محسوسة تُنسج مباشرة في مخرجات الصوت، مما يتيح الكشف الموثوق عن المحتوى الذي يولده الذكاء الاصطناعي والمساعدة في منع انتشار المعلومات المضللة. كما نشرت Google بطاقة نموذج تفصيلية توضح نهجها في السلامة والمسؤولية لهذا الإصدار.

Gemini 3.1 Flash Live متاح اعتباراً من اليوم للمطورين عبر Google AI Studio، وللمؤسسات من خلال Gemini Enterprise for Customer Experience، وللمستخدمين عبر Gemini Live وSearch Live.