تخطي إلى المحتوى

Gemini 3.5 Transcribe: تحويل الكلام إلى نص

Darius Z. بقلم Darius Z. 8 دقائق للقراءة
هاتف ذكي على مكتب بودكاست يعرض موجة صوتية متوهجة، يوضح إطلاق Gemini 3.5 Transcribe

يحتوي على روابط تابعة

أضافت جوجل إلى عائلة Gemini (جيميناي) نموذج Gemini 3.5 Transcribe، وتصفه بأنه أدقّ ما أصدرته حتى الآن في تحويل الكلام إلى نص، وهو توصيف تؤكده اختبارات مستقلة أيضاً. دخل النموذج مرحلة المعاينة العامة في 26 أغسطس 2026 على هيئة واجهتي برمجة تطبيقات منفصلتين: خيار للبث الفوري في التطبيقات الصوتية الحية، وخيار آخر للصوت المُسجَّل مسبقاً يضيف تمييز المتحدثين وطوابع زمنية على مستوى الكلمة، وهي الصيغة التي تحتاجها أعمال التفريغ الصوتي لتسجيلات البودكاست والاجتماعات والمقابلات.

يقوم النموذج الجديد على وضع نسخ ذكي يلتقط التصحيحات التي يجريها المتحدث في منتصف الجملة، ويحذف كلمات الحشو، وينسّق النص تلقائياً، إلى جانب وضع النسخ الحرفي التقليدي الذي تعتمده معظم أدوات تحويل الكلام إلى نص كخيار افتراضي. وسجّلت اختبارات مستقلة أجرتها Artificial Analysis نسبة خطأ في الكلمات بلغت 2.6% للصوت المُسجَّل مسبقاً و4.0% للبث المباشر، إلى جانب اختصار زمن الوصول إلى النص النهائي بنسبة 70% مقارنة بـ Chirp 3، النموذج الذي يحل محله. وقد وصل الطرح بالفعل إلى Gboard وGoogle Antigravity وAI Studio وتطبيق Gemini على macOS.

النقاط الرئيسية

  • دخل Gemini 3.5 Transcribe مرحلة المعاينة العامة في 26 أغسطس 2026، مقسوماً إلى واجهة Live API للبث الفوري وواجهة Interactions API للصوت المُسجَّل مسبقاً مع تمييز المتحدثين وطوابع زمنية على مستوى الكلمة
  • تبلغ نسبة الخطأ في الكلمات 2.6% للصوت المُسجَّل مسبقاً و4.0% للبث المباشر وفق Artificial Analysis، مع وصول أسرع بنسبة 70% إلى النص النهائي مقارنة بـ Chirp 3، النموذج الذي يحل محله
  • وضع النسخ الذكي يحذف كلمات الحشو ويعالج التصحيحات الذاتية وينسّق النص تلقائياً، إلى جانب الوضع الحرفي الافتراضي ودعم مفردات مخصصة
  • يغطي النموذج أكثر من 85 لغة مع اكتشاف تلقائي، ويتعامل مع اللكنات الإقليمية، ويمكنه التبديل بين اللغات في منتصف البث
  • يشغّل النموذج بالفعل ميزة Rambler في Gboard وGoogle Antigravity ووضع Build في AI Studio وتطبيق Gemini على macOS، مع وصول دعم Chrome قريباً

ذكاء صوتي ونسخ في خطة ElevenLabs واحدة

تجمع ElevenLabs بالفعل بين تحويل نص إلى كلام بجودة إنتاجية واستنساخ صوتي ودبلجة ونموذج Scribe الخاص بها للنسخ، كلها في مساحة عمل واحدة متاحة اليوم لا في مرحلة معاينة.

جرّب ElevenLabs مجاناً ←

بث فوري أم تسجيل مسبق: داخل Gemini Transcribe

ينقسم Gemini 3.5 Transcribe إلى واجهتي برمجة تطبيقات مصممتين لمهمتين مختلفتين. واجهة Live API، المعروفة باسم gemini-3.5-transcribe-live، تبث الصوت باستمرار في الاتجاهين وتُعيد النص بزمن استجابة أقل من ثانية، وهي مخصصة للوكلاء الصوتيين والتطبيقات التي لا تستطيع الانتظار حتى يتوقف المتحدث عن الكلام. أما واجهة Interactions API، المعروفة باسم gemini-3.5-transcribe، فتعالج الصوت المُسجَّل مسبقاً وتضيف تمييز المتحدثين مع طوابع زمنية على مستوى الكلمة، وهي الصيغة التي يحتاجها محررو البودكاست ومعدّو محاضر الاجتماعات.

وتتشارك الواجهتان السلوك نفسه في التعامل مع الكلام الحقيقي غير المرتب. الوضع الافتراضي، الحرفي، ينسخ ما قيل بالضبط، بما في ذلك كلمات الحشو. أما الوضع الذكي المنفصل فيعالج نوع التصحيح الذاتي الذي يظهر في الحديث العادي، كأن يقول أحدهم «لنلتقِ الثلاثاء، لا، الأربعاء»، ويحذف أصوات التردد مثل «امم» و«آه»، وينسّق النتيجة بدلاً من تركها كتلة نصية متصلة بلا فواصل.

المفردات المخصصة مدعومة أيضاً. زوّد النموذج مسبقاً بالمصطلحات المتخصصة أو أسماء المنتجات أو الأسماء غير المألوفة، وسيتكيف معها بدلاً من التخمين. كما يمكن لواجهة Interactions API تمييز كل متحدث على حدة ووضع طابع زمني له.

معلومات: أكثر من ثلاثة متحدثين

يبقى تمييز المتحدثين موثوقاً حتى ثلاثة أشخاص في التسجيل نفسه. أما دعم أربعة متحدثين أو أكثر فتصنّفه جوجل كميزة تجريبية، لذا قد تحتاج التسجيلات الجماعية الكبيرة وحلقات النقاش إلى تنقيح يدوي.

ما مدى دقة Gemini 3.5 Transcribe؟

تؤكد الاختبارات المستقلة ما تقوله جوجل عن الدقة. قاست Artificial Analysis نسبة خطأ في الكلمات بلغت 2.6% للصوت المُسجَّل مسبقاً عبر واجهة Interactions API و4.0% للبث المباشر عبر واجهة Live API، مع أداء جيد للنموذج في البيئات الصاخبة ودقة في التقاط السلاسل الأبجدية الرقمية مثل الرموز البريدية وأرقام الطلبات.

وعلى معيار FLEURS متعدد اللغات، الذي يختبر الدقة عبر مجموعة واسعة من اللغات، سجّل النموذج نسبة خطأ في الكلمات بلغت 5.04% للصوت غير المُبثّ و5.50% للبث المباشر.

2.6% نسبة الخطأ في الكلمات، الصوت المُسجَّل مسبقاً
4.0% نسبة الخطأ في الكلمات، البث المباشر
70% أسرع في الوصول إلى النص النهائي مقابل Chirp 3
85+ لغة مدعومة

Chirp 3، نموذج النسخ السابق لدى جوجل، هو الأساس الذي قِيست عليه نسبة تحسّن السرعة البالغة 70%. تقول جوجل إن النموذج الأحدث يضيف قدرات جديدة إلى جانب نسبة خطأ أقل في الكلمات، لكن الفرق العملي الأوضح هو السرعة: سجّلت Artificial Analysis تحسناً بنسبة 70% في زمن الوصول إلى النص النهائي مقارنة بـ Chirp 3، وهو ما يظهر أثره الأكبر في الاستخدامات الفورية لواجهة Live API، حيث يُلمَس أي تأخير في الحال.

أين يمكنك استخدام Gemini 3.5 Transcribe اليوم؟

التوفر ينقسم حسب الفئة المستهدفة. يمكن للمطورين اختبار Gemini 3.5 Transcribe الآن عبر واجهة Gemini API في Google AI Studio وداخل Google Antigravity. أما المؤسسات فتحصل عليه في معاينة عامة عبر Gemini Enterprise Agent Platform، بينما لا يزال Gemini Enterprise for Customer Experience مدرجاً ضمن الخطط القادمة قريباً. وعلى مستوى المستخدم العادي، يعمل النموذج بالفعل داخل أربعة منتجات:

Rambler في Gboard

ميزة في لوحة مفاتيح Android، متاحة في بلدان ولغات مختارة، تحوّل الكلام المرسل وغير المرتب إلى نص منسّق بوضوح، مع إمكانية التعديل الصوتي على ما سبق نسخه

Google Antigravity

يستخدم سياق الشاشة، وسجلّ المحادثة بإذن المستخدم، لتحسين الدقة في تفاصيل مثل أسماء الملفات

وضع Build في AI Studio

برمجة بالصوت، حيث تُملي تعديلات المشروع بدل كتابتها

تطبيق Gemini على macOS

يدعم الإنجليزية فقط حالياً، مع أوامر صوتية تقرأ سياق الشاشة لتلخيص الملفات المحلية أو توليد صورة عند موضع المؤشر

دعم Chrome قادم قريباً، ليتيح التحدث بدل الكتابة في أي نموذج ويب أو حقل نصي. وعلى macOS، يمكن للنموذج أيضاً تمرير مهمة إلى نموذج Gemini آخر عبر استدعاء الدوال: فطلب توليد صورة أو تحليل ملف في منتصف المحادثة يوجَّه تلقائياً، مع بقاء Gemini 3.5 Transcribe كواجهة وسيطة لا منفذاً للمهمة بنفسه.

وعلى أرض الواقع، تتقاطع الاستخدامات العملية مع أدوات موجودة أصلاً في يوميات صانع المحتوى: تفريغ تسجيل بودكاست خام إلى نص قابل للبحث، كتابة مسودة ترجمة قبل تصدير الفيديو، إملاء نص أولي بدل كتابته، أو تمرير نص نظيف إلى إحدى أفضل أدوات تحويل النص إلى كلام بالذكاء الاصطناعي لإنتاج تعليق صوتي مدبلج بلغة أخرى. منصات المطورين، بما فيها Agora وFishjam وLangChain وLiveKit وPipecat وVercel وVision Agents، تدعمه بالفعل، وذكر مستخدمون أوائل مثل Vivo وIntellitek Health وLingopal زمن الاستجابة والدقة وتغطية اللغات في ملاحظات نشرتها جوجل عند الإطلاق.

رهان جوجل: النسخ كبنية تحتية

لم تمنح جوجل إطلاق 26 أغسطس صفحة منتج مستقلة أو قائمة أسعار. بل طرحته كطبقة داخل أدوات يستخدمها الناس بالفعل: لوحة مفاتيح، أداة برمجة، مساعد مدمج في نظام تشغيل. وهو خطاب يختلف عمّا تقدّمه منصات الذكاء الاصطناعي الصوتي المتخصصة.

ElevenLabs بنت عملها بالاتجاه المعاكس، كمنصة يكون فيها النسخ ميزة واحدة من عدة ميزات بدلاً من أداة خلفية مدمجة داخل تطبيقات أخرى. نموذجها الخاص لتحويل الكلام إلى نص، Scribe، يعمل داخل مساحة عمل تتولى أيضاً تحويل النص إلى كلام واستنساخ الصوت والدبلجة، موجهة لمن يريد أداة واحدة مبنية خصيصاً لإنتاج الصوت. فالمطور الذي يركّب وكيلاً صوتياً يحتاج شيئاً مختلفاً عمّا يحتاجه محرر فيديو يريد واجهة جاهزة فقط، لا واجهة برمجية عليه تعلّمها.

ما يغيّره Gemini 3.5 Transcribe هو خط الأساس. عندما يصل نموذج بهذه الدقة مجاناً إلى تطبيق لوحة مفاتيح، يتوقف النسخ الجيد عن كونه خدمة يدفع صانعو المحتوى مقابلها اشتراكاً منفصلاً بشكل تلقائي، وتحتاج المنصات المتنافسة على تلك الميزانية سبباً أوضح من الدقة وحدها. تحركت جوجل بسرعة في ميزات Gemini هذا الربع، من مفتاح للتحكم بالعلامة المائية للوسائط المولّدة بالذكاء الاصطناعي إلى إطلاق النسخ هذا. النمط نفسه في الحالتين: قدرة تُدمج كبنية تحتية، لا تُباع كمنتج قائم بذاته. يستحق الأمر المتابعة إلى جانب خلاصة أخبار الذكاء الاصطناعي لدينا.

اربط نصوصك المكتوبة بدبلجة ElevenLabs

النص النظيف هو الخطوة الأولى في مسار الدبلجة. تحوّل ElevenLabs ذلك النص إلى تعليقات صوتية بعشرات اللغات، مع استنساخ صوتي يحافظ على نبرة المتحدث الأصلي كما هي.

ابدأ الدبلجة مع ElevenLabs ←

الأسئلة الشائعة

هل Gemini 3.5 Transcribe مجاني؟

لم تنشر جوجل أسعار مرحلة المعاينة العامة لـ Gemini 3.5 Transcribe. يمكن للمطورين اختباره الآن عبر واجهة Gemini API في Google AI Studio وGoogle Antigravity، بينما لا يحمل الوصول الاستهلاكي عبر تطبيق Gemini على macOS وRambler في Gboard أي رسوم منفصلة. مع ذلك، لم يذكر الإعلان أي أسعار لواجهة برمجة التطبيقات خلال فترة المعاينة.

ما مدى دقة Gemini 3.5 Transcribe؟

يسجّل Gemini 3.5 Transcribe نسبة خطأ في الكلمات بلغت 2.6% للصوت المُسجَّل مسبقاً و4.0% لصوت البث المباشر، وفق معايير مستقلة من Artificial Analysis. وعلى معيار FLEURS متعدد اللغات عبر أبرز اللغات، تبلغ نسبة الخطأ في الكلمات 5.04% للصوت غير المُبثّ و5.50% للبث المباشر، وتقول جوجل إن النموذج يحافظ على أدائه في البيئات الصاخبة ويلتقط بدقة السلاسل الأبجدية الرقمية مثل الرموز البريدية وأرقام الطلبات.

كم عدد اللغات التي يدعمها Gemini 3.5 Transcribe؟

يدعم Gemini 3.5 Transcribe أكثر من 85 لغة مع اكتشاف تلقائي للغة مدمج فيه. كما يتعامل النموذج مع اللكنات الإقليمية ويمكنه التبديل بين اللغات في منتصف البث أثناء محادثة مباشرة دون الحاجة لإخباره مسبقاً باللغة القادمة.

هل يدعم Gemini 3.5 Transcribe اللغة العربية؟

نعم، العربية ضمن أكثر من 85 لغة يغطيها Gemini 3.5 Transcribe، مع اكتشاف تلقائي للغة يعمل دون الحاجة لتحديدها يدوياً. المصادر المتاحة عند الإطلاق لا تُفصّل مستوى الدقة لكل لهجة عربية على حدة، لكن النموذج مصمم للتعامل مع اللكنات الإقليمية ضمن اللغات التي يدعمها، وهو ما يجعله قابلاً للاستخدام في تطبيقات مثل Rambler على Gboard لمستخدمي المنطقة.

ما هو Rambler في Gboard؟

Rambler ميزة في Gboard لنظام Android تستخدم Gemini 3.5 Transcribe لتحويل الكلام المرسل وغير المرتب إلى نص منسّق بوضوح. صُممت للإملاء الذي لا يخرج كجملة مرتبة من المحاولة الأولى، وتدعم التعديل الصوتي على نص سبق نسخه بدلاً من إعادة كتابته يدوياً.

ما الفرق بين Gemini 3.5 Transcribe وChirp 3؟

يحل Gemini 3.5 Transcribe محل Chirp 3 كنموذج النسخ لدى جوجل، بقدرات جديدة ونسبة خطأ أقل في الكلمات وأوقات استجابة أسرع بشكل ملموس. سجّلت Artificial Analysis تحسناً بنسبة 70% في زمن الوصول إلى النص النهائي مقارنة بـ Chirp 3، إلى جانب ميزات النسخ الذكي مثل حذف كلمات الحشو ومعالجة التصحيح الذاتي التي لم يكن Chirp 3 يقدمها.

هل أستخدم Gemini 3.5 Transcribe أم منصة نسخ متخصصة؟

يناسب Gemini 3.5 Transcribe من يعمل بالفعل داخل أدوات جوجل والمطورين الذين يدمجون واجهته البرمجية في تطبيقاتهم الخاصة، لأن النسخ يأتي مدمجاً مع أدوات مثل Gboard وAntigravity وAI Studio. أما المنصة المتخصصة فتناسب أكثر العمل الإنتاجي على الصوت: تجمع ElevenLabs بين نموذجها الخاص للنسخ، Scribe، وتحويل النص إلى كلام واستنساخ الصوت والدبلجة في مساحة عمل واحدة، مبنية لفرق يكون مخرجها صوتاً نهائياً جاهزاً لا نصاً خاماً فقط.


المصادر

  1. Google: Gemini 3.5 Transcribe - Google، 26 أغسطس 2026
  2. 9to5Google: Gemini 3.5 Transcribe - 9to5Google، 26 أغسطس 2026
  3. Business Today: Google launches Gemini 3.5 Transcribe with smarter speech-to-text and 85 language support - Business Today، 27 أغسطس 2026
  4. Google AI for Developers: Transcribe audio - توثيق Google AI

هل كانت هذه المقالة مفيدة؟

0:00