مراجعة ElevenCreative 2026
يمنحك ElevenCreative 10,000 رصيد مجاني شهرياً، ثم من $6 إلى $99. مراجعة لـ Studio وFlows وMusic v2 وDubbing v2، وأين تكمن مشكلة استهلاك الأرصدة.
اقرأ المقال →
أضافت جوجل إلى عائلة Gemini (جيميناي) نموذج Gemini 3.5 Transcribe، وتصفه بأنه أدقّ ما أصدرته حتى الآن في تحويل الكلام إلى نص، وهو توصيف تؤكده اختبارات مستقلة أيضاً. دخل النموذج مرحلة المعاينة العامة في 26 أغسطس 2026 على هيئة واجهتي برمجة تطبيقات منفصلتين: خيار للبث الفوري في التطبيقات الصوتية الحية، وخيار آخر للصوت المُسجَّل مسبقاً يضيف تمييز المتحدثين وطوابع زمنية على مستوى الكلمة، وهي الصيغة التي تحتاجها أعمال التفريغ الصوتي لتسجيلات البودكاست والاجتماعات والمقابلات.
يقوم النموذج الجديد على وضع نسخ ذكي يلتقط التصحيحات التي يجريها المتحدث في منتصف الجملة، ويحذف كلمات الحشو، وينسّق النص تلقائياً، إلى جانب وضع النسخ الحرفي التقليدي الذي تعتمده معظم أدوات تحويل الكلام إلى نص كخيار افتراضي. وسجّلت اختبارات مستقلة أجرتها Artificial Analysis نسبة خطأ في الكلمات بلغت 2.6% للصوت المُسجَّل مسبقاً و4.0% للبث المباشر، إلى جانب اختصار زمن الوصول إلى النص النهائي بنسبة 70% مقارنة بـ Chirp 3، النموذج الذي يحل محله. وقد وصل الطرح بالفعل إلى Gboard وGoogle Antigravity وAI Studio وتطبيق Gemini على macOS.
تجمع ElevenLabs بالفعل بين تحويل نص إلى كلام بجودة إنتاجية واستنساخ صوتي ودبلجة ونموذج Scribe الخاص بها للنسخ، كلها في مساحة عمل واحدة متاحة اليوم لا في مرحلة معاينة.
جرّب ElevenLabs مجاناً ←ينقسم Gemini 3.5 Transcribe إلى واجهتي برمجة تطبيقات مصممتين لمهمتين مختلفتين. واجهة Live API، المعروفة باسم gemini-3.5-transcribe-live، تبث الصوت باستمرار في الاتجاهين وتُعيد النص بزمن استجابة أقل من ثانية، وهي مخصصة للوكلاء الصوتيين والتطبيقات التي لا تستطيع الانتظار حتى يتوقف المتحدث عن الكلام. أما واجهة Interactions API، المعروفة باسم gemini-3.5-transcribe، فتعالج الصوت المُسجَّل مسبقاً وتضيف تمييز المتحدثين مع طوابع زمنية على مستوى الكلمة، وهي الصيغة التي يحتاجها محررو البودكاست ومعدّو محاضر الاجتماعات.
وتتشارك الواجهتان السلوك نفسه في التعامل مع الكلام الحقيقي غير المرتب. الوضع الافتراضي، الحرفي، ينسخ ما قيل بالضبط، بما في ذلك كلمات الحشو. أما الوضع الذكي المنفصل فيعالج نوع التصحيح الذاتي الذي يظهر في الحديث العادي، كأن يقول أحدهم «لنلتقِ الثلاثاء، لا، الأربعاء»، ويحذف أصوات التردد مثل «امم» و«آه»، وينسّق النتيجة بدلاً من تركها كتلة نصية متصلة بلا فواصل.
المفردات المخصصة مدعومة أيضاً. زوّد النموذج مسبقاً بالمصطلحات المتخصصة أو أسماء المنتجات أو الأسماء غير المألوفة، وسيتكيف معها بدلاً من التخمين. كما يمكن لواجهة Interactions API تمييز كل متحدث على حدة ووضع طابع زمني له.
يبقى تمييز المتحدثين موثوقاً حتى ثلاثة أشخاص في التسجيل نفسه. أما دعم أربعة متحدثين أو أكثر فتصنّفه جوجل كميزة تجريبية، لذا قد تحتاج التسجيلات الجماعية الكبيرة وحلقات النقاش إلى تنقيح يدوي.
تؤكد الاختبارات المستقلة ما تقوله جوجل عن الدقة. قاست Artificial Analysis نسبة خطأ في الكلمات بلغت 2.6% للصوت المُسجَّل مسبقاً عبر واجهة Interactions API و4.0% للبث المباشر عبر واجهة Live API، مع أداء جيد للنموذج في البيئات الصاخبة ودقة في التقاط السلاسل الأبجدية الرقمية مثل الرموز البريدية وأرقام الطلبات.
وعلى معيار FLEURS متعدد اللغات، الذي يختبر الدقة عبر مجموعة واسعة من اللغات، سجّل النموذج نسبة خطأ في الكلمات بلغت 5.04% للصوت غير المُبثّ و5.50% للبث المباشر.
Chirp 3، نموذج النسخ السابق لدى جوجل، هو الأساس الذي قِيست عليه نسبة تحسّن السرعة البالغة 70%. تقول جوجل إن النموذج الأحدث يضيف قدرات جديدة إلى جانب نسبة خطأ أقل في الكلمات، لكن الفرق العملي الأوضح هو السرعة: سجّلت Artificial Analysis تحسناً بنسبة 70% في زمن الوصول إلى النص النهائي مقارنة بـ Chirp 3، وهو ما يظهر أثره الأكبر في الاستخدامات الفورية لواجهة Live API، حيث يُلمَس أي تأخير في الحال.
التوفر ينقسم حسب الفئة المستهدفة. يمكن للمطورين اختبار Gemini 3.5 Transcribe الآن عبر واجهة Gemini API في Google AI Studio وداخل Google Antigravity. أما المؤسسات فتحصل عليه في معاينة عامة عبر Gemini Enterprise Agent Platform، بينما لا يزال Gemini Enterprise for Customer Experience مدرجاً ضمن الخطط القادمة قريباً. وعلى مستوى المستخدم العادي، يعمل النموذج بالفعل داخل أربعة منتجات:
ميزة في لوحة مفاتيح Android، متاحة في بلدان ولغات مختارة، تحوّل الكلام المرسل وغير المرتب إلى نص منسّق بوضوح، مع إمكانية التعديل الصوتي على ما سبق نسخه
يستخدم سياق الشاشة، وسجلّ المحادثة بإذن المستخدم، لتحسين الدقة في تفاصيل مثل أسماء الملفات
برمجة بالصوت، حيث تُملي تعديلات المشروع بدل كتابتها
يدعم الإنجليزية فقط حالياً، مع أوامر صوتية تقرأ سياق الشاشة لتلخيص الملفات المحلية أو توليد صورة عند موضع المؤشر
دعم Chrome قادم قريباً، ليتيح التحدث بدل الكتابة في أي نموذج ويب أو حقل نصي. وعلى macOS، يمكن للنموذج أيضاً تمرير مهمة إلى نموذج Gemini آخر عبر استدعاء الدوال: فطلب توليد صورة أو تحليل ملف في منتصف المحادثة يوجَّه تلقائياً، مع بقاء Gemini 3.5 Transcribe كواجهة وسيطة لا منفذاً للمهمة بنفسه.
وعلى أرض الواقع، تتقاطع الاستخدامات العملية مع أدوات موجودة أصلاً في يوميات صانع المحتوى: تفريغ تسجيل بودكاست خام إلى نص قابل للبحث، كتابة مسودة ترجمة قبل تصدير الفيديو، إملاء نص أولي بدل كتابته، أو تمرير نص نظيف إلى إحدى أفضل أدوات تحويل النص إلى كلام بالذكاء الاصطناعي لإنتاج تعليق صوتي مدبلج بلغة أخرى. منصات المطورين، بما فيها Agora وFishjam وLangChain وLiveKit وPipecat وVercel وVision Agents، تدعمه بالفعل، وذكر مستخدمون أوائل مثل Vivo وIntellitek Health وLingopal زمن الاستجابة والدقة وتغطية اللغات في ملاحظات نشرتها جوجل عند الإطلاق.
لم تمنح جوجل إطلاق 26 أغسطس صفحة منتج مستقلة أو قائمة أسعار. بل طرحته كطبقة داخل أدوات يستخدمها الناس بالفعل: لوحة مفاتيح، أداة برمجة، مساعد مدمج في نظام تشغيل. وهو خطاب يختلف عمّا تقدّمه منصات الذكاء الاصطناعي الصوتي المتخصصة.
ElevenLabs بنت عملها بالاتجاه المعاكس، كمنصة يكون فيها النسخ ميزة واحدة من عدة ميزات بدلاً من أداة خلفية مدمجة داخل تطبيقات أخرى. نموذجها الخاص لتحويل الكلام إلى نص، Scribe، يعمل داخل مساحة عمل تتولى أيضاً تحويل النص إلى كلام واستنساخ الصوت والدبلجة، موجهة لمن يريد أداة واحدة مبنية خصيصاً لإنتاج الصوت. فالمطور الذي يركّب وكيلاً صوتياً يحتاج شيئاً مختلفاً عمّا يحتاجه محرر فيديو يريد واجهة جاهزة فقط، لا واجهة برمجية عليه تعلّمها.
ما يغيّره Gemini 3.5 Transcribe هو خط الأساس. عندما يصل نموذج بهذه الدقة مجاناً إلى تطبيق لوحة مفاتيح، يتوقف النسخ الجيد عن كونه خدمة يدفع صانعو المحتوى مقابلها اشتراكاً منفصلاً بشكل تلقائي، وتحتاج المنصات المتنافسة على تلك الميزانية سبباً أوضح من الدقة وحدها. تحركت جوجل بسرعة في ميزات Gemini هذا الربع، من مفتاح للتحكم بالعلامة المائية للوسائط المولّدة بالذكاء الاصطناعي إلى إطلاق النسخ هذا. النمط نفسه في الحالتين: قدرة تُدمج كبنية تحتية، لا تُباع كمنتج قائم بذاته. يستحق الأمر المتابعة إلى جانب خلاصة أخبار الذكاء الاصطناعي لدينا.
النص النظيف هو الخطوة الأولى في مسار الدبلجة. تحوّل ElevenLabs ذلك النص إلى تعليقات صوتية بعشرات اللغات، مع استنساخ صوتي يحافظ على نبرة المتحدث الأصلي كما هي.
ابدأ الدبلجة مع ElevenLabs ←لم تنشر جوجل أسعار مرحلة المعاينة العامة لـ Gemini 3.5 Transcribe. يمكن للمطورين اختباره الآن عبر واجهة Gemini API في Google AI Studio وGoogle Antigravity، بينما لا يحمل الوصول الاستهلاكي عبر تطبيق Gemini على macOS وRambler في Gboard أي رسوم منفصلة. مع ذلك، لم يذكر الإعلان أي أسعار لواجهة برمجة التطبيقات خلال فترة المعاينة.
يسجّل Gemini 3.5 Transcribe نسبة خطأ في الكلمات بلغت 2.6% للصوت المُسجَّل مسبقاً و4.0% لصوت البث المباشر، وفق معايير مستقلة من Artificial Analysis. وعلى معيار FLEURS متعدد اللغات عبر أبرز اللغات، تبلغ نسبة الخطأ في الكلمات 5.04% للصوت غير المُبثّ و5.50% للبث المباشر، وتقول جوجل إن النموذج يحافظ على أدائه في البيئات الصاخبة ويلتقط بدقة السلاسل الأبجدية الرقمية مثل الرموز البريدية وأرقام الطلبات.
يدعم Gemini 3.5 Transcribe أكثر من 85 لغة مع اكتشاف تلقائي للغة مدمج فيه. كما يتعامل النموذج مع اللكنات الإقليمية ويمكنه التبديل بين اللغات في منتصف البث أثناء محادثة مباشرة دون الحاجة لإخباره مسبقاً باللغة القادمة.
نعم، العربية ضمن أكثر من 85 لغة يغطيها Gemini 3.5 Transcribe، مع اكتشاف تلقائي للغة يعمل دون الحاجة لتحديدها يدوياً. المصادر المتاحة عند الإطلاق لا تُفصّل مستوى الدقة لكل لهجة عربية على حدة، لكن النموذج مصمم للتعامل مع اللكنات الإقليمية ضمن اللغات التي يدعمها، وهو ما يجعله قابلاً للاستخدام في تطبيقات مثل Rambler على Gboard لمستخدمي المنطقة.
Rambler ميزة في Gboard لنظام Android تستخدم Gemini 3.5 Transcribe لتحويل الكلام المرسل وغير المرتب إلى نص منسّق بوضوح. صُممت للإملاء الذي لا يخرج كجملة مرتبة من المحاولة الأولى، وتدعم التعديل الصوتي على نص سبق نسخه بدلاً من إعادة كتابته يدوياً.
يحل Gemini 3.5 Transcribe محل Chirp 3 كنموذج النسخ لدى جوجل، بقدرات جديدة ونسبة خطأ أقل في الكلمات وأوقات استجابة أسرع بشكل ملموس. سجّلت Artificial Analysis تحسناً بنسبة 70% في زمن الوصول إلى النص النهائي مقارنة بـ Chirp 3، إلى جانب ميزات النسخ الذكي مثل حذف كلمات الحشو ومعالجة التصحيح الذاتي التي لم يكن Chirp 3 يقدمها.
يناسب Gemini 3.5 Transcribe من يعمل بالفعل داخل أدوات جوجل والمطورين الذين يدمجون واجهته البرمجية في تطبيقاتهم الخاصة، لأن النسخ يأتي مدمجاً مع أدوات مثل Gboard وAntigravity وAI Studio. أما المنصة المتخصصة فتناسب أكثر العمل الإنتاجي على الصوت: تجمع ElevenLabs بين نموذجها الخاص للنسخ، Scribe، وتحويل النص إلى كلام واستنساخ الصوت والدبلجة في مساحة عمل واحدة، مبنية لفرق يكون مخرجها صوتاً نهائياً جاهزاً لا نصاً خاماً فقط.