تخطي إلى المحتوى

دليل استنساخ الصوت بالذكاء الاصطناعي مجانا

Darius Z. بقلم Darius Z. 12 دقائق للقراءة
توضيح لشخص يتحدث وصوته يتدفق إلى حاسوب محمول يعرض موجات صوتية مكررة لاستنساخ الصوت بالذكاء الاصطناعي

يحتوي على روابط تابعة

استنساخ صوتك بالذكاء الاصطناعي مجاناً ممكن فعلاً، وليس مجرد وعد تسويقي، ويستغرق دقائق معدودة باستخدام نماذج مفتوحة المصدر بدلاً من صفحات الشركات التي تصف نفسها بـ”مجانية” وهي ليست كذلك. يغطي هذا الدليل طريقتين مجانيتين فعلاً، Chatterbox وOpenVoice V2، إضافة إلى أرخص خيار مدفوع حقيقي: ElevenLabs (إليفن لابز) Starter بسعر $6/شهرياً.

معظم نتائج البحث عن “استنساخ الصوت المجاني بالذكاء الاصطناعي” هي في الواقع صفحات تسويقية لشركات. الأدوات التي تروّج لميزة الاستنساخ في صفحتها الرئيسية غالباً ما تحجب الميزة فعلياً خلف باقة مدفوعة بمجرد أن تحاول استخدامها. يلتزم هذا الدليل بما هو مجاني فعلاً وقابل للتحقق: نماذج مفتوحة المصدر تعمل على عروض Hugging Face الرسمية، دون تسجيل ودون بيانات بطاقة ائتمان.

النقاط الرئيسية

  • معظم صفحات "استنساخ الصوت المجاني بالذكاء الاصطناعي" هي صفحات تسويقية لشركات، وليست مجانية فعلاً عند محاولة استنساخ صوت حقيقي
  • توجد طريقتان مجانيتان فعلاً في أغسطس 2026: Chatterbox وOpenVoice V2، وكلاهما بترخيص MIT ويعملان على مساحات Hugging Face رسمية دون أي تثبيت
  • الباقة المجانية من ElevenLabs لا تتضمن استنساخ الصوت إطلاقاً؛ باقة Starter بـ $6/شهرياً هي الأرخص التي تفتح ميزة Instant Voice Cloning مع ترخيص تجاري
  • استنساخ صوتك الخاص أمر قانوني ومباشر؛ أما استنساخ صوت شخص آخر فيتطلب موافقته، وقانون ELVIS في ولاية تينيسي الأمريكية أصبح ينص على ذلك رسمياً
  • تتحسن الجودة مع طول التسجيل: نحو 5 ثوانٍ كافية للاستنساخ المقبول بلا تدريب مسبق (zero-shot)، ودقيقة إلى دقيقتين تعطيان استنساخاً فورياً جيداً، بينما تعطي 30 دقيقة إلى 3 ساعات نتائج بجودة احترافية
مبتدئ | عملي: 15-30 دقيقة

تجاوز أدوات «المجانية» الوهمية وجرّب ElevenLabs

الباقة المجانية من ElevenLabs لا تتضمن الاستنساخ إطلاقاً. باقة Starter تفتح Instant Voice Cloning وترخيصاً تجارياً مقابل $6/شهرياً.

جرّب استنساخ الصوت على ElevenLabs ←

ما تحتاجه قبل البدء

الإعداد واحد في كل الطرق أدناه، سواء انتهى بك المطاف باستخدام نموذج مجاني مفتوح المصدر أو أداة مدفوعة: هاتف أو ميكروفون USB بسيط، غرفة هادئة، ومن 30 ثانية إلى دقيقتين من كلام نظيف. هذا كل شيء فعلاً؛ الفروق بين الأدوات تبدأ فقط عند خطوة الرفع.

جهاز تسجيل. يكفي هاتف ذكي أو ميكروفون USB بسيط؛ لا تحتاج معدات استوديو. الأهم هو غرفة هادئة، لأن هذه النماذج تنسخ كل ما في المقطع المرجعي، بما في ذلك الضوضاء الخلفية والصدى، وليس الصوت وحده.

مكان هادئ. سجّل في مكان خالٍ من صوت المروحة أو ضجيج الشارع أو أحاديث الآخرين. خزانة ملابس مغلقة أو غرفة صغيرة مفروشة بالسجاد أفضل من صالة مفتوحة، لأن الأسطح الناعمة تقلل الصدى.

من 30 ثانية إلى دقيقتين من كلام نظيف. هذه هي النقطة المثالية في معظم الأدوات هنا. اقرأ فقرة أو فقرتين بصوتك الطبيعي، دون موسيقى أو ضوضاء خلفية. بعض الطرق أدناه تحتاج أقل من ذلك بكثير، حتى 5 ثوانٍ فقط، وهذا مذكور في خطوات كل طريقة على حدة.

الطريقة الأولى: استنساخ صوتك مجاناً باستخدام Chatterbox

Chatterbox (ونسخته الأسرع، Chatterbox Turbo) نموذج استنساخ صوت مفتوح المصدر من شركة Resemble AI، صدر بترخيص MIT. يعني هذا أنه مجاني للاستخدام الشخصي والبحثي والتجاري، بما في ذلك المنتجات مغلقة المصدر، وليس مجرد نسخة تجريبية تنتهي صلاحيتها. يستنسخ النموذج الصوت بلا تدريب مسبق، من مقطع مرجعي قصير، دون أي عملية ضبط دقيق أو تدريب منفصل.

1

افتح العرض الرسمي لـ Chatterbox Turbo

اذهب إلى مساحة ResembleAI/chatterbox-turbo-demo على Hugging Face، وهي نسخة Turbo الأسرع. يعمل العرض بالكامل داخل المتصفح، دون حساب أو تثبيت.

2

ارفع مقطعاً مرجعياً قصيراً

ارفع أو سجّل مقطعاً نظيفاً من صوتك. نحو 5 ثوانٍ كافية لاستنساخ Chatterbox بلا تدريب مسبق.

اقتصر على متحدث واحد ودون ضوضاء خلفية. يحاكي النموذج كل ما في المقطع، اللكنة والصوت الخلفي معاً، لذا نظافة التسجيل أهم من طوله.

3

اكتب النص الذي تريد نطقه

أدخل النص أو الجملة التي تريد سماعها بصوتك المستنسخ.

4

ولّد الصوت وحمّله

اضغط على زر التوليد، استمع للنتيجة، وحمّل الملف الصوتي. بما أن Chatterbox بترخيص MIT، فالمخرجات ملكك للاستخدام التجاري دون الحاجة لترخيص منفصل.

عرض Chatterbox Turbo على Hugging Face يظهر مربع نص، وسوم عاطفية، موجة الصوت المرجعي، وزر Generate

العرض الرسمي لـ Chatterbox Turbo: الصق نصك، ارفع أو سجّل مقطعاً مرجعياً قصيراً، ثم اضغط Generate. كل الخطوات تجري على صفحة واحدة.

معلومات: تريد صوتاً يتحدث العربية أيضاً؟

تنشر Resemble AI أيضاً نسخة Chatterbox Multilingual، وهي منفصلة عن عرض Turbo المستخدم في الخطوات أعلاه، وتدعم 23 لغة من بينها العربية بشكل أصلي، بموجب ترخيص MIT نفسه. عرض Turbo الرسمي في هذا الدليل يبقى بالإنجليزية، فإذا كنت تريد استنساخ صوتك وتوليد كلام عربي مجاناً، ابحث عن مساحة Chatterbox Multilingual على Hugging Face تحديداً.

لمقارنة تفصيلية في جودة الصوت وزمن الاستجابة والتسعير مقابل بديل مدفوع، راجع مقارنة ElevenLabs vs Chatterbox TTS الكاملة.

الطريقة الثانية: استنساخ صوتك مجاناً باستخدام OpenVoice V2

OpenVoice V2 خيار ثانٍ مفتوح المصدر، طورته شركة MyShell بالتعاون مع باحثين من MIT، وصدر أيضاً بترخيص MIT (منذ أبريل 2024، ويشمل الاستخدام التجاري). ميزته الأساسية على Chatterbox هي تعدد اللغات: يدعم أصلياً الإنجليزية والإسبانية والفرنسية والصينية واليابانية والكورية، أي أن مقطعاً مرجعياً واحداً يمكن أن يولّد صوتك المستنسخ وهو يتحدث بأي من هذه اللغات الست.

تحذير: لا يدعم العربية أصلياً

اللغات الست المدعومة أصلياً في OpenVoice V2 لا تشمل العربية. إذا كان هدفك توليد كلام عربي بصوتك المستنسخ مجاناً، فالخيار الأنسب من بين الأداتين المجانيتين في هذا الدليل هو Chatterbox Multilingual من Resemble AI، المذكورة في الطريقة الأولى أعلاه.

1

افتح مساحة OpenVoice V2

اذهب إلى مساحة myshell-ai/OpenVoiceV2 على Hugging Face. مثل Chatterbox، هو عرض يعمل داخل المتصفح دون تسجيل.

2

ارفع مقطعك المرجعي

ارفع تسجيلاً قصيراً ونظيفاً للصوت الذي تريد استنساخه، بنفس قاعدة الغرفة الهادئة في الطريقة الأولى.

3

اختر اللغة وولّد الصوت

اختر أياً من اللغات الست المدعومة تريد أن تكون بها المخرجات، ثم ولّد الصوت.

هذه هي الميزة التي تميز OpenVoice V2: يمكنك استنساخ صوت من عينة إنجليزية وجعله يقرأ نصاً يابانياً أو إسبانياً، دون إعادة التسجيل بتلك اللغة.

4

حمّل مقطعك

حمّل الصوت المولّد بعد أن ترضى عن النتيجة. نفس ترخيص MIT الخاص بـ Chatterbox، ما يجعل الاستخدام التجاري واضحاً.

مساحة OpenVoice V2 على Hugging Face تظهر علامة MyShell، ملاحظة ترخيص MIT، اللغات الست المدعومة، وحقل إدخال النص

يوضح عرض OpenVoice V2 شروطه مباشرة على الصفحة: ترخيص MIT، استخدام تجاري مجاني، وست لغات مدعومة أصلياً.

الطريقة الثالثة: فتح استنساخ الصوت الحقيقي على ElevenLabs مقابل $6/شهرياً

إذا كنت تريد واجهة أنظف وترخيصاً تجارياً دون قراءة شروط MIT بنفسك، فـ ElevenLabs هو أرخص خيار مدفوع يعمل فعلاً. باقته المجانية تستحق التوضيح: تحويل النص إلى كلام، تحويل الكلام إلى نص، مؤثرات صوتية، وتصميم صوت، لكن بلا أي استنساخ صوت ودون ترخيص تجاري. باقة Starter، بسعر $6/شهرياً مقابل 30,000 رصيد، هي الباقة التي تفتح ميزة Instant Voice Cloning وتضيف الترخيص التجاري.

1

اشترك في ElevenLabs Starter

الباقة المجانية لن تمنحك ميزة الاستنساخ. باقة Starter بـ $6/شهرياً تفتح Instant Voice Cloning إضافة إلى ترخيص تجاري لا تملكه الباقة المجانية.

2

سجّل من 30 ثانية إلى دقيقتين من صوت نظيف

توثيق ElevenLabs الرسمي يذكر أن 30 ثانية يمكن أن تعطي نتائج ممتازة، مع التوصية بدقيقة إلى دقيقتين من الصوت النظيف لأفضل توازن.

أكثر من 3 دقائق قد يضر فعلياً بالجودة، وفق إرشادات ElevenLabs نفسها. التزم بمتحدث واحد، وتذكّر أن النموذج يحاكي اللكنة والضوضاء الخلفية دون تمييز، لذا سجّل في مكان هادئ.

3

ارفع المقطع وأكّد الموافقة

ارفع المقطع في Voice Lab وحدد مربع الموافقة المطلوب الذي يؤكد أن لديك الحق في استنساخ هذا الصوت.

4

ولّد الصوت ونقّحه

اكتب نصك، ولّد الكلام بصوتك المستنسخ، وعدّل الصياغة أو الإعدادات حتى تقتنع بالنتيجة.

بما أنها ميزة Instant Voice Cloning، تستغرق هذه الدورة كاملة دقائق لا ساعات.

معلومات: تريد نتائج بجودة بث احترافي؟

إذا كان بإمكانك توفير 30 دقيقة إلى 3 ساعات من الصوت، فميزة Professional Voice Cloning من ElevenLabs (متاحة من باقة Creator، $22/شهرياً مع عرض تمهيدي $11 للشهر الأول) تدرّب نموذجاً مخصصاً خلال نحو 3 إلى 6 ساعات. يمكنها فقط استنساخ صوتك أنت، حتى مع موافقة كتابية من شخص آخر، وتتطلب تسجيلاً تحققياً كجزء من الإعداد.

ابدأ استنساخ صوتك على ElevenLabs Starter

ارفع عينة من دقيقة إلى دقيقتين واسمع صوتك المستنسخ في دقائق، مع 30,000 رصيد شهرياً وحقوق استخدام تجاري.

احصل على ElevenLabs Starter ←

إذا كنت تبحث عن خيارات تحويل نص إلى كلام أوسع من الاستنساخ تحديداً، فمقارنة أفضل مولدات الصوت بالذكاء الاصطناعي تغطي مجموعة أوسع من الأدوات وحالات الاستخدام.

ما أدوات “الاستنساخ المجاني” التي ليست مجانية فعلاً؟

بعض الأسماء المعروفة تضع استنساخ الصوت في واجهة صفحاتها لكنها لا تقدمه فعلياً مجاناً: Murf يحجب الاستنساخ خلف مكالمة مبيعات لباقة Enterprise، وباقة Speechify المجانية لا تتضمن استنساخاً رغم إيحاء التسويق بعكس ذلك، وباقة ElevenLabs المجانية تتوقف عند تحويل النص إلى كلام. إليك ما يتقاضاه كل منها فعلياً.

Murf AI: استنساخ الصوت إضافة حصرية لباقة Enterprise باسم Custom Voice Clones، ومحجوبة خلف “تواصل مع المبيعات”. غير متاحة في الباقة المجانية (10 دقائق لمرة واحدة من توليد الصوت، دون استنساخ)، ولا في Creator ($19/شهرياً بفوترة سنوية)، ولا في Business ($66/شهرياً بفوترة سنوية). لا توجد طريقة ذاتية الخدمة لاستنساخ صوت على Murf بأي سعر.

Speechify: تروّج صفحة التسويق لعبارة “جرّب استنساخ الصوت مجاناً”، لكن التسعير الرسمي يروي قصة مختلفة: الباقة المجانية تذكر صراحة “لا يوجد استنساخ صوت”، ولا يبدأ الاستنساخ إلا مع باقة Studio Starter بسعر $100/سنوياً.

باقة ElevenLabs المجانية نفسها: تستحق التكرار، لأنها المصدر الأكثر شيوعاً للالتباس. الباقة المجانية تمنح 10,000 رصيد شهرياً لتحويل النص إلى كلام وتحويل الكلام إلى نص والمؤثرات الصوتية، لكن دون أي استنساخ صوت ودون ترخيص تجاري.

مقارنة مقابل صفحات التسعير الرسمية، أغسطس 2026

Tool مجانية فعلاً؟ الصوت المطلوب الاستخدام التجاري المقابل الخفي
Chatterbox نعم ~5 ثوانٍ نعم (ترخيص MIT) العرض الرسمي مصمم للاختبار وليس للإنتاج عالي الحجم
OpenVoice V2 نعم مقطع قصير واحد نعم (ترخيص MIT) أفضل النتائج في اللغات الست المدعومة أصلياً
ElevenLabs Free لا غير متاح لا لا استنساخ إطلاقاً في أي مستوى رصيد
ElevenLabs Starter ($6/شهرياً) لا (مدفوعة) 30 ثانية - دقيقتان نعم استنساخ فوري فقط؛ الاستنساخ الاحترافي يحتاج باقة Creator ($22/شهرياً)
Murf AI لا غير متاح غير متاح الاستنساخ حصري لباقة Enterprise ومحجوب خلف المبيعات
Speechify لا غير متاح غير متاح الباقة المجانية بلا استنساخ؛ يبدأ من $100/سنوياً

كم من الصوت تحتاج فعلياً لاستنساخ صوت؟

من 5 ثوانٍ إلى 3 ساعات، بحسب الأداة والجودة المطلوبة: أدوات zero-shot مثل Chatterbox تعمل من نحو 5 ثوانٍ، وميزة Instant Voice Cloning من ElevenLabs تريد دقيقة إلى دقيقتين، بينما يحتاج الاستنساخ الاحترافي من 30 دقيقة إلى 3 ساعات. كلما زاد الصوت النظيف، كان الاستنساخ أدق وأثبت، والفرق بين المستويات مسموع بوضوح.

ثوانٍ قليلة (بلا تدريب مسبق): يعمل كل من Chatterbox وOpenVoice V2 من مقطع قصير دون أي خطوة تدريب. الجودة معقولة، وكافية للاختبارات السريعة أو المقاطع القصيرة أو المشاريع الشخصية، لكن العيوب الصغيرة في النبرة والإيقاع تكون أوضح مقارنة بعينة أطول.

دقيقة إلى دقيقتين (استنساخ فوري): ميزة Instant Voice Cloning من ElevenLabs مدربة على هذا النطاق، وتنتج استنساخاً أثبت وأكثر طبيعية بوضوح من عينة zero-shot مدتها 5 ثوانٍ. هذا هو النطاق الذي يجب أن يستهدفه معظم الناس إذا كانت الجودة مهمة.

30 دقيقة إلى 3 ساعات (استنساخ احترافي): تدرّب ميزة Professional Voice Cloning من ElevenLabs نموذجاً مخصصاً على هذه الكمية من الصوت، وهذا أقرب ما يمكن الحصول عليه اليوم إلى استنساخ بجودة بث احترافي. يستغرق التدريب ساعات ولا يمكن استخدامه إلا لاستنساخ صوتك أنت.

هل استنساخ الصوت بالذكاء الاصطناعي قانوني؟

استنساخ صوتك الخاص أمر قانوني وغير مثير للجدل تقريباً كأي استخدام للذكاء الاصطناعي؛ فهو صوتك، وتسجيلك، ومخرجاتك. أما استنساخ صوت شخص آخر فهنا يبدأ الخط الفاصل، قانونياً وأخلاقياً، وكل شيء يتوقف على الموافقة.

تحذير: الموافقة ليست اختيارية

استنساخ صوت شخص آخر دون إذنه قد ينتهك حقوقه حتى لو سمحت الأداة نفسها بذلك تقنياً. تتطلب كل طريقة في هذا الدليل منك تأكيد أن لديك الحق في استنساخ الصوت الذي ترفعه.

قانون ELVIS في ولاية تينيسي الأمريكية: ساري المفعول منذ 1 يوليو 2024، وهو قانون على مستوى الولاية وليس فيدرالياً، يحمي تحديداً صوت الشخص من النسخ غير المصرح بها بالذكاء الاصطناعي ويشترط إذناً كتابياً قبل استنساخ الصوت للاستخدام التجاري. قد تحذو ولايات أخرى حذوها، لكن هذه الحماية ليست معمّمة على مستوى الولايات المتحدة كلها، وليست قانوناً في الدول العربية أصلاً؛ يُذكر هنا كسياق دولي فقط.

قانون الاتحاد الأوروبي للذكاء الاصطناعي: دخلت قواعد الشفافية في المادة 50 حيز التنفيذ في 2 أغسطس 2026، وتشترط الإفصاح عن الصوت المولَّد أو المُعدَّل بالذكاء الاصطناعي، بما في ذلك الديب فيك، للمستمعين. هذا القانون لا ينطبق على الدول العربية، لكنه يعكس اتجاهاً عالمياً متنامياً نحو إلزامية الإفصاح، وإذا كنت تنشر صوتاً مستنسخاً لجمهور في الاتحاد الأوروبي فتصنيفه كمحتوى مولَّد بالذكاء الاصطناعي أصبح شرطاً قانونياً هناك. راجع قواعد المادة 50 من قانون الاتحاد الأوروبي للذكاء الاصطناعي بشأن تصنيف المحتوى للتفاصيل الكاملة.

الاحتيال هو الخطر الآخر. حذّرت هيئة التجارة الفيدرالية الأمريكية (FTC) مراراً من عمليات احتيال باستخدام أصوات مستنسخة، حيث يُستخدم صوت مستنسخ، غالباً لأحد أفراد العائلة ومأخوذ من مقاطع على وسائل التواصل الاجتماعي، لتلفيق مكالمة طوارئ وطلب المال. لا شيء في هذا الدليل مصمم لهذا الغرض، لكن التقنية نفسها قابلة لسوء الاستخدام، وهذا بالضبط سبب أهمية الموافقة والإفصاح.

قراءة إضافية

الأسئلة الشائعة

هل يجوز استنساخ صوتك الخاص بالذكاء الاصطناعي؟

نعم. استنساخ صوتك الخاص قانوني ولا يتطلب إذن أحد سواك، لأنه تسجيلك وصوتك أنت. الإشكاليات القانونية حول استنساخ الصوت تنطبق على استنساخ صوت شخص آخر، حيث تكون الموافقة مطلوبة، وليس على استنساخ صوتك أنت.

كم من الصوت تحتاج لاستنساخ صوت؟

يتراوح من نحو 5 ثوانٍ إلى عدة ساعات، حسب الطريقة والجودة التي تريدها. أدوات zero-shot مثل Chatterbox وOpenVoice V2 تعمل من نحو 5 ثوانٍ من الصوت النظيف. توصي ميزة Instant Voice Cloning من ElevenLabs بدقيقة إلى دقيقتين لأفضل توازن بين السرعة والجودة. أما الاستنساخ بجودة احترافية فيحتاج من 30 دقيقة إلى 3 ساعات من الصوت ويستغرق ساعات في التدريب.

هل يمكن استنساخ الصوت مجاناً فعلاً؟

نعم، باستخدام نماذج مفتوحة المصدر. كل من Chatterbox وOpenVoice V2 بترخيص MIT ويعملان على مساحات Hugging Face رسمية ومجانية دون تسجيل أو تثبيت. كثير من الأدوات التي تروّج لاستنساخ صوت "مجاني" في صفحاتها التسويقية لا تقدمه فعلياً مجاناً، بما في ذلك باقة ElevenLabs المجانية نفسها، التي لا تتضمن أي استنساخ إطلاقاً.

هل استنساخ الصوت بالذكاء الاصطناعي آمن؟

الأدوات نفسها آمنة للاستخدام عندما تستنسخ صوتك الخاص أو صوتاً لديك موافقة على استنساخه. الخطر يأتي من سوء الاستخدام: استُخدمت أصوات مستنسخة في مكالمات احتيال تنتحل صفة أفراد العائلة، ولهذا أصدرت هيئة التجارة الفيدرالية تحذيرات للمستهلكين. استخدام أداة موثوقة، والالتزام باستخدامات مصرح بها، والإفصاح عن الصوت المولَّد بالذكاء الاصطناعي حيث يُطلب ذلك (كما في قانون الاتحاد الأوروبي للذكاء الاصطناعي) يبقي الممارسة في الجانب الآمن.

ما مستوى الجودة المتوقع من أدوات استنساخ الصوت المجانية؟

من معقول إلى جيد، حسب مقطعك المرجعي. ينتج كل من Chatterbox وOpenVoice V2 أصواتاً مستنسخة يسهل التعرف عليها وصالحة للاستخدام من عينة zero-shot قصيرة، كافية للمشاريع الشخصية أو الاختبارات السريعة أو المحتوى الذي لا يتطلب كمالاً. لن تضاهي نموذجاً مدرباً احترافياً على ساعات من الصوت، لكن بالنسبة لأدوات مجانية تعمل داخل المتصفح، الفارق أصغر مما يتوقعه معظم الناس.

ما أفضل أداة لاستنساخ الصوت بالذكاء الاصطناعي؟

يعتمد على ميزانيتك وحالة استخدامك. إذا كانت التكلفة هي الأولوية، فـ Chatterbox وOpenVoice V2 مجانيتان فعلاً وبترخيص MIT يتيح الاستخدام التجاري. إذا كنت تريد سير عمل أسرع وأكثر احترافاً ولا تمانع الدفع، فباقة ElevenLabs Starter بـ $6/شهرياً هي الأرخص التي تفتح استنساخاً حقيقياً. راجع مقارنة أفضل أدوات استنساخ الصوت المجانية ومقارنة ElevenLabs vs Chatterbox TTS لتفاصيل أدق حول الخيارين.

هل كانت هذه المقالة مفيدة؟

0:00