يبدأ كل فيديو بالذكاء الاصطناعي بنص، لكن الصوت هو ما يحدد كيف يصل هذا النص فعليًا إلى المشاهد. فهو يحدد اللهجة، والعمر، والنبرة، والحيوية، وشخصية مقدّمك — كما أن السرعة والوقفات وإشارات الأداء هي التي تحدد ما إذا كان الناتج يبدو كإنسان يتحدث أم كآلة تقرأ صفحة.

باختصار: اختر صوت الذكاء الاصطناعي عبر مطابقة اللغة واللهجة الإقليمية مع جمهورك، واستخدم وسوم الملف التعريفي لبناء قائمة مختصرة، واستمع إلى معاينة كل مرشّح بنصّك أنت، ثم اضبط الأداء بالسرعة والوقفات قبل الإنشاء. ويشرح باقي هذا الدليل تلك العملية خطوة بخطوة داخل VisionStory، حيث تضم مكتبة أصوات الذكاء الاصطناعي أكثر من 1,000 صوت عبر 88 لغة.

ما يغطيه هذا الدليل: مكتبة الصوت العامة وعناصر التحكم في الأداء المحيطة بها. أما بناء صوت من تسجيلك الخاص فهو سير عمل منفصل — راجع كيفية استنساخ صوتك بالذكاء الاصطناعي.

الخطوة 1: افتح مكتبة الصوت واقرأ صف الصوت

افتح فيديو الذكاء الاصطناعي، وحدد الأفاتار الذي تريد استخدامه، ثم انقر على الصوت الحالي أسفل مربع النص. تُفتح مكتبة الصوت فوق المحرر.

يحمل كل صف أربع إشارات تتيح لك توقّع الطريقة التي سيبدو بها المتحدث قبل الضغط على زر التشغيل:

  • وسم اللغة — اللغة التي يتحدث بها الصوت.
  • العلماللهجة الإقليمية، وليس لغة ثانية. فالأصوات الإنجليزية قد تحمل أعلام الولايات المتحدة والمملكة المتحدة وكندا وغيرها.
  • الجنس والعمر — الهوية المُدرَكة للمتحدث.
  • السمات وحالة الاستخدام — أوصاف مثل واضح أو دافئ أو حواري، أو السرد أو التعليم أو وسائل التواصل الاجتماعي.
دليل وسوم اللغة واللهجة الإقليمية والجنس والعمر والسمات وحالة الاستخدام في صف الصوت داخل VisionStory
العلم يدل على اللهجة الإقليمية — وهو الوسم الأهم عند المقارنة بين عدة أصوات باللغة نفسها.

استخدم الوسوم لبناء قائمة مختصرة، لا لاتخاذ القرار النهائي. فصوتان يحملان وسومًا شبه متطابقة قد يختلفان كثيرًا في الإيقاع والنبرة والحيوية.

الخطوة 2: صفِّ وابحث وعاين قائمة مختصرة

ابدأ بنطاق واسع بما يكفي لتسمع فروقًا حقيقية، ثم ضيّقه تدريجيًا. استخدم مرشحات اللغة والجنس والعمر وحالة الاستخدام ما دمت في مرحلة الاستكشاف. وإذا كنت تعرف الصوت بالاسم مسبقًا، فاكتبه في حقل البحث بدلًا من ذلك.

  1. ابنِ قائمة مختصرة. صفِّ أو ابحث حتى يتبقى لديك عدد قليل من المرشحين بدلًا من كتالوج كامل.
  2. استمع إلى أصوات القائمة المختصرة كلها. انقر على زر التشغيل في يمين صف الصوت لسماع عيّنته.
  3. أوقف وقارن. انقر على الزر نفسه مرة أخرى لإيقاف التشغيل قبل بدء الصوت التالي.
مكتبة الصوت في VisionStory مع حقل بحث ومرشحات اللغة والجنس والعمر وحالة الاستخدام وزر تشغيل في كل صف صوت
البحث والمرشحات يجعلان مكتبة تضم 1,000 صوت سهلة الإدارة؛ أما المعاينة فهي ما يؤكد ملاءمة الصوت.

أنصت إلى ما يحتاجه الفيديو فعليًا: اللهجة الإقليمية، والوضوح، والحيوية، والدفء، والحضور الواثق، ومدى سرعة تنقّل الصوت داخل الجملة. فالصوت الذي يبدو رائعًا بمفرده قد يظل غير مناسب لنص تعليمي أو بيعي أو إخباري أو قائم على الشخصيات.

الخطوة 3: طابِق الصوت مع محتواك وجمهورك

معظم التعليقات الصوتية المخيّبة للآمال بالذكاء الاصطناعي ليست مشكلة جودة، بل مشكلة ملاءمة. قبل أن تعتمد صوتًا، حدِّد ما الذي يجب أن يؤديه هذا الصوت في هذا الفيديو تحديدًا.

إذا كنت تُنشئابحث عنتجنَّب
الدروس التعليمية والشروحات والدوراتنطق واضح وإيقاع ثابت ودفء محايدالأداء الترويجي عالي الطاقة الذي يسرع في نطق المصطلحات التقنية
الإعلانات والعروض الترويجية والمقاطع القصيرة لوسائل التواصلالحيوية والقوة وطابع صوتي واثق وأصغر سنًاالسرد البطيء المتزن الذي يُفقد المقطع عنصر الجذب
الأخبار والمحتوى المؤسسي وتحديثات المنتجنبرة موثوقة وإيقاع متساوٍ وأقل قدر من الخامة الصوتيةالأصوات العفوية أو ذات الطابع التمثيلي المبالغ فيه
سرد القصص والمقابلات والبودكاستشخصية مميزة ومدى تعبيري واسعالأداء الإذاعي الرتيب بلا أي تنوع
النسخ المحلية من الفيديو نفسهلهجة إقليمية أصلية لكل سوقصوت إنجليزي واحد يقرأ نصًا مترجمًا

اللهجة هي الإعداد الذي يخطئ فيه الناس أكثر من غيره. إذا كان جمهورك في لندن وكان مقدّمك يحمل علم الولايات المتحدة، فسيلاحظ المستمعون ذلك — حتى لو كانت كل كلمة صحيحة. اختر العلم المناسب للجمهور، لا للغة وحدها.

الخطوة 4: اضبط سرعة الكلام ثم أضف الوقفات

انقر على صف الصوت لتطبيقه على الإعداد الحالي. ثم افتح قائمة السرعة بجوار الصوت المحدد واختر بطيء أو عادي أو سريع.

  • بطيء يناسب الشروحات المتأنية وأي محتوى يكون فيه الفهم أهم من الإلحاح.
  • عادي هو الخيار الأساسي الآمن لمعظم الدروس التعليمية والعروض التقديمية وفيديوهات الأفاتار المتحدث.
  • سريع يضيف حيوية إلى العروض الترويجية القصيرة ومقاطع وسائل التواصل، لكن النصوص الكثيفة تصبح أصعب في المتابعة.

تحدد السرعة إيقاع الأداء بأكمله. وللتحكم داخل الجملة، ضع المؤشر عند موضع الوقفة وانقر على أداة الإيقاف المؤقت. تضيف كل نقرة 0.5 ثانية؛ انقر مرة أخرى للحصول على وقفة أطول.

مقارنة بين سرعات الكلام بطيء وعادي وسريع بجانب وقفة بمقدار نصف ثانية مُدرجة داخل النص
استخدم السرعة لضبط الإيقاع العام، والوقفات للحظات المحددة التي تحمل المعنى.

معلومة مفيدة: أضف الوقفات في المواضع التي يأخذ فيها مقدّم حقيقي نفسًا، أو ينتقل بين الأفكار، أو يترك العبارة تترسّخ. كثرة الوقفات تُفكك الأداء، لذا استمع إلى معاينة الجملة كاملة بعد التحرير، لا الجزء الذي غيّرته فقط.

الخطوة 5: وجِّه الأداء باستخدام تحسين الصوت

انقر على تحسين الصوت عندما تكون الكلمات صحيحة لكن الأداء المقصود لم يتضح بعد. يضيف VisionStory إشارات أداء خاصة بالمشاعر والإيقاع والتشديد مع الحفاظ على صياغتك الأصلية.

راجع النص المُحسَّن قبل المتابعة. اختر احتفاظ عندما تتطابق الإشارات مع ما تقصده، أو تراجع للعودة إلى النص الأصلي. تظهر قيمة هذه الأداة عندما يحتاج النص إلى توجيه عاطفي واضح دون إعادة صياغته.

مقارنة قبل وبعد توضّح كيف يضيف تحسين الصوت إشارات أداء هادئة ومتزنة دون تغيير الكلمات
الرسالة تبقى رسالتك؛ الأداء وحده هو ما يحصل على التوجيه.

الخطوة 6: عاين نصك الحقيقي قبل الإنشاء

انقر على معاينة الصوت بعد ضبط الصوت والسرعة والوقفات وأي إرشادات تحسين. استمع إلى التسجيل كاملاً بدلاً من الحكم على الكلمات القليلة الأولى، وتحقق من النطق واللهجة والإيقاع ونهايات الجمل والوقفات ومدى الملاءمة العاطفية.

وأنت لا تزال تقارن بين المرشحين، ابدأ بجملة قصيرة واحدة تمثّل النص. وعندما تتقلّص القائمة إلى صوتين أو ثلاثة، عاين مقطعًا يحتوي على الأسماء والأرقام والمصطلحات التقنية أو اللحظات العاطفية الأهم في الفيديو النهائي — فعند هذه النقطة تتمايز الأصوات.

حصة المعاينة: تتضمن معاينة الصوت حصة مجانية من الأحرف تتجدد ضمن دورة متجددة مدتها 24 ساعة. بعد استهلاك هذه الحصة، يكلّف إنشاء المعاينة نقطة واحدة لكل 500 حرف. راجع كيف تعمل نقاط VisionStory للاطلاع على الصورة الكاملة.

الخطوة 7: أنشئ فيديو واحدًا ليتذكر الأفاتار الصوت

يؤدي اختيار صوت إلى تغيير إعداد المحرر الحالي، لكن الاختيار وحده لا يحفظ ذلك الصوت في الأفاتار. أنشئ فيديو واحدًا بالصوت الذي اخترته. عندها يتذكّر VisionStory هذا الاقتران ويستعيده في المرة التالية التي تستخدم فيها الأفاتار نفسه.

رسم تخطيطي من ثلاث خطوات يوضح اختيار صوت، ثم حفظه بعد إنشاء فيديو واحد، ثم استعادته عند إعادة استخدام الأفاتار
الحدّ الفاصل هو الإنشاء: اختر الصوت، وأنشئ فيديو واحدًا، ثم أعد استخدام الأفاتار وقد أصبح ذلك الصوت مرتبطًا به.

لهذا السبب يستحق هذا الاختيار عناية. فبمجرد اقتران الأفاتار بصوت، يبدأ كل فيديو لاحق من مقدّم ثابت بدلاً من قرار جديد في كل مرة.

لماذا تبدو أصوات الذكاء الاصطناعي آلية — وكيف تعالج ذلك

عندما يبدو التعليق الصوتي المُنشأ اصطناعيًا، يكون السبب عادةً واحدًا من خمسة أسباب قابلة للإصلاح، لا نموذج الصوت نفسه.

  • صوت غير مناسب للنص. الصوت السردي وهو يقرأ نصًا إعلانيًا يبدو باهتًا. أعد تصفية القائمة حسب حالة الاستخدام قبل أن تلوم الجودة.
  • غياب الوقفات. المتحدثون الحقيقيون يتنفسون. جدار من النص بلا فواصل يُقرأ كآلة، لذا أضف وقفات بنصف ثانية عند حدود الأفكار.
  • ضبط السرعة مرة واحدة ثم نسيانها. خيار «سريع» يجعل الجمل الكثيفة غير واضحة، وخيار «بطيء» يجعل الإعلان الترويجي القصير متثاقلاً. طابِق الإيقاع مع نوع المحتوى.
  • علامات ترقيم غامضة. الجمل المتصلة بلا نهاية، والفواصل الناقصة، والاختصارات غير المكتوبة بالكامل، كلها تدفع الصوت نحو نبرة رتيبة. نظّف النص أولاً.
  • غياب التوجيه العاطفي. إذا لم تكن النية موجودة في النص، فلن يستطيع الصوت استنتاجها — وهذا بالضبط ما وُجدت من أجله ميزة تحسين الصوت.

عالج هذه الأسباب الخمسة، وستختفي معظم الشكاوى من أصوات الذكاء الاصطناعي الآلية دون تغيير الصوت إطلاقًا.

إذا أوقف أحد المزوّدين صوتًا تستخدمه

يحصل VisionStory على الأصوات من عدة مزوّدين، ويمكن لأي مزوّد أن يزيل صوتًا من كتالوجه الخاص. وعند حدوث ذلك، لا يمكن إعادة الصوت إلى مكتبة الصوت العامة.

إذا اختفى صوت كنت تعتمد عليه، فابحث عن مقطع نظيف من فيديو سابق يحتوي على ذلك الصوت وحده، واستخدمه كصوت مصدر في استنساخ الصوت. يمكن للاستنساخ أن ينتج بديلًا قريبًا جدًا، وإن كان لا ينبغي توقّع أن يبدو مطابقًا تمامًا.

مخطط للعملية يوضح كيف يمكن لمقطع صوتي نظيف من فيديو سابق أن يكون مصدرًا لاستنساخ صوت بديل مشابه
يمكن لفيديو سابق معتمد أن يوفّر المقطع الصوتي النظيف الذي يحافظ على الاستمرارية عند إيقاف أحد أصوات الكتالوج.

الإذن مطلوب: استنسخ فقط المقاطع الصوتية التي تملكها أو لديك إذن واضح باستخدامها، وعاين البديل بالنص الذي تنوي استخدامه قبل النشر.

قائمة التحقق من صوت الذكاء الاصطناعي قبل الإنشاء

  • اختر اللهجة الإقليمية المناسبة لجمهورك، لا اللغة وحدها.
  • استخدم وسوم الملف التعريفي لتضييق القائمة، ثم دع أذنك تحسم القرار.
  • عاين الأسماء والأرقام والمصطلحات الصعبة من نصّك الفعلي.
  • اضبط السرعة العامة قبل إضافة الوقفات الموضعية.
  • استخدم تحسين الصوت فقط عندما يحتاج الأداء إلى توجيه أوضح.
  • استمع إلى معاينة كاملة، لا إلى الجملة الأولى فقط.
  • أنشئ الفيديو مرة واحدة عندما تريد أن يتذكّر الأفاتار الصوت.
  • دوّن اسم الصوت المختار في ملاحظات علامتك التجارية أو حملتك.

بعد تثبيت الصوت، يصبح ما تبقّى سريعًا. تابع الإعداد نفسه حتى الوصول إلى فيديو نهائي عبر كيفية إنشاء أفاتار متحدث بالذكاء الاصطناعي، أو افتح تحويل النص إلى كلام عندما تحتاج إلى الجانب الصوتي فقط.

الأسئلة الشائعة

  • ابدأ من الجمهور: طابِق اللغة واللهجة الإقليمية التي يشير إليها العلم، ثم استخدم وسوم الجنس والعمر والسمات وحالة الاستخدام لتكوين قائمة مختصرة من بضعة مرشّحين. عاين كل صوت بجملة من نصك الحقيقي بدل الاكتفاء بعيّنة عامة، واختر الصوت الذي يناسب إيقاعه وحيويته ودفؤه نوع المحتوى. وأخيرًا اضبط سرعة الكلام وأضف الوقفات حتى يطابق الأداء ما تقصده.