علي بابا تطلق أدوات ذكاء اصطناعي لتوليد الأصوات واستنساخها

أطلقت علي بابا كلاود أدوات ذكاء اصطناعي جديدة لتوليد واستنساخ الأصوات.

فريق التحرير
علي بابا تطلق أدوات ذكاء اصطناعي لتوليد الأصوات واستنساخها

ملخص المقال

إنتاج AI

أطلقت علي بابا كلاود أدوات ذكاء اصطناعي جديدة من عائلة Qwen3 لتوليد واستنساخ الأصوات، تستهدف قطاعات الإعلام والألعاب وخدمات العملاء. النماذج الجديدة، Qwen3‑TTS‑VD‑Flash و Qwen3‑TTS‑VC‑Flash، متاحة عبر واجهات برمجة التطبيقات وتدعم إنشاء واستنساخ الأصوات بجودة عالية.

النقاط الأساسية

  • أطلقت علي بابا كلاود أدوات ذكاء اصطناعي جديدة لتوليد واستنساخ الأصوات.
  • تستهدف الأدوات قطاعات الإعلام والألعاب وخدمات العملاء بجودة صوت عالية.
  • النماذج الجديدة متاحة عبر واجهات برمجة التطبيقات لتسهيل دمجها بالتطبيقات.

أعلنت شركة علي بابا كلاود عن إطلاق أدوات ذكاء اصطناعي جديدة مخصّصة لتوليد الأصوات واستنساخها ضمن عائلة نماذج Qwen3، في خطوة تعزز تنافسها في سباق تقنيات الصوت التوليدية عالميًا. وتستهدف هذه الأدوات قطاعات الإعلام والألعاب وخدمات العملاء، مع وعود بجودة صوت عالية وقدرات متقدمة على تقليد الأصوات الحقيقية بعد ثوانٍ قليلة فقط من التسجيل.

علي بابا كلاود كشفت عن نموذجين جديدين من عائلة Qwen3، هما Qwen3‑TTS‑VD‑Flash لتصميم الأصوات من الصفر عبر الأوامر النصية، وQwen3‑TTS‑VC‑Flash لاستنساخ الأصوات الحقيقية بشكل شبه مطابق.

النماذج الجديدة متاحة عبر واجهات برمجة التطبيقات (API) على منصة علي بابا كلاود، مع توفير تجارب مباشرة للمطورين عبر مستودعات مفتوحة ومنصة Hugging Face لتسهيل اختبارها ودمجها في التطبيقات.

نموذج Qwen3‑TTS‑VD‑Flash يسمح بإنشاء صوت بالكامل بالاعتماد على وصف نصي دقيق، مثل نوع الصوت، وعمر المتحدث، والإيقاع، والنبرة العاطفية، وحتى تفاصيل كطريقة النطق وسرعة الكلام، ما يتيح إنتاج أصوات مخصّصة للمحتوى الإعلاني والمرئي.

نموذج Qwen3‑TTS‑VC‑Flash قادر، وفق الشركة، على استنساخ أي صوت تقريبًا اعتمادًا على نحو 3 ثوانٍ فقط من عيّنة صوتية، مع دعم الاستنساخ في 10 لغات مختلفة، ومعدل خطأ تقول علي بابا إنه أقل من منافسين مثل ElevenLabs وMiniMax.

الأدوات الجديدة تستهدف مجالات عدة، من بينها: دبلجة المحتوى المرئي إلى لغات مختلفة، صناعة الألعاب، المساعدات الصوتية الذكية، وخدمات الرد الآلي، إضافة إلى إنتاج كتب صوتية ومحتوى تعليمي بتكاليف أقل وبسرعة أكبر.

Advertisement

النماذج قادرة أيضًا على التعامل مع نصوص معقدة، وتقليد أصوات الحيوانات، واستخراج الصوت البشري من تسجيلات مختلطة، ما يوسّع نطاق الاستخدام ليشمل الإنتاج الإبداعي والمؤثرات الصوتية في السينما والوسائط الرقمية.

اعتبارات أخلاقية وتنظيمية

تقارير تقنية تشير إلى أن فريق Qwen يرافق الإطلاق بسياسات تخص الموافقة على استخدام الأصوات الحقيقية، والتحقق من هوية المستخدمين في سيناريوهات حساسة، في ظل تزايد المخاوف من استغلال تقنيات الاستنساخ الصوتي في الاحتيال والتزييف العميق.