Qwen3.5-Omni: نموذج Alibaba Omnimodal AI (2026)
١ أبريل ٢٠٢٦
يعالج نموذج Qwen3.5-Omni من Alibaba النصوص والصور والصوت والفيديو بشكل أصلي مع مخرجات صوتية في الوقت الفعلي، والتعرف على 113 لغة، و215 مهمة صوتية فرعية بمستوى SOTA.
يعالج نموذج Qwen3.5-Omni من Alibaba النصوص والصور والصوت والفيديو بشكل أصلي مع مخرجات صوتية في الوقت الفعلي، والتعرف على 113 لغة، و215 مهمة صوتية فرعية بمستوى SOTA.
نموذج Voxtral TTS من Mistral هو نموذج تحويل نص إلى كلام مفتوح الأوزان بحجم 4B، مع نسبة فوز بلغت 68.4% مقابل ElevenLabs Flash v2.5. يدعم 9 لغات، واستنساخ صوتي في 3 ثوانٍ، وبتكلفة 0.016 دولار لكل 1000 حرف.
استكشف الأبعاد الأخلاقية والتقنية والقانونية لاستنساخ الصوت بتقنية AI — من مخاطر deepfake إلى ممارسات التصميم والاختبار والنشر المسؤولة.