---
title: نماذج الذكاء الاصطناعي الصينية للفيديو تتنافس على صدارة مؤشرات القياس
url: https://www.dataloco.com/ar/nmathg-althkaaa-alastnaaay-alsyny-llfydyo-ttnafs-aal-sdar-moshrat-alkyas
published: 2026-09-27T12:08:05+00:00
language: ar
section: الذكاء الاصطناعي
source: https://www.ai4business.it/intelligenza-artificiale/modelli-ai-video-cinesi-la-sfida-ai-vertici-dei-benchmark/
organizations: Alibaba, Artificial Analysis, MiniMax, ByteDance, Google
publisher: Dataloco
---

# نماذج الذكاء الاصطناعي الصينية للفيديو تتنافس على صدارة مؤشرات القياس

يتصدر نموذج Wan 3.0 التابع لشركة Alibaba مؤشر قياس تحويل النص إلى فيديو مع الصوت التابع لمنصة Artificial Analysis، إلا أن الفارق بينه وبين المنافسين يظل غير مؤكد إحصائياً.

تظهر أنظمة توليد الفيديو الصينية حضوراً متزايداً في مؤشرات القياس الدولية، حيث تبرز شركات Alibaba وMiniMax وByteDance في المراتب العليا لتصنيفات Artificial Analysis، وهي منصة مستقلة تقارن النماذج التوليدية الرئيسية في السوق. ويحتل Wan 3.0 حالياً المركز الأول في فئة تحويل النص إلى فيديو مع توليد الصوت، مسجلاً حوالي 1,240 نقطة.

لا تعني هذه النتيجة تفوقاً عاماً للصناعة الصينية، إذ تحافظ شركة Google على الصدارة في فئات أخرى من توليد الفيديو، مثل فئة تحويل النص إلى فيديو بدون صوت التي يتصدرها نموذج Gemini Omni Flash. وتعتمد Artificial Analysis تصنيفات منفصلة لكل نمط، بما في ذلك تحويل الصور إلى فيديو والتحرير، مع تمييز الأنظمة التي تنتج صوتاً عن تلك التي تولد صوراً متحركة فقط.

وفيما يخص ترتيب فئة تحويل النص إلى فيديو مع الصوت، يأتي Gemini Omni Flash في المركز الثاني، تليه نسخة من MiniMax H3 خضعت لتدريب إضافي من قبل fal، ثم يليهما نموذج MiniMax H3 الأصلي ونموذج Dreamina Seedance 2.0 من شركة ByteDance. وتتداخل فترات الثقة المرتبطة بالمراكز الثلاثة الأولى، مما يعني أن الفارق الرقمي لا يثبت تفوق نموذج Alibaba إحصائياً على النموذجين الآخرين.

تعتمد منهجية Artificial Analysis بشكل أساسي على مقارنات بشرية عمياء، حيث يختار المستخدمون الفيديو المفضل من بين خيارين دون معرفة النموذج المنتج، ثم يتم تجميع هذه المقارنات عبر نموذج إحصائي Bradley-Terry وتحويلها إلى مقياس يشبه نظام Elo. ويقيس هذا الأسلوب تفضيلات المشاهدين من حيث الجودة البصرية والواقعية وديناميكيات المشهد والصوت، لكنه لا يقيس بالضرورة مدى الالتزام بالتعليمات المعقدة أو استمرارية الشخصيات في التسلسلات الطويلة.

من جانبها، قدمت Alibaba نموذج Wan 3.0 كمنصة توليد سمعية بصرية يمكنها إنتاج مقاطع تصل مدتها إلى 30 ثانية في عملية توليد واحدة، بدقة تصل إلى 1080p وبمعدل 30 إطاراً في الثانية، مع توليد أصلي للحوارات والموسيقى والمؤثرات الصوتية. ويقبل النظام مدخلات متعددة تشمل النصوص والصور والفيديو والصوت والمستندات وصفحات الويب، بحد أقصى عشرين عنصراً لكل طلب.

أما شركة MiniMax، فتظهر في المراتب الأولى في التقييمات بصوت وبدون صوت عبر نموذج H3، الذي يتميز بتوفر جزء كبير من نظامه بأوزان مفتوحة. ويمكن لنموذج H3 توليد فيديوهات مصحوبة بصوت ستيريو بتردد 32 كيلو هرتز، بمدة تتراوح بين أربع وخمس عشرة ثانية، وبدقة تصل إلى 2K من خلال عملية إعادة توليد إضافية.
