أطلقت شركة Qwen الجيل الجديد من نموذجها الشامل Qwen 3.8-Omni-Flash رسميًا في 18 سبتمبر. ووفقًا للمعلومات المتاحة، يدعم هذا النموذج إدخال النصوص والصور والصوت والفيديو، ويمكنه معالجة سياقات تصل إلى 1M، مما يمكّنه من تخطيط المهام بشكل مستقل واستدعاء الأدوات وإكمال الإبداع والتسليم بناءً على فهم المحتوى.
تحسين قدرة Qwen 3.8-Omni-Flash على معالجة الصوت والفيديو
من حيث الوظائف، يستمر Qwen 3.8-Omni-Flash في دعم البرمجة ومعالجة النصوص والعمليات GUI، بينما يوسع بشكل أكبر قدراته في معالجة المهام المتعلقة بالصوت والفيديو. فيما يتعلق بفهم الفيديوهات الطويلة، يمكن لهذا النموذج التعامل مع محتوى فيديو يمتد لعدة ساعات، حيث يحدد المعلومات المرئية والصوتية التي يجب التركيز عليها بناءً على الأسئلة المطروحة، ويقوم بتحديد المحتوى الرئيسي من خلال جولات متعددة من الاستدلال. بعد دمج الأدوات، يمكن للنموذج أيضًا استخراج الملاحظات والمهام والمعلومات المتعلقة بالمخاطر من الاجتماعات، ومتابعة تنفيذ مهام مثل إرسال البريد الإلكتروني، كتابة الشيفرة أو استرجاع البيانات متعددة الوسائط لتوليد التقارير.
فيما يتعلق بإنشاء المحتوى الصوتي والمرئي، يمكن استخدام هذا النموذج في إنتاج مقاطع الفيديو الموسيقية، وترجمة المسرحيات القصيرة، وشرح الأفلام الطويلة، وغيرها من السيناريوهات. على سبيل المثال، في إنتاج مقاطع الفيديو الموسيقية، يمكن للنموذج فهم هيكل الأغنية والإيقاع والعواطف، وإخراج كلمات الأغاني مع الطوابع الزمنية؛ في ترجمة المسرحيات القصيرة، يمكنه إتمام التعرف على الشخصيات، والترجمة الشفوية، واستنساخ الصوت، وإعادة مزج المسارات الصوتية، وفحص جودة المنتج النهائي؛ وفي معالجة الأفلام الطويلة، يمكنه إتمام استخراج الحبكة، وتخطيط الشرح، وتسجيل الصوت والموسيقى، وتحرير الفيديو وإخراج الجودة النهائية.
علاوة على ذلك، يمكن للنموذج تحويل محتوى الفيديو الطويل إلى أصول معلومات قابلة لإعادة الاستخدام، بما في ذلك تنظيم النقاط المعرفية تلقائيًا، وتفكيك الخطوات، وتوليد ملاحظات PDF متطابقة مع النصوص والصور، وتحويلها لاحقًا إلى مهارات وكيل تم التحقق منها واختبارها. النسخة التفاعلية في الوقت الحقيقي Qwen 3.8-Omni-Flash-Realtime يمكنها إتمام الإدراك والاستجابة بشكل متزامن أثناء إدخال تدفقات الصوت والفيديو، مما يجعلها مناسبة لممارسات المحادثة، وإدراك الصوت المكاني، وخدمات العملاء الذكية.
فيما يتعلق بالدعم، قامت الشركة رسميًا بتوسيع Qwen-MM-Plugins، حيث أضافت العديد من القدرات الموجهة لفهم وإنشاء المحتوى الصوتي والمرئي، وأصدرت Qwen-Live Harness، التي تستخدم للتفاعل المستمر وفي الوقت الحقيقي مع الصوت والفيديو وتنفيذ المهام. وفقًا للبيانات الرسمية، في 30 تقييمًا تم إجراؤها، سجل Qwen 3.8-Omni-Flash متوسط درجات أعلى من الجيل السابق Qwen 3.5-Omni-Plus بنسبة تزيد عن 26%؛ وفي الوقت نفسه، انخفض سعر إدخال الصوت عبر API بنسبة تزيد عن 98%، وانخفض سعر إدخال الفيديو والصوت بنسبة تزيد عن 93%.
حاليًا، تم إطلاق هذا النموذج على منصة Qwen AI.
اقرأ المقال الأصلي على techritual.com (بالصينية التقليدية) →
The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.

