إطلاق نموذج Qwen3-Max-Flash على منصة Ali Qianwen AI مع هيكلية انتباه مختلط جديدة

·بواسطة TechRitual Editorial·الذكاء الاصطناعي
إطلاق نموذج Qwen3-Max-Flash على منصة Ali Qianwen AI مع هيكلية انتباه مختلط جديدة
✏️ محتوى أصلي| TechRitual World الطاقم التحريري

أطلقت منصة Qwen AI التابعة لشركة علي بابا نموذج Qwen3-Max-Flash رسميًا في 27 أغسطس، والذي يتميز بهيكله المتنوع من نوع الخبراء المختلطين (MoE) ويستهدف تقديم أفضل قيمة مقابل السعر. السعر الرسمي المعلن هو: رسوم إدخال لكل مليون توكن RMB¥0.80 (حوالي HK$0)، رسوم إخراج لكل مليون توكن RMB¥2.70 (حوالي HK$2)، رسوم وصول سريع لكل مليون توكن RMB¥0.10 (حوالي HK$0).

نموذج Qwen3-Max-Flash يعتمد على هيكل انتباه مختلط جديد

يعتمد Qwen3-Max-Flash على هيكل الجيل التالي (Next) الذي يختلف تمامًا عن النماذج الكبيرة السابقة، حيث يصل إجمالي عدد المعلمات إلى مئات المليارات، ولكن يتم تفعيل 6 مليارات (6B) معلمة فقط في كل استنتاج، مما يدعي أنه يحقق معايير كفاءة جديدة على مستوى العالم. في آلية الانتباه، يقدم النموذج آلية الانتباه النادرة QSA (Qwen Sparse Attention) الفريدة، والتي تتكامل بكفاءة مع GDN لتشكيل هيكل انتباه مختلط، مما يزيد من سرعة الحساب في سيناريوهات السياق الطويلة التي تصل إلى 1M توكن، بأكثر من 8 مرات مقارنة بالحلول التقليدية، مع الحفاظ على الدقة.

فيما يتعلق بالاتصالات الداخلية الهرمية، يستخدم النموذج طريقة Gated Residual المطورة ذاتيًا، حيث يقوم بتقسيم قناة المعلومات الرئيسية التقليدية في Transformer إلى 4 قنوات مستقلة، مما يسمح للنموذج بتحديد مسارات القراءة والكتابة ديناميكيًا حسب الحاجة، مما يجعل نقل المعلومات أكثر كفاءة ويزيد من استقرار التدريب. هذا التصميم يغير عنق الزجاجة الناتج عن القناة الواحدة السابقة، مما يسهل تدفق التدرجات أثناء التدريب على نطاق واسع.

51B N-gram Embedding يعزز كفاءة توسيع المعلمات

فيما يتعلق بتوسيع المعلمات، يقدم النموذج معلمات N-gram Embedding إضافية بحجم 51B، مما يوفر وظيفة تحديد موقع فعالة لهيكل Transformer. لا تحتاج هذه المعلمات إلى تفعيل فوري في كل عملية حساب توكن، بل تستخدم موارد منخفضة جدًا "لتوصيل" دليل ذاكرة كبير، مما يعزز بشكل كبير كفاءة توسيع معلمات النموذج ويقلل من تكاليف التدريب. من خلال هذا التصميم المفصول، يتمكن النموذج من تحميل المزيد من المعرفة العالمية مسبقًا إلى المعلمات الثابتة مع الحفاظ على سرعة الاستنتاج.

فيما يتعلق بضبط المعلمات، يتبنى Qwen3-Max-Flash استراتيجية تقدم متزامن بين هيكل النموذج والتحسينات اللاحقة، مما يؤدي إلى تحسين كبير في كفاءة التقارب وإنتاجية التدريب. بناءً على التقنيات المذكورة أعلاه، يمكن للنموذج الجديد تقديم خدمات استنتاج فعالة بتكلفة أقل في سيناريوهات المهام الحقيقية مثل البرمجة وAgent، مما يوفر خيارات أكثر فعالية من حيث التكلفة للتطبيقات على مستوى المؤسسات.

البندالمواصفات
نوع الهيكلخبراء مختلطون متعددون (MoE)
إجمالي عدد المعلماتمئات المليارات
المعلمات النشطة6 مليارات (6B)
معلمات N-gram Embedding51B
آلية الانتباهQSA انتباه نادر + هيكل مختلط GDN
زيادة سرعة السياق الطويلزيادة بأكثر من 8 مرات في سيناريوهات 1M توكن ذات الوصول السريع
سعر الإدخالRMB¥0.80 (حوالي HK$0)
سعر الإخراجRMB¥2.70 (حوالي HK$2)
سعر الوصول السريعRMB¥0.10 (حوالي HK$0)

اقرأ المقال الأصلي على techritual.com (بالصينية التقليدية)

T
حول المؤلف
TechRitual Editorial

The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.