DeepSeek V4.1 Flash يسجل 81.2 بتكلفة تعادل واحدًا من كل 70 من تكلفة GPT-6، ما يضغط على سردية Sahara AI (SAHARA)

سجل V4.1 Flash من DeepSeek 81.2 في OpenDesign Arena، متأخرًا 1.5 نقطة عن GPT-6 Astra، بكلفة 0.023 دولار مقابل 1.61 دولار، بفارق 70 ضعفًا.

(٠٣:١١ ص UTC)
4 دقائق للقراءة
ملخص الذكاء الاصطناعيAI
  • طراز V4.1 Flash من DeepSeek سجل 81.2 نقطة في OpenDesign Arena يوم 11 سبتمبر.
  • فارق الكلفة لكل مهمة بلغ 0.023 دولار مقابل 1.61 دولار لـ GPT-6 Astra.
  • GPT-6 Astra يحتل الصدارة بين 13 طرازًا بنتيجة 82.7 نقطة.
  • الطراز يحمل 552 مليار معامل مع تفعيل نحو 16 مليارًا لتوليد المخرجات.
k7rq2fdm

81.2 مقابل 82.7: الفارق في المقياس المرجعي

حقق طراز V4.1 Flash من DeepSeek متوسط 81.2 نقطة في تقييم OpenDesign Arena لتصميم الويب، وهي نتائج نُشرت يوم 11 سبتمبر، وبذلك اقترب إلى مسافة 1.5 نقطة فقط من GPT-6 Astra من OpenAI الذي يحصد صدارة بين 13 طرازًا بنتيجة 82.7. بعبارة أخرى: الفجوة في القدرة بين المتصدرين في لوحة تصنيف الذكاء الاصطناعي شارفت على أن تصبح ضوضاء إحصائية، أما فجوة التكلفة بين الطرازين فلم تضيق قيد أنمودة.

يقيّم OpenDesign Arena الطرازات في أعمال تصميم عملية: تطبيقات ويب ولوحات تحكم وشاشات هواتف وصفحات هبوط، ويحكم على مدى تلبية المتطلبات وتوزيع العناصر والتسلسل البصري والألوان ودرجة اكتمال كل مخرَج. وفق هذه المعايير، جاء V4.1 Flash في المركز الثاني بنقاطه 81.2، متفوقًا على Claude Fable 5.1 من Anthropic الذي سجل 80.3 في التقييم ذاته.

الاقتصاد هو حيث يفصل طراز DeepSeek بين نفسه وبين الجميع. متوسط كلفة مهمة التصميم الواحدة بلغ 0.023 دولار لـ V4.1 Flash مقابل 1.61 دولار لـ GPT-6 Astra، أي ما يعادل تقريبًا واحدًا من كل سبعين من السعر، فيما جاءت Claude Fable 5.1 أعلى من ذلك كله بـ 3.66 دولار لكل مهمة. وكان طراز DeepSeek أسرع أيضًا، إذ أنجز المهمة المتوسطة في 5.3 دقائق مقابل 11.1 دقيقة لـ Astra و12.8 دقيقة لـ Claude Fable 5.1.

هوامش الجودة تحكي قصة أكثر تحفظًا. المخرجات التي اعتُدت صالحة للاستخدام دون أي مراجعة بلغت 60% لـ GPT-6 Astra، مقابل 57.7% لـ V4.1 Flash و56.7% لـ Claude Fable 5.1، أي فارق 2.3 نقطة مئوية بين الأول والثاني فقط. وهذا التحفظ مهم، لأن OpenDesign Arena يقيس مجالًا واحدًا. نتيجة شبه التعادل في تصميم الويب لا تثبت تكافؤًا عامًا مع GPT-6 Astra في البرمجة أو الاستدلال أو البحث العلمي، وDeepSeek لم تدّعِ غير ذلك. ما تثبته الأرقام هو أنه في فئة المهام التي تنفق عليها المؤسسات فعلًا على التصميم التوليدي، لم تعد القدرة الخام المتغير الحاسم، بل السعر لكل مهمة والإنتاجية.

552 مليار معامل، و16 مليار نشِطة

ميزة التكلفة لدى V4.1 Flash معمارية وليست مدعومة من الشركة، وهي قابلة للقياس. يحمل الطراز 552 مليار معامل إجمالية، لكنه لا يشغّلها جميعًا في آن واحد: نحو 8 مليارات تُفعَّل لمعالجة المُدخلات، ونحو 16 مليارًا لتوليد المخرجات. تصف DeepSeek هذا الترتيب بأنه بنية غير متماثلة، تصميم من نوع خليط الخبراء (mixture-of-experts) يحافظ على سعة معرفة طراز ضخم مع تقليص الحوسبة المستهلكة فعلًا لكل طلب. والمنطق يشبه، في روحه، الآلة الافتراضية البديلة (AltVM) في البنية التحتية للبلوكشين، التي تنفّذ فقط الوحدات التي تتطلبها معاملة معينة بدل بيئة تشغيل كاملة.

صدر الطراز رسميًا يوم 10 سبتمبر، وفق الجدول الزمني الذي أشارت إليه DeepSeek مسبقًا. وكانت الاختبارات الداخلية قد قاست الإنتاج بنحو 420 رمزًا في الثانية، رغم أن ظروف القياس لم تكن مطابقة تمامًا لظروف الطرازات المنافسة، ما يجعل مقارنات السرعة المباشرة غير دقيقة. وعند الإطلاق قالت DeepSeek إن بنيتها الأكثر كفاءة تمكّنها من خدمة مزيد من المستخدمين بتكلفة أقل، مضيفة أن الوفر يُعاد إلى المستخدمين.

قراءتنا لبيانات المقياس المرجعي: ادعاء الكفاءة صمد أمام اختبار تقييم مستقل، على الأقل داخل هذا المجال. لكن تكاليف الخدمة وسرعاتها الواقعية ستظل تختلف تبعًا لطول المدخلات ونمط الطلبات وظروف الخوادم، كما أن تسعير واجهات البرمجة يتباين بين المزودين، لذا يجب التعامل مع أرقام الكلفة المعلنة لكل مهمة بوصفها اتجاهًا عامًا لا أرقامًا تعاقدية. أما ما لم يبقَ اتجاهًا عامًا فهو المسار ذاته: مخرجات بمستوى الرFrontier بـ 0.023 دولار لكل مهمة تعيد ضبط التوقعات بشأن ما ينبغي أن تكلفه الاستدلال الآلي. يمكن للقراء الراغبين في متابعة السوق لحظيًا الاطلاع على أسعار السبوت والعقود الآجلة مباشرة عبر Bitget.

الكلفة لكل مهمة تصبح مقياس الذكاء الاصطناعي

إذا قرأنا النتيجة شبه المتكافئة وفجوة الكلفة السبعينية معًا، تشكّل قصة واحدة: المنافسة في الذكاء الاصطناعي تتحول من مقاييس القدرة إلى اقتصاديات الوحدة. وهذا التحول يصيب مباشرة الأصول الرقمية المرتبطة بالذكاء الاصطناعي. عملات مثل Sahara AI (SAHARA) تتداول على أطروحة مفادها أن بنية تعلّم الآلة اللامركزية قادرة على التفوق المركزي مختبرات التطوير في الكلفة؛ فحين يُظهر مختبر متقدم مركزي تسعيرًا يعادل واحدًا من كل سبعين من أقرب منافس له، تصبح تلك الأطروحة أصعب في البيع، ومن المتوقع أن يظهر أي إعادة تقييم أولًا في حجم التداول عبر منظومة عملات الذكاء الاصطناعي. ومكاسب الكفاءة تقطع بالسيفين لشبكات الحوسبة القائمة على البلوكشين، التي تتنافس على تقليل الدورات الحسابية المهدورة. المقياس التالي الذي يستحق المتابعة هو ما إذا كانت OpenDesign Arena ومقيمون أمثالها ستتبنى نشر تصنيفات معدّلة بالكلفة؛ فإن فعلت، صارت حرب الأسعار التي أشعلت DeepSeek للتو لوحة النتائج الرسمية لهذه الصناعة.

COINOTAG News Desk

COINOTAG News Desk

فريق التحرير والأبحاث في COINOTAG.

كيف يعمل مكتب الأخبار
بمساعدة الذكاء الاصطناعي

تم إنتاجه بمساعدة الذكاء الاصطناعي، وتمت مراجعته بالذكاء الاصطناعي، ونُشر تحت الإشراف التحريري لـ COINOTAG.

أخبار مؤثرة على الأسعار