SpaceXAI لإيلون ماسك تطلق Grok 4.7 بنتيجة 71% في DeepSWE وسط ضجيج Dogecoin (DOGE)

أطلقت SpaceXAI لإيلون ماسك Grok 4.7 في 21 سبتمبر: 71.0% في DeepSWE v1.1 و38.0% في Terminal-Bench 4.0، مع الحفاظ على تسعير 2$/6$ لكل مليون رمز.

(١٢:٣١ ص UTC)
4 دقائق للقراءة
ملخص الذكاء الاصطناعيAI
  • أطلقت SpaceXAI نموذج Grok 4.7 يوم 21 سبتمبر بنسبة 71.0% في DeepSWE v1.1
  • سجل Grok 4.7 نسبة 38.0% في Terminal-Bench 4.0 مقابل 20.3% لسابقه
  • سعر الإطلاق 2 دولار للمليون رمز إدخال و6 دولارات للمليون رمز إخراج
  • في Brood War Bench خاضت 19 إعداداً 171 مباراة وحقق Codex Astra 18 فوزاً
k7rq2fdm

Grok 4.7 يستهدف أعباء العمل التي تمتد لساعات

كشفت SpaceXAI، الذراع المتخصص في الذكاء الاصطناعي التابع لإيلون ماسك، يوم 21 سبتمبر عن نموذج Grok 4.7، وصفته الشركة بأنه أقوى نماذجها حتى الآن في البرمجة والعمل المعرفي. وفق الإعلان الرسمي ، بُني النظام على نموذج أساس أكبر من Grok 4.6، ومرّ بدورات أطول من التعلم المعزز على مزيج مهام أصعب، مع تركيز مقصود على المشكلات التي تستغرق ساعات عدة لإكمالها. تضع SpaceXAI الإصدار بأكمله في إطار «التحمّل»: فحيث كانت النماذج السابقة تجيب خلال دقائق، صُمم هذا النموذج ليخوض عملاً يستهلك من مهندس أو محلل بشري ساعات طويلة. وتقول الشركة إن النموذج صار أفضل بوضوح في التحقق من مخرجاته الخاصة عبر الجلسات الطويلة، وفي إدارة نوافذ سياق طويلة جداً، وفي تشغيل إطار الوكلاء Grok Bot بشكل أصلي — تحسينات تظهر، بحسبها، في المحادثة ومهام المعرفة العامة وتوليد المستندات والعروض التقديمية الاحترافية. وتضع المقارنات المنشورة إعداد xhigh قرب خط المقدمة: ففي DeepSWE v1.1، وهي منظومة اختبار لهندسة البرمجيات، سجل Grok 4.7 نسبة 71.0%، متجاوزاً Fable 5.1 max عند 70.0%، ولا يتقدم إلا على GPT-5.6 Sol max عند 72.7%. وفي Terminal-Bench 4.0 الذي يقيس العمل الطرفي متعدد الساعات، قفز النموذج إلى 38.0% مقابل 20.3% لسابقه. أما في المنظومات التي تحاكي مهنياً متعدد الساعات للمحامين والممرضات والمحللين الماليين — ومنها AA Briefcase وHealthBench — فيقول إن Grok 4.7 يعمل اليوم على مستوى أفضل النماذج في الصناعة. والسلامة هي الادعاء الكبير الآخر: إذ يجعل هيكل السلامة المعاد بناؤه هذه النسخة الأصعب على الإطلاق في رفض الطلبات غير الملائمة ومقاومة محاولات التجاوز. ففي HackerBench v0.3 الذي يختبر المهام الإلكترونية الخبيثة، لم تنجح سوى 3.3% من المطالبات عالية الخطورة ذات الاستخدام المزدوج، مع حالات رفض خاطئة قليلة للأعمال الأمنية الدفاعية المشروعة. وقد مُنح عدد محدود من شركاء الأمن السيبراني صلاحية فريق الهجوم الأحمر بالدعوة فقط لدعم أبحاث الدفاع. والنموذج متاح الآن عبر Cursor وGrok Build وواجهة Grok API والمنصات السحابية الكبرى وموجّهات النماذج.

تسعير 2 دولار يصمد بينما يُحرَج Grok 4.6 في Brood War

التسعير هو المفاجأة الهادئة: يُطلق Grok 4.7 بسعر 2 دولار لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج — مطابقاً تماماً لتسعير Grok 4.6 — إضافة إلى نسخة سريعة تضاعف سرعة الإخراج عند ضعف السعر. وتجعل الاقتصاد الرمزي للمنافسين في موقع حرج: فGPT-5.6 Sol مدرج بسعر 4 دولارات/20 دولاراً لكل مليون رمز، وFable 5.1 بسعر 10 دولارات/50 دولاراً، ما يضع أسعار Grok عند نحو الثلث إلى نصف أسعار المنافسين مع تسليم أسرع. وبرقم تلك المقارنة، يُظهر جدول SpaceXAI المقارن تفوق Grok 4.7 في الهندسة الكهربائية (EEBench: 64.0% مقابل 39.4% لـ GPT-5.6 Sol و56.4% لـ Fable 5.1) وفي معيار Harvey للوكيل القانوني (19.6% مقابل 2.5% و6.7%)، بينما يتراجع خلف Fable 5.1 في هندسة البرمجيات (CursorBench 4.0: 46.3% مقابل 51.8%) وفي الاستدلال الإكلينيكي (HealthBench Professional: 56.7% مقابل 62.1%). وكل الأرقام أعلاه من بيانات SpaceXAI المنشورة. والخلفية المؤسسية مهمة: فقد اتخذت SpaceXAI شكلها الحالي في فبراير حين اندمجت xAI في SpaceX، تلاها استحواذ يونيو على Cursor — ضمن إمبراطورية ماسك الممتدة إلى Tesla (TSLA) ، وحسب تغطيتنا السابقة مسعى لتوحيد اشتراكات الذكاء الاصطناعي خلال أسابيع. لكن قبل ساعات من الإطلاق، ضُرب السابق بمعيار جماعي محرج. فـ Brood War Bench للمطور Ben Swerdlow، حيث تخوض وكلاء الذكاء الاصطناعي لعبة StarCraft: Brood War، تداول على X في 20 سبتمبر: ف19 إعداداً من Codex وClaude وGrok خاضت 171 مباراة وجهاً لوجه، واجتاح Codex Astra مبارياته الـ18 كلها بأقصى استدلال. أما إعدادات Grok 4.6 الثلاثة فخسرت أمام كل إعدادات Codex وClaude، بأفضل نتيجة فوزين من 18. وسجل Swerdlow مباراة حرق فيها Grok بأقصى استدلال 11,138 رمز استدلال على مدى 43 دقيقة وأصدر ست دفعات أوامر فقط — دون أن يُنزّل وحدة قتالية واحدة — وكتب أن Grok ليس بعد بذكاء يكفي للعبة، وأن النماذج الأقدم تتعامل مع الاستراتيجية الفورية كاستراتيجية بالأدوار. وأضاف أن أحداً لم يتجاوز مستوى المبتدئ، ولم يُصنّف Grok 4.7 بعد. يمكن للقراء الراغبين في متابعة السوق لحظيًا الاطلاع على أسعار السبوت والعقود الآجلة مباشرة عبر Bitget.

ضغط التسعير هو الإشارة الحقيقية

اقتران أرقام يوم الإطلاق بمفارقة Brood War يُقرأ كقصة واحدة: مختبرات الخط الأمامي تبيع اليوم الاستدلال بأسعار سلعية، والموثوقية الوكيلية — لا درجات المقارنات الثابتة — هي التي تحسم الفائز. وقراءتنا في COINOTAG: جدول 2 دولار/6 دولارات يمنح Grok 4.7 اقتصاداً رمزياً على المنافسين مضاهاته، تقريباً كما تفرض أسعار العقود الآجلة على الأسواق إعادة تثبيت التوقعات، بينما المخاطر على المختبرات بلا قدرة حاسوبية مماثلة أن تصبح سيولة خروج في حرب الأسعار هذه. وتاريخياً، كانت عناوين الحوسبة لماسك تحرك معنويات الأصول المرتبطة به مثل Dogecoin (DOGE) — راقبوا نتائج Grok 4.7 الوكيلية، لا دعايات إطلاقه.

COINOTAG News Desk

COINOTAG News Desk

فريق التحرير والأبحاث في COINOTAG.

كيف يعمل مكتب الأخبار
بمساعدة الذكاء الاصطناعي

تم إنتاجه بمساعدة الذكاء الاصطناعي، وتمت مراجعته بالذكاء الاصطناعي، ونُشر تحت الإشراف التحريري لـ COINOTAG.