اختبار Saturn بعشرة آلاف إجابة يكشف فشل الذكاء الاصطناعي في 57% من أسئلة المال — التركيز على Bittensor (TAO)
اختبار Saturn لـ18 نموذج ذكاء اصطناعي رصد فشلًا بنسبة 57% في أسئلة التمويل الشخصي يرتفع إلى 88% في الأسئلة الصعبة، مع استمرار صعود الثقة بنصائح الذكاء…
ملخص الذكاء الاصطناعيAI
- اختبار Saturn يرصد فشل 57% من إجابات أسئلة التمويل الشخصي عبر 18 نموذج ذكاء اصطناعي
- يرتفع معدل الفشل إلى 88% في الأسئلة الصعبة متعددة الخطوات
- النماذج المجانية تفشل في 63% من الإجابات مقابل 49% للنسخ المدفوعة
- Claude Opus 5 يتصدر الترتيب مع خطأ في 39% من الإجابات
عشرة آلاف إجابة، 57% منها خاطئة
انتهى الاختبار، والنتيجة قراءة غير مريحة لأي شخص سبق أن سأل روبوت محادثة أين يضع مدخراته: نماذج الذكاء الاصطناعي السائدة قدمت إجابات خاطئة أو ناقصة في 57% من أسئلة التمويل الشخصي خلال اختبار أجرته شركة التقنية المالية البريطانية Saturn، وارتفع معدل الفشل إلى 88% في الأسئلة الأصعب متعددة الخطوات — وهي بالضبط النوعية من الأسئلة التي تواجهها الأسر المعيشية فعليًا. ضمّ التمرين 121 سؤالًا وشغّله على 18 نموذجًا مجانيًا ومدفوعًا من مزودين يضمون ChatGPT وGemini من Alphabet وClaude وCopilot، مع تكرار كل سؤال حتى خمس مرات لاختبار الاتساق، وجمع أكثر من 10,000 إجابة في المجموع. واحتُسبت الإجابة فشلًا عندما تضمنت خطأً واقعيًا، أو أغفلت معلومة جوهرية، أو حذفت تحذيرًا مطلوبًا. وكلفت الفئات المجانية الأمناء أكثر من غيرها، إذ فشلت في 63% من الإجابات مقابل 49% للنسخ المدفوعة؛ وفي الأسئلة الأصعب كذلك أخطأت النماذج المجانية في 93% من الحالات. تصدر Claude Opus 5 في وضع التفكير (reasoning mode) الترتيب، ومع ذلك أخطأ في 39% من الإجابات، وامتدت الأخطاء من حسابات خاطئة إلى إغفال تغييرات ضريبية حديثة وقواعد ببساطة غير موجودة أصلًا. وكان في إحدى الإجابات المتعلقة بضريبة المعاشات التقاعدية ما قد يعرّض مدّخر لغرامة قيمتها 17,500 جنيه إسترليني من هيئة الإيرادات والجمارك البريطانية HM Revenue and Customs. وقال الرئيس التنفيذي لشركة Saturn، Amal Jolly: «ملايين الناس يثقون بنماذج الذكاء الاصطناعي للحصول على نصيحة مالية، لكنهم يتلقون إجابات خاطئة قد تكلفهم أموالهم». ويزيد التوقيت من حدّة النتيجة: اعتماد المستهلكين على روبوتات المحادثة في القرارات المالية نما بشكل حاد، وهو ما يحوّل معدل خطأ قدره 57% من فضول مخبري إلى مشكلة قائمة لحماية المستهلك — ومشكلة تمتد مباشرة إلى عالم العملات الرقمية، حيث يعتمد المستثمرون الذاتيون بشكل روتيني على أدوات الذكاء الاصطناعي دون وجود طبقة نصيحة منظَّمة خلفهم.
الثقة تواصل الصعود رغم كل شيء
أشدّ التناقضات وضوحًا في هذه البيانات أن الثقة في هذه الأدوات تواصل الارتفاع في حين يتراجع أداؤها في الدقة. وجدت مسحًا لشركة EY شمل 18,000 مستهلك حول العالم أن 49% منهم سبق أن استخدموا الذكاء الاصطناعي لدعم قرارات الادخار والاستثمار. وأفاد الجهة المنظِّمة للخدمات المالية في بريطانيا في أغسطس بأن أربعة من كل خمسة مستثمرين أقل خبرة لجأوا إلى الذكاء الاصطناعي للمساعدة في الاستثمار، وقال 56% من المشاركين في الاستطلاع إنهم يثقون بهذه الأدوات — نسبة أعلى ممن قالوا الشيء نفسه عن التلفزيون والإذاعة البالغة 47%. وأشارت الأبحاث ذاتها إلى مفهوم خاطئ أكثر إثارة للقلق: 44% من المستجيبين يعتقدون خطأً أن المعلومات المالية المولّدة من الذكاء الاصطناعي خاضعة للرقابة التنظيمية. وفي مسح منفصل أجرته PensionBee على 1,000 شخص بالغ في الولايات المتحدة، صرّح نحو ستة من كل عشرة بأنهم سيتصرفون بناءً على إرشاد مالي دون التحقق منه بشكل مستقل، وقال ما يقارب ربع المشاركين إن روبوت محادثة سبق أن قدّم لهم معلومات خاطئة عن شؤونهم المالية. كما أن التعرض لهذا الخطر لم يعد يتطلب متصفحًا على سطح المكتب: المساعدات الذكية مدمجة اليوم على مستوى نظام التشغيل نفسه، من Siri من Apple إلى Gemini على Android، ما يجعل كل الفئات العمرية داخل نطاق الخطر. وتبقى نقطة Jolly البنيوية صامدة: النصيحة المالية المقدمة من الذكاء الاصطناعي تقع خارج المحيط التنظيمي، تاركة المستخدمين بلا حقوق تعويض تُذكر مع المستشار البشري، وقد دعا الجهة المنظِّمة FCA إلى التحرك سريعًا في هذا الملف. يمكن للقراء الراغبين في متابعة السوق لحظيًا الاطلاع على أسعار السبوت والعقود الآجلة مباشرة عبر Binance.
Bittensor (TAO) وفجوة الثقة
قراءتنا في COINOTAG أن نتائج Saturn تنسحق أشدّ ما تنسحق الزاوية من عالم العملات الرقمية التي تسوّق نفسها على أساس الذكاء الآلي. فشبكة Bittensor (TAO) اللامركزية التي تكافئ المساهمين على نماذج تعلّم الآلة تتداول على منحنى المصداقية نفسه الذي كشطه الاختبار للتو — فجمهور التجزئة الذي يكتشف أن روبوتات المحادثة تفشل في 57% من أسئلة المال قد يخفّض من قيمة روايات رموز الذكاء الاصطناعي جنبًا إلى جنب مع المساعدات مغلقة المصدر. والقضية الأعمق هي التحقق: فـأوراكل البلوكتشين وُجد أساسًا لأن المدخلات غير الموثوقة تُعطِّل الأموال المؤتمتة، في حين لا تحمل روبوتات المحادثة المالية أي آلية تحقق مكافئة. وإلى أن تتحسّن موثوقية النماذج ويُنظَّم بُعد النصيحة المالية، سيبقى الذكاء الاصطناعي اللامركزي قصة ثقة أولًا وقصة قدرة حاسوبية ثانيًا.
الوسوم ذات الصلة

تم إنتاجه بمساعدة الذكاء الاصطناعي، وتمت مراجعته بالذكاء الاصطناعي، ونُشر تحت الإشراف التحريري لـ COINOTAG.


