Sakana Fugu Ultra مقابل Claude Fable 5 و Mythos: المقارنة الكاملة 2026
آخر تحديث: يونيو 2026
السؤال الذي يتردّد في كل اجتماع تقني هذا الشهر بسيط في صياغته معقّد في إجابته: هل يستحق Sakana Fugu Ultra أن تدفع له بدلاً من Claude Fable 5؟ معظم المقالات تجيب بكلمة واحدة مطّاطة: «يضاهيه». لكن «يضاهيه» لا تكفي صانع قرار يوقّع شيكاً. ما تحتاجه هو من يفوز في أي اختبار بالضبط، وكم يكلّفك كل خيار فعلياً لكل مهمة منجزة، وأي الخيارات تستطيع أصلاً شراءه اليوم. هذه المقارنة تجيب عن الثلاثة بأرقام صريحة لا تجميل فيها.
باختصار: Fugu Ultra يقف كتفاً بكتف مع Claude Fable 5 لا متفوّقاً عليه. يتصدّر Fable 5 في SWE-Bench Pro (86.0 مقابل 73.7) و Humanity's Last Exam (53.3 مقابل 50.0)، بينما يتفوّق Fugu Ultra في LiveCodeBench و Terminal Bench و GPQA-Diamond. والأهم: Fable 5 و Mythos مقيّدان بضوابط التصدير، فالمقارنة الواقعية لمعظم المشترين هي Fugu Ultra مقابل Opus 4.8 و GPT-5.5 و Gemini 3.1 Pro.
ما هي النماذج التي نقارنها؟
قبل الأرقام، توضيح سريع لمن نضعهم في الحلبة. Fugu Ultra هو النسخة عالية الجودة من نموذج Sakana الياباني المنسّق — لا يملك نموذجاً حدوديّاً خاصاً به، بل ينسّق مجموعة من النماذج المتاحة ليضاهي القمة. إن لم تكن تعرف كيف يعمل هذا التنسيق بالضبط، فقد شرحناه بالتفصيل في دليل ما هو Sakana Fugu.
في الجهة المقابلة: Claude Fable 5 و Mythos Preview، نموذجا Anthropic الحدوديان، وهما المرجع الذي تقيس Sakana نفسها عليه. ثم النماذج التي تمثّل خياراتك الفعلية في السوق: Opus 4.8 و GPT-5.5 و Gemini 3.1 Pro.
جدول المقارنة الكامل بالأرقام الحقيقية
نعرض الأرقام كما نُشرت من دون تجميل. لاحظ أن بعض النماذج (Fable 5 و Mythos) خارج مجموعة Fugu لأنها مقيّدة بضوابط التصدير، فهي هنا كمرجع.
| المعيار | Fugu Ultra | Fable 5 | Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|
| SWE-Bench Pro | 73.7 | 86.0 | 69.2 | 58.6 | 54.2 |
| Terminal Bench 2.1 | 82.1 | 80.4 | 74.6 | 78.2 | 70.3 |
| LiveCodeBench | 93.2 | 89.8 | 87.8 | 85.3 | 88.5 |
| CharXiv Reasoning | 86.6 | 86.1 | 84.2 | 84.1 | 83.3 |
| GPQA-Diamond | 95.5 | — | 92.0 | 93.6 | 94.3 |
| Humanity's Last Exam | 50.0 | 53.3 | 49.8 | 41.4 | 44.4 |
القيمة 86.1 في CharXiv منسوبة إلى Mythos Preview لا إلى Fable 5. وجميع مقارنات Fable 5 و Mythos تعتمد درجات أبلغ عنها المزوّدون، لا اختباراً مباشراً وجهاً لوجه.
من يفوز في كل اختبار؟ بطاقة النتائج الصريحة
هذا ما لا تجده في المقالات التي تكتفي بكلمة «يضاهيه»:
- SWE-Bench Pro (هندسة برمجيات واقعية): يفوز Fable 5 بفارق واضح (86.0 مقابل 73.7). إن كانت أولويتك إصلاح أخطاء برمجية معقّدة في مستودعات حقيقية، Fable 5 في المقدمة.
- Humanity's Last Exam (أصعب اختبار معرفي عام): يفوز Fable 5 (53.3 مقابل 50.0)، لكن بفارق ضيّق.
- LiveCodeBench (توليد كود): يفوز Fugu Ultra (93.2)، متقدّماً على الجميع.
- Terminal Bench 2.1 (مهام طرفية وكيلية): يفوز Fugu Ultra (82.1).
- GPQA-Diamond (أسئلة علمية صعبة على مستوى الدكتوراه): يفوز Fugu Ultra (95.5)، الأعلى في الجدول.
- CharXiv Reasoning (استدلال على رسوم بيانية علمية): يفوز Fugu Ultra (86.6).
الحصيلة الأمينة: Fable 5 يفوز في اختبارَين، Fugu Ultra يفوز في أربعة. لكن الاختبارين اللذين يخسرهما Fugu (SWE-Bench Pro و HLE) من أهم المعايير المعتمدة في الصناعة، ولهذا تصف Sakana نفسها النتيجة بأنها «كتف بكتف» لا تفوّقاً. أرقام مكمّلة: في AutoResearch سجّل Fugu Ultra أفضل متوسط bits-per-byte (0.9774)، وحلّ مكعّب روبيك في 19 خطوة — الأقل بين النماذج المختبرة.
القصة الحقيقية: عدم التماثل في الوصول
هنا تنقلب المقارنة رأساً على عقب. في 12 يونيو 2026، قيّدت ضوابط التصدير الأمريكية الوصول إلى Fable 5 و Mythos، فصارا غير متاحين للعموم في كثير من الأسواق. هذا يعني أن مقارنة «Fugu Ultra ضد Fable 5» نظرية بالنسبة لمعظم المشترين: لا يمكنك ببساطة شراء Fable 5.
لذا فإن المقارنة العملية الفعلية ليست Fugu ضد Fable، بل Fugu Ultra مقابل Opus 4.8 مقابل GPT-5.5 مقابل Gemini 3.1 Pro — وهي النماذج التي تستطيع شراءها اليوم وتدور حول مجموعة Fugu. وحين ننظر إلى الجدول من هذه الزاوية، نجد Fugu Ultra يتصدّر معظم المعايير ضد هذه الثلاثة، وهو ما يجعله مرشّحاً قوياً عندما يكون Fable 5 خارج المتناول.
من زاوية الأعمال المحايدة، الدرس واضح: الوصول إلى نماذج القمة قد يتغيّر بقرار تنظيمي مفاجئ. تنويع المزوّدين ليس ترفاً بل إدارة مخاطر. نناقش هذا البعد الاستراتيجي بعمق في مقال نماذج التنسيق والسيادة الرقمية. ولا حاجة للتذكير بأن الحديث هنا عن مرونة سلسلة التوريد لا عن الالتفاف على أي قانون.
حساب التكلفة الحقيقية لكل نتيجة
الأرقام في الجدول تخفي نصف القصة. التكلفة الفعلية تتوقّف على أمرين يميّزان Fugu عن النموذج المنفرد:
أولاً، أسعار Fugu Ultra المعلنة (الدفع حسب الاستخدام): 5 دولارات للإدخال و30 دولاراً للإخراج لكل مليون توكن، ترتفع إلى 10 و45 دولاراً للسياقات الكبيرة (272 ألف توكن فأكثر). أو اشتراكات شهرية بـ 20 و100 و200 دولار.
ثانياً — وهو الأهم — تضخّم التوكنات. لأن Fugu قد يشغّل من 3 إلى 5 نماذج بالتوازي على المهمة الواحدة، فإن طلباً واحداً يستهلك 4 إلى 6 أضعاف توكنات استدعاء النموذج المنفرد. هذا يعني أن «5 دولارات لكل مليون توكن» تتحوّل عملياً إلى تكلفة أعلى بكثير لكل مهمة منجزة. أبلغ مستخدمون عن استنفاد باقة 20 دولاراً في أقل من خمس ساعات عمل نشط، وعن وصول تكلفة الرسالة الواحدة الثقيلة إلى نحو 10 دولارات.
مثال عملي مبسّط: مهمة معقّدة تستهلك في النموذج المنفرد مليون توكن إخراج (نحو 30 دولاراً بسعر Fugu Ultra المباشر). مع تضخّم التنسيق 4-6×، قد تكلّفك المهمة ذاتها بين 120 و180 دولاراً فعلياً عبر Fugu. مقابل ذلك، استدعاء Opus 4.8 أو GPT-5.5 مباشرة يكلّف توكناً واحداً لكل توكن. القاعدة: Fugu يبرّر تكلفته فقط حين تكون جودة الإجابة المنسّقة أعلى فعلاً بما يكفي ليستحق ضِعف الثمن أو أكثر — وهذا يصحّ في المهام المعقّدة، لا البسيطة.
أما إن أردت تجربة Opus أو GPT أو Gemini مباشرة بأسعار مبسّطة لتقارن بنفسك، فيمكنك الحصول على اشتراكات Claude Max و ChatGPT Plus و Gemini عبر متجر تروسكو.
كيف نقرأ الأرقام بصدق دون أن نخدع أنفسنا؟
نقطة منهجية يتجاهلها كثير من المقارنات المتسرّعة: فروق نقطة أو نقطتين في معيار واحد لا تعني تفوّقاً حقيقياً في الاستخدام اليومي. حين يسجّل Fugu Ultra 50.0 في Humanity's Last Exam مقابل 53.3 لـ Fable 5، الفارق موجود لكنه ليس فجوة هائلة. وحين يسجّل 95.5 في GPQA-Diamond مقابل 94.3 لـ Gemini 3.1 Pro، فالتقارب يجعل الاختيار بينهما يعتمد على عوامل أخرى — التكلفة، التوفّر، زمن الاستجابة — أكثر من المعيار نفسه.
الاستثناء الوحيد الذي يستحق وزناً حقيقياً هو فجوة SWE-Bench Pro: 86.0 لـ Fable 5 مقابل 73.7 لـ Fugu Ultra. هذه فجوة تزيد على اثنتي عشرة نقطة في معيار هندسة برمجيات واقعية، وهي كافية لتترك أثراً ملموساً إذا كان عملك الأساسي إصلاح أخطاء في مستودعات كود ضخمة ومعقّدة. هنا، وفي هذه الحالة تحديداً، تكون أفضلية Fable 5 جوهرية لا تجميلية.
تحذير منهجي ثانٍ: مقارنات Fable 5 و Mythos تعتمد درجات أبلغ عنها المزوّدون، لا اختباراً مباشراً موحّد الظروف. هذا يعني أن المقارنة بينها وبين Fugu ليست «وجهاً لوجه» بالمعنى العلمي الصارم، بل تجميع لأرقام من مصادر مختلفة. صانع القرار الناضج يأخذ هذا في حسبانه ولا يبني قراراً مصيرياً على فروق صغيرة بين أرقام غير متجانسة المصدر.
ما وراء المعايير: عوامل لا تظهر في الجداول
الجداول تقيس القدرة الخام، لكن قرار الشراء يتأثّر بعوامل لا يلتقطها أي معيار:
- سهولة الدمج: واجهة Fugu المتوافقة مع OpenAI تجعل التبديل شبه فوري لمن يستخدم واجهة OpenAI أصلاً. هذه ميزة عملية لا يقيسها أي benchmark.
- التوفّر الجغرافي: Fable 5 و Mythos مقيّدان بضوابط التصدير، و Fugu يستبعد الاتحاد الأوروبي. التوفّر في سوقك قد يحسم القرار قبل أي رقم أداء.
- استقرار الخدمة: أبلغ مستخدمون عن أعطال في يوم إطلاق Fugu. منتج حديث يحمل مخاطر نضج تشغيلي لا يحملها مزوّد راسخ.
- الشفافية: مع النموذج المنفرد تعرف بالضبط من عالج بياناتك. مع Fugu لا تعرف — وهذا اعتبار حاسم للقطاعات المنظَّمة.
- زمن الاستجابة: التنسيق الداخلي ومراجعة المخرجات يضيفان تأخيراً ملموساً في Fugu Ultra مقارنةً بالاستدعاء المباشر لنموذج واحد.
القرار الحكيم يوازن هذه العوامل مع الأرقام، لا يكتفي بالأرقام وحدها.
مصفوفة القرار حسب حالة الاستخدام
| حالة الاستخدام | الخيار الأقوى جودةً | الخيار الأوفر تكلفةً |
|---|---|---|
| هندسة برمجيات معقّدة (مستودعات حقيقية) | Fable 5 (إن توفّر) ثم Fugu Ultra | Opus 4.8 مباشرة |
| توليد كود وحلول برمجية | Fugu Ultra (يتصدّر LiveCodeBench) | GPT-5.5 |
| أبحاث علمية وإعادة إنتاج أوراق | Fugu Ultra (يتصدّر GPQA-D) | حسب المهمة |
| محادثة عالية الحجم وبسيطة | أي نموذج منفرد | نموذج منفرد رخيص (تجنّب Fugu) |
| مرونة ضد انقطاع مزوّد واحد | Fugu (تبديل تلقائي) | — |
المخاطر التي يجب أن تدخل في قرارك
- سقف الجودة: Fugu لا يتجاوز جودة النماذج التي يصل إليها؛ ليست سيادة بل اعتماد موزّع.
- الغموض: لا تعرف أي نموذج أنتج إجابتك، وتركيبة المجموعة غير معلنة — نقد مشروع للشفافية والامتثال.
- التكلفة الخفيّة: تضخّم التوكنات 4-6× يجعل المقارنة السعرية المباشرة مضلِّلة.
- التوفّر: Fugu يستبعد الاتحاد الأوروبي حالياً، وقد شهد أعطالاً في اليوم الأول.
- زمن الاستجابة: التنسيق أبطأ من الاستدعاء المنفرد.
سيناريوهات واقعية: أي خيار لأي فريق؟
لتحويل المقارنة من نظرية إلى قرار، إليك ثلاثة سيناريوهات تمثّل غالبية المشترين:
شركة برمجيات تبني منتجاً معقّداً. فريق هندسي يصلح أخطاء في مستودع كود ضخم يومياً. هنا تزن فجوة SWE-Bench Pro كثيراً: Fable 5 يتصدّر بـ86.0، لكنه مقيّد بالتصدير وغير متاح. الخيار العملي يصبح بين Opus 4.8 المباشر (69.2، أرخص وأبسط) و Fugu Ultra (73.7، أعلى لكن مع تضخّم تكلفة). إن كانت دقة الإصلاح حرجة وتبرّر التكلفة، Fugu Ultra يستحق التجربة؛ وإلا فالاستدعاء المباشر أوفر.
مختبر أبحاث أو فريق علم بيانات. مهام معقّدة من نوع إعادة إنتاج أوراق علمية وأسئلة على مستوى الدكتوراه. هنا يلمع Fugu Ultra: يتصدّر GPQA-Diamond بـ95.5 و CharXiv بـ86.6، وسجّل أفضل bits-per-byte في AutoResearch. لهذا الفريق تحديداً، الجودة الإضافية قد تبرّر تضخّم التكلفة، خصوصاً أن المهام أقل تكراراً وأعلى قيمة لكل نتيجة.
شركة تشغّل دعماً آلياً عالي الحجم. ملايين الردود البسيطة يومياً. هنا يكون Fugu خياراً خاطئاً تماماً: تضخّم التوكنات 4-6× سيحوّل فاتورة معقولة إلى كارثة مالية مقابل تحسّن جودة لا يلاحظه العميل. نموذج منفرد رخيص — Gemini 3.1 Pro أو GPT-5.5 — هو القرار الصحيح بوضوح.
القاعدة العابرة للسيناريوهات: كلّما زاد تعقيد المهمة وقيمتها لكل نتيجة، رجحت كفّة Fugu؛ وكلّما زاد الحجم وبساطة المهمة، رجحت كفّة النموذج المنفرد المباشر.
هل يستحق Fugu Ultra تكلفته؟ الحكم النهائي
نعم، إن كنت في المهام المعقّدة عالية القيمة (هندسة برمجيات صعبة، أبحاث، أمن سيبراني)، وتقدّر مرونة عدم الاعتماد على مزوّد واحد، وتستطيع تحمّل تضخّم التكلفة مقابل جودة أعلى. لا، إن كان عملك استعلامات بسيطة عالية الحجم، أو تحتاج شفافية كاملة، أو تتطلّب أرخص تكلفة لكل توكن — فالنموذج المنفرد المباشر أوفر وأوضح. والقرار الأهم يبقى: Fugu لا يتفوّق على Fable 5، بل يضاهيه؛ فإن كان Fable 5 متاحاً لك واحتياجك هندسة برمجيات صعبة، فهو لا يزال في الصدارة.
الأسئلة الشائعة
هل Sakana Fugu Ultra أفضل من Claude Fable 5؟
لا يتفوّق عليه إجمالاً. يتصدّر Fable 5 في SWE-Bench Pro (86.0 مقابل 73.7) و Humanity's Last Exam، بينما يتفوّق Fugu Ultra في LiveCodeBench و Terminal Bench و GPQA-Diamond. الوصف الأدق: يقفان كتفاً بكتف، وSakana نفسها لا تدّعي التفوّق.
ما الفرق بين Fugu Ultra و Mythos Preview؟
Mythos Preview نموذج حدودي من Anthropic مقيّد بضوابط التصدير وغير متاح للعموم، يُستخدم كمرجع. Fugu Ultra نموذج منسّق متاح للشراء، يضاهي أداء النماذج الحدودية عبر تنسيق نماذج أخرى متاحة بدلاً من امتلاك نموذج حدودي خاص.
أيهما أرخص: Fugu Ultra أم Claude أم GPT؟
ظاهرياً أسعار Fugu Ultra (5/30 دولاراً لكل مليون توكن) تنافسية، لكن تضخّم التنسيق 4-6× يجعل التكلفة الفعلية لكل مهمة أعلى من استدعاء Opus أو GPT المباشر. للمهام البسيطة، النموذج المنفرد أوفر بوضوح.
ما نتائج معايير الأداء لـ Fugu Ultra؟
أبرزها: LiveCodeBench 93.2، GPQA-Diamond 95.5، Terminal Bench 82.1، CharXiv 86.6، SWE-Bench Pro 73.7، Humanity's Last Exam 50.0. يتصدّر أربعة من ستة معايير مقارنةً بالنماذج المنشورة.
لماذا لا يستخدم Fugu نموذج Fable 5 داخل مجموعته؟
لأن Fable 5 مقيّد بضوابط التصدير الأمريكية منذ 12 يونيو 2026 وغير متاح للعموم. لذلك يضاهي Fugu أداءه عبر تنسيق نماذج أخرى متاحة، لا عبر استدعائه مباشرة.
هل يستحق Fugu Ultra تكلفته للشركات؟
يستحقها في المهام المعقّدة عالية القيمة حيث تبرّر الجودة الأعلى تضاعف التكلفة. لا يستحقها في الاستعلامات البسيطة عالية الحجم، حيث يلتهم تضخّم التوكنات الميزانية مقابل فائدة محدودة.
ما تأثير ضوابط التصدير على توفّر Claude Fable 5؟
منذ 12 يونيو 2026 صار Fable 5 و Mythos غير متاحين للعموم في كثير من الأسواق بسبب القيود. عملياً، هذا يحوّل المقارنة معهما إلى مقارنة نظرية، ويجعل الخيار الواقعي بين Fugu و Opus و GPT و Gemini.
هل يمكنني الوصول إلى Fable 5 و Mythos في 2026؟
ليس للعموم في معظم الأسواق بعد قيود 12 يونيو 2026. هذا بالضبط جزء من جاذبية Fugu: يقدّم أداءً مماثلاً عبر نماذج متاحة، مع مرونة التبديل إن انقطع أي مزوّد.
الخلاصة
المقارنة بين Fugu Ultra و Fable 5 تنتهي بحكم متوازن: تكافؤ في الأداء العام مع تفوّق متبادل حسب المعيار، وأفضلية حاسمة لـ Fugu في الوصول العملي لأن منافسه مقيّد. لكن لا تدع الأرقام تخفي السؤال الأهم — التكلفة الحقيقية لكل مهمة، حيث يغيّر تضخّم التنسيق المعادلة جذرياً. أفضل قرار هو الذي تتّخذه بعد تجربة مباشرة: اختبر نماذج القمة عبر متجر تروسكو، أو جرّب أدوات الذكاء الاصطناعي المجانية، وقارن المخرجات على مهامك الفعلية قبل أن توقّع أي اشتراك.