أطلقت شركة Cohere في 7 يوليو 2026 نموذج Cohere Transcribe Arabic كأول نموذج مفتوح المصدر متخصص في تحويل الكلام العربي إلى نص (ASR)، مصمم خصيصاً للتعامل مع تحديات اللغة العربية في بيئات العمل: تنوع اللهجات، والخلط بين العربية والإنجليزية في الكلام (code-switching).
ما هو Cohere Transcribe Arabic؟
نموذج ذكاء اصطناعي بحجم 2 مليار معامل (2B parameters) يعتمد على معمارية encoder-decoder: FastConformer لمعالجة الإشارات الصوتية، مع Transformer decoder خفيف لإنشاء النص. النموذج متاح مفتوح المصدر على HuggingFace ويمكن استخدامه عبر Cohere API.
الأرقام الرئيسية
- معدل خطأ الكلمات (WER): 25.87% على معيار Hugging Face Arabic ASR Leaderboard — الأفضل عالمياً بين النماذج مفتوحة المصدر
- تفوق على Meta OmniASR-LLM-7B بفارق 2.45 نقطة (28.32%)
- تفوق على OpenAI Whisper v3 Large بفارق 11 نقطة كاملة (36.87%)
- السرعة: RTFx 525 مقابل 146 لـ Whisper و66 لـ OmniASR (أسرع بنحو 3.6 مرة من Whisper)
- التقييم البشري: مفضّل على Whisper في 95.8% من الحالات

لماذا هذا النموذج مهم للمستخدم العربي؟
المشكلة التي عاناها العرب مع نماذج ASR السابقة هي ثلاثية:
- تسطيح اللهجات: النماذج الحالية تحول كل لهجة إلى فصحى، مما يفقد معنى الكلام الأصلي
- ضعف code-switching: عندما يخلط المتحدث بين العربية والإنجليزية (كما يحدث في بيئة العمل)، تتعثر النماذج
- إهمال اللهجات غير الفصحى: مئات الملايين يتحدثون بلهجات (خليجية، مصرية، شامية، مغاربية) لا يغطيها أي نموذج بشكل كافٍ
Cohere Transcribe Arabic عالج هذه المشاكل عبر:
- توزيع متوازن للهجات: إعادة توزيع العينات عبر مجموعات اللهجات لمنع هيمنة لهجة واحدة
- كلام ثنائي اللغة حقيقي: بيانات تعكس كيف يتحدث العرب في بيئات العمل فعلاً
- ظروف تسجيل متنوعة: أجهزة وبيئات وضوضاء مختلفة

ماذا يعني هذا لك؟
للمطورين والشركات في الخليج
- تحميل مجاني: أوزان النموذج متاحة على HuggingFace
- استضافة ذاتية: يمكنك تشغيل النموذج على خوادمك الخاصة باستخدام vLLM
- Cohere API: متاح مع free tier
- سرعة الإنتاج: RTFx 525 يعني قدرة على معالجة كمية كبيرة من الصوتيات في وقت قياسي
للصحفيين والباحثين
- تفريغ المقاطع الصوتية: تحويل المقابلات والندوات باللهجات إلى نصوص بدقة عالية
- أرشفة المحتوى: تفريغ البودكاست والمحاضرات تلقائياً
القيود المعروفة
- النموذج يحتاج language tag (عربي أو إنجليزي) ليعمل بشكل صحيح
- لا يدعم الطوابع الزمنية (timestamps) في الإصدار الحالي
- لا يدعم فصل المتحدثين (speaker diarization)
- قد يحول ضوضاء الخلفية المنخفضة إلى كلام خيالي — يُنصح باستخدام VAD قبل النموذج
مقارنة سريعة
| المعيار | Cohere Transcribe Arabic | Whisper v3 Large | OmniASR-LLM-7B |
|---|---|---|---|
| WER (أقل أفضل) | 25.87% | 36.87% | 28.32% |
| الحجم | 2B | ~1.5B | 7B |
| السرعة (RTFx) | 525 | 146 | 66 |
| مفتوح المصدر | نعم | نعم | نعم |
| دعم اللهجات | ممتاز | ضعيف | متوسط |
| code-switching | ممتاز | ضعيف | ضعيف |
كيف تبدأ؟
- جرّب النموذج على HuggingFace Spaces قبل التحميل
- حمّل الأوزان من HuggingFace:
CohereLabs/cohere-transcribe-arabic-07-2026 - استخدم Cohere API مع free tier للاختبار
- للنشر الإنتاجي: استخدم vLLM مع noise gate للحصول على أفضل النتائج
المصدر الأساسي: مدونة Cohere على HuggingFace — تاريخ النشر: 7 يوليو 2026