أعلنت جوجل يوم 26 أغسطس 2026 عن نموذج Gemini 3.5 Transcribe، أحدث نماذج تحويل الكلام إلى نص وأدقها في تاريخ الشركة، وهو مصمم لينتج نصاً منقحاً ومنسقاً مباشرة من الصوت الخام بدلاً من مجرد تفريغ حرفي مليء بالتكرار والحشو. الإعلان جاء على المدونة الرسمية لجوجل من فريق Gemini Audio، ويضع النموذج أمام المطورين في معاينة عامة عبر Gemini API، وفي الوقت نفسه يبدأ وصوله تدريجياً لمستخدمي تطبيقات جوجل اليومية. في هذا الدليل نشرح ما الذي يميز النموذج، وأرقام الدقة الرسمية، وكيف تستخدمه من الخليج اليوم، وما حدوده الصادقة قبل أن تتسرع بالاعتماد عليه.

المصدر: مدونة جوجل الرسمية

المصدر: مدونة جوجل الرسمية
ما هو Gemini 3.5 Transcribe بالضبط؟
الفرق الجوهري بينه وبين أنظمة التعرف على الكلام التقليدية أن جوجل تصفه بأنه "أدق نموذج تحويل كلام إلى نص حتى الآن" مصمم للتفاعلات الصوتية الذكية. الأنظمة التقليدية تتعثر مع الضوضاء والمصطلحات المتخصصة وتفريغ الترددات اللغوية، بينما يحوّل Gemini 3.5 Transcribe الصوت الخام مباشرة إلى نص دقيق ومصقول ومنسق. هذا يعني عملياً أن تسجيلاً صوتياً لمحاضرة أو اجتماع يخرج لك نصاً جاهزاً للقراءة، لا مسودة تحتاج ساعات تحرير.
الأرقام الرسمية: دقة تقترب من الكمال
جاءت أرقام الأداء في الإعلان الرسمي محددة وواضحة، مقيسة عبر جهة القياس المستقلة Artificial Analysis:
- نسبة خطأ الكلمة (WER): 4.0% في البث المباشر و2.6% في معالجة التسجيلات — أي دقة تتجاوز 95% في أسوأ الأحوال.
- على مقياس FLEURS عبر مجموعة من أهم اللغات: 5.50% بثاً مباشراً و5.04% تسجيلاً، متفوقاً على النموذج السابق Chirp 3.
- زمن الوصول إلى النص النهائي أسرع بنسبة 70% من Chirp 3، وهو الفارق الذي يهم في التطبيقات الحية مثل الترجمة الفورية للعروض والمحادثات.
- النموذج يتعامل بثبات مع البيئات الصاخبة الواقعية، ويلتقط الكيانات الحرفية والرقمية بدقة مثل الرموز البريدية وأرقام الطلبات.
ست قدرات تجعله مختلفاً
- التفريغ الذكي: يحذف كلمات الحشو تلقائياً ("إي"، "يعني"، umm)، ويفهم التصحيح الذاتي فوراً — إذا قلت "نجتمع الثلاثاء — لا، الأربعاء" كتب الأربعاء فقط — وينسق النص تلقائياً بعناوين ونقاط.
- استدعاء الدوال (Function Calling): النموذج لا يفرّغ فقط، بل يستطيع تفويض مهام معقدة — توليد صورة أو تحليل ملف — إلى نماذج جيميناي الأخرى. المتاح حالياً في تطبيق Gemini على macOS.
- المفردات المخصصة: تزوّده بقاموس مصطلحات شركتك أو مجالك فيلتزمها في التفريغ — مفيد جداً للمجالات الطبية والقانونية والتقنية.
- دعم أكثر من 85 لغة بالكشف التلقائي، مع تعامل صريح مع "اللهجات واللكنات الإقليمية المتنوعة" بحسب جوجل، وتبديل اللغة حياً في منتصف الجملة دون تقطيع البث.
- تحديد المتحدثين: في التسجيلات يُنسَب الكلام إلى كل متحدث مع طوابع زمنية دقيقة على مستوى الكلمة، لما يصل إلى ثلاثة متحدثين بشكل مستقر (وأكثر من ذلك تجريبي).
- بيئتان للمطورين: بث حي ثنائي الاتجاه بزمن استجابة أقل من ثانية عبر Live API بنموذج
gemini-3.5-transcribe-live، ومعالجة التسجيلات عبر Interactions API بنموذجgemini-3.5-transcribeمع نسبة كل متحدث وطوابع زمنية.
ماذا يعني هذا لك في الخليج والعالم العربي؟
- للطلاب: تفريغ المحاضرات الصوتية إلى ملخصات منظمة صار أسرع وأدق، والنموذج يدعم العربية ضمن أكثر من 85 لغة. إن كنت تستخدم جيميناي في دراستك أصلاً، فاطلع على عرض جيميناي المجاني للطلاب لعام كامل الذي تغطيه في دليل سابق.
- للمهنيين: اجتماعاتك ومكالماتك يمكن تحويلها إلى محاضر جاهزة بتمييز المتحدثين — والاتجاه هنا يتكامل مع ميزات Gemini Live الإنتاجية الجديدة المعلنة في اليوم نفسه.
- للمطورين في المنطقة: النموذج في معاينة عامة عبر Google AI Studio وجوجل أنتغرافيتي، ويمكن البناء عليه في وكلاء صوتيين وترجمة فورية وتحليلات ما بعد المكالمات. شركات مثل Vivo وLingopal وIntellitek Health شاركت شهادات مبكرة إيجابية حول زمن الاستجابة والدقة واتساع اللغات.
- للباحثين عن بديل عربي مفتوح: لدينا مقال مستقل عن Cohere Transcribe العربي: أدق نموذج مفتوح المصدر لتحويل الكلام العربي إلى نص — والخياران لا يتنافسان: جوجل للخدمة السحابية الجاهزة، والمفتوح للتشغيل الذاتي والخصوصية.
مقارنة سريعة: Gemini 3.5 Transcribe مقابل البدائل
| المعيار | Gemini 3.5 Transcribe | Chirp 3 (السابق) | Cohere Transcribe (مفتوح) |
|---|---|---|---|
| نسبة الخطأWER بثاً | 4.0% | أعلى — النموذج الجديد يتفوق رسمياً | غير معلن بنفس المقياس |
| زمن النص النهائي | أسرع بـ70% من Chirp 3 | الأساس المرجعي | حسب بنيتك التحتية |
| حذف الحشو والتنسيق | تلقائي | غير متاح كميزة أساسية | يتطلب معالجة لاحقة |
| اللغات | 85+ لغة بكشف تلقائي | أقل تغطية | تركيز عربي |
| التشغيل | سحابي (جوجل) | سحابي (جوجل) | مفتوح المصدر — تشغيل ذاتي |
كيف تستخدمه اليوم — خطوة بخطوة
- كمطور: افتح Google AI Studio وفعّل نمط Build، واختر نموذج التفريغ المناسب (
gemini-3.5-transcribeللتسجيلات أو-liveللبث). النموذج في معاينة عامة. - كمستخدم أندرويد: ميزة Rambler الجديدة في لوحة مفاتيح Gboard تحول كلامك الطويل إلى نص منسق وتحذف الحشو، وتتيح التعديل الصوتي للنص — متاحة في دول ولغات مختارة تتوسع تدريجياً.
- كمستخدم Mac: تطبيق Gemini على macOS يفرّغ كلامك الحر نصاً نظيفاً وينفذ أوامر صوتية بسياق الشاشة، بالإنجليزية حالياً.
- متصفح Chrome: ميزة "تحدث ليكتب في أي حقل ويب" قادمة قريباً وفق جوجل.
ثلاث حالات استخدام تستحق التجربة هذا الأسبوع
حالة الطالب الجامعي: سجل محاضرة صباحية مدتها تسعون دقيقة، وارفعها للمعالجة عبر Interactions API أو جرّبها في AI Studio. المخرج المتوقع: نص مقسم بعناوين، حشو الكلام محذوف، وأسئلة الطلبة المتداخلة منسوبة لمتحدثين مختلفين بطوابع زمنية — أي مادة مراجعة جاهزة قبل الاختبار بدل ثلاث ساعات تفريغ يدوي.
حالة المهني في الاجتماعات: مكالمة فريق مع ثلاثة متحدثين رئيسيين تتحول إلى محضر بنسب متحدثين ("تحدث المدير 60% من الوقت")، وهذه النسب وحدها تكشف ديناميكيات اجتماعاتك. أضف المفردات المخصصة لمصطلحات شركتك وستختفي أخطاء أسماء المنتجات والمشاريع من المحاضر نهائياً.
حالة صانع المحتوى: البودكاست بالعربية والحلقات الطويلة أصبحت قابلة للتحويل إلى مقالات وقوائم زمنية قابلة للنقر، خاصة مع تبديل اللغة الحي — مفيد جداً للحلقات التي تمزج العربية والإنجليزية في جملة واحدة، وهي الشائعة في المحتوى التقني الخليجي.
لماذا هذا الإعلان مهم الآن؟
سوق التفريغ الصوتي كان حتى الشهر الماضي سوقاً مشتتاً: أدوات تفريغ حرفي رخيصة، وأدوات "ذكية" غالية وبطيئة، وحلول مفتوحة تحتاج خبرة تقنية. بدخول جوجل بنموذج يجمع الدقة المرجعية (خطأ 2.6% في التسجيلات) مع التنقيح التلقائي والتعامل مع 85+ لغة في خدمة واحدة، تنضغط الفجوة: الأدوات الوسطى التي تعيش على "تفريغ + تنقيح يدوي" ستضغط أسعارها أو تختفي، والمستفيد النهائي هو المستخدم. والمفاضلة المتبقية حقيقية واحدة: من يريد التحكم الكامل في بياناته الصوتية بعيداً عن السحابة، يبقى في المعسكر المفتوح، ومن يريد الجاهزية والدقة فالخدمة السحابية الرسمية صارت الخيار الوجيه.
حدوده الصادقة قبل الاعتماد عليه
- تطبيق Gemini على macOS يعمل بالإنجليزية فقط حتى الآن، وRambler على أندرويد متاح في دول ولغات مختارة — أي أن وصوله الكامل للعربية على هذه الأسطح ليس مضموناً اليوم، رغم أن النموذج نفسه يدعم العربية عبر الواجهات البرمجية.
- النسخة الموجهة للجمهور في بداياتها؛ المؤسسات تحصل عليها عبر Gemini Enterprise Agent Platform وسيتم إطلاقها قريباً في Gemini Enterprise for Customer Experience.
- تحديد أكثر من ثلاثة متحدثين لا يزال تجريبياً رسمياً.
- جوجل لم تنشر جدول أسعار مستقلاً للنموذج في إعلان الإطلاق؛ التسعير يتبع بنود Gemini API المعلنة على صفحات جوجل للأسعار — تحقق منها قبل المشاريع الكبيرة، ولا تعتمد على أرقام متناقلة.
أسئلة شائعة
هل يدعم Gemini 3.5 Transcribe اللغة العربية؟
نعم، النموذج يدعم أكثر من 85 لغة بالكشف التلقائي مع تعامل مع اللهجات، والعربية ضمن تغطية FLEURS متعددة اللغات التي أعلنت عنها جوجل.
ما الفرق بينه وبين التفريغ العادي في تطبيق جيميناي؟
التفريغ الذكي هنا ينقّح وينسّق ويحذف الحشو ويفهم التصحيح الذاتي، ويمكنه تفويض مهام لنماذج أخرى، بينما التفريغ التقليدي ينقل الكلام حرفياً تقريباً.
هل النموذج مجاني؟
المعالجة عبر Gemini API في معاينة عامة وتخضع لتسعير جوجل المعلن لواجهاتها البرمجية، أما أسطح المستخدم مثل Rambler وتطبيق macOS فتأتي ضمن منتجات جوجل المجانية وخططها المدفوعة حسب السطح.
متى يصل التحدث بالكتابة إلى متصفح Chrome؟
أعلنت جوجل أنها "قادمة قريباً" دون تاريخ محدد، وستتيح الإملاء في أي حقل ويب.
هل يصلح لتفريغ اجتماعات متعددة المتحدثين؟
نعم لما يصل إلى ثلاثة متحدثين بشكل مستقر مع طوابع زمنية ونسبة كلام لكل متحدث، وما فوق ذلك تجريبي.