GPT-Live-1 من OpenAI في الـ API: نموذج صوتي يستمع ويتحدث في نفس الوقت

GPT-Live-1 في الـ API من OpenAI: نموذج صوتي مزدوج الاتجاه بـ 0.05 دولار للدقيقة، يتفوق على GPT-Realtime-2.1 بـ 30 نقطة — الجداول الكاملة للمطورين والشركات وحالات الاستخدام.

GPT-Live-1 من OpenAI في الـ API: نموذج صوتي يستمع ويتحدث في نفس الوقت
Table of contents

GPT-Live-1 من OpenAI في الـ API: نموذج صوتي يستمع ويتحدث في نفس الوقت

آخر تحديث: سبتمبر 2026

خمسة سنتات للدقيقة الواحدة، وثلاثون نقطة مئوية فوق سابقه في مقياس الحوار المزدوج — هذه أبرز أرقام إطلاق GPT-Live-1 في واجهة OpenAI للبرمجة، المعلن يوم 10 سبتمبر 2026. النموذج الصوتي الجديد متاح اليوم للمطورين في الـ API، وهو أول نموذج تطرحه الشركة «يستمع ويتحدث في اللحظة نفسها» بمعمارية نموذج واحد بدلاً من سلسلة أدوات متراصة. للسوق العربي تحديداً، هذا الإطلاق يعني أن بناء مزود خدمة صوتي يتحدث العربية الطبيعية أصبح أقرب وأرخص مما كان قبل أسبوع.

بانر الإعلان الرسمي عن GPT-Live-1 من صفحة OpenAI

المصدر: OpenAI — صفحة الإعلان الرسمية

ما هو GPT-Live-1؟

نموذج صوتي «مزدوج الاتجاه بالكامل» (full-duplex): قناة الاستماع وقناة الكلام تعملان معاً في آن واحد، تماماً كما يتحادث بشر اثنان. سابقاً قدّمت OpenAI هذا المستوى من الحوار في واجهة ChatGPT للمستخدمين العاديين — راجع تغطيتنا له في: GPT-Live ميزة الصوت الجديدة في ChatGPT. الجديد اليوم أن القدرة نفسها انتقلت إلى الـ API، أي أن أي مطور أو شركة تستطيع بنائها داخل منتجاتها الخاصة.

المعمارية هي جوهر الفرق. الأنظمة الصوتية السائدة سلسلة من ثلاث مراحل: تحويل الكلام لنص، ثم معالجة نصية، ثم تحويل النص لكلام. GPT-Live-1 يستبدلها بنموذج واحد يستنتج مباشرة على الصوت الداخل والصوت الخارج معاً، ولهذا يستطيع أن يُقاطَع ويستأنف ويحترم طبقات الحوار الطبيعية.

المعيار سلسلة STT→LLM→TTS التقليدية GPT-Live-1
عدد النماذج ثلاثة مكونات متراصة نموذج واحد للصوت
الاستماع أثناء الكلام غير ممكن عملياً أصلي (full-duplex)
المقاطعة الطبيعية تأخير ملحوظ معالجة فورية بنموذج واحد
العقل المدبّر النموذج النصي الوسطي تفويض لنموذج خلفي مثل GPT-6 Astra
الضوضاء والصمت تفكك السلسلة إدارة أصلية دون سرد كل خطوة

الأرقام التي تهم المطور

المقياس نتيجة GPT-Live-1 المقارنة المعلنة
Full Duplex Bench +30 نقطة مئوية فوق GPT-Realtime-2.1
ترتيب Tau3 الأول مع GPT-6 Astra بجهد استدلال medium
تكرار المقاطعات (Early Speak) انخفاض ~80% مقابل أنظمة الأدوار السابقة
تقييمات خدمة العملاء نتائج Pass@1 طيران وتجزئة واتصالات
المعرفة المصرفية 97 مهمة تقييمات قطاع مصرفي

التسعير المعلن: 0.05 دولار للدقيقة عن طبقة الصوت الأمامية — الاستماع والكلام وإدارة الحوار — بينما الأصوات المخصصة للعلامات التجارية تتطلب التواصل مع فريق المبيعات. وحساب التكلفة التقريبي يصنع الفارق في دراسة الجدوى:

الوحدة الزمنية تكلفة طبقة الصوت فقط
دقيقة واحدة 0.05$
ساعة كاملة 3$
1,000 دقيقة (نحو 17 ساعة) 50$
مركز اتصال: 10,000 دقيقة شهرياً 500$

هذه أرقام طبقة الصوت وحدها؛ النموذج الخلفي الذي يتولى الاستدلال العميق — ويمكن أن يكون GPT-6 Astra أو نموذج طرف ثالث — يُحاسَب وفق تسعيره الخاص، ويبقى اختيار جهد الاستدلال بيد المطور لموازنة الجودة مقابل التكلفة.

كيف يعمل من الداخل؟

التفصيل الأنيق في التصميم هو فصل «الصوت» عن «العقل». GPT-Live-1 يتولى الطبقة الصوتية بكل ما فيها: إيقاع الحوار، المقاطعة، نبرة الحديث التي تُضبط عبر system prompt، التعامل مع الضوضاء الخلفية وفترات الصمت دون أن يسرد كل خطوة، والموثوقية في الجلسات الطويلة. أما الاستدعاءات المنطقية واستخدام الأدوات فيفوّضها لنموذج نصي خلفي تختاره أنت — وقد فصّلنا قدرات النموذج الأبرز المرشح لهذا الدور في: إطلاق GPT-6 Astra: السعر والمواصفات.

فيديو OpenAI الرسمي المرافق لإعلان GPT-Live-1 في الـ API

المصدر: OpenAI — صفحة الإعلان الرسمية

على مستوى الإدخال، يقدّم النموذج نصوص ASR أصلية ونص الرد وكشف أدوار المتحدثين، مع فهم الأرقام والحروف المسموعة (alphanumeric) وانحياز الكلمات المفتاحية (keyword biasing) — تفاصيل صغيرة تصنع الفارق في أرقام الحسابات وأسماء العملاء ومصطلحات كل قطاع. وللأحمال الهاتفية، دعم telephony يعني وكلاء مكالمات حقيقيين على خطوط الهاتف العادية لا عبر تطبيقات فقط.

ماذا يعني هذا للمطور العربي والشركات الخليجية؟

القطاعات الثلاثة التي قاستها OpenAI في إعلانها — الطيران والتجزئة والاتصالات — هي نفسها أعمدة خدمة العملاء في المنطقة. أضف إليها التقييم المصرفي (97 مهمة معرفية مصرفية) وتصبح الصورة واضحة: البنوك وشركات الاتصالات والتوصيل في الخليج هي العميل الطبيعي لهذه التقنية، حيث تُدار ملايين الدقائق الصوتية شهرياً بمقاييس جودة صارمة.

وحيث إن النموذج يوسّع مكتبة الأصوات عبر لكنات ولغات متعددة مع وعود بالمزيد في الأشهر المقبلة، تدخل لهجاتنا العربية في نطاق التغطية التصاعدي — والمطور العربي مطالب اليوم بالتجربة المبكرة لا بالانتظار: من يبني خبرة تشغيلية في الحوار المزدوج الآن يسبق السوق عندما تنضج التغطية اللهجية الكاملة.

للبداية التقنية: دليل Live API الرسمي على developers.openai.com هو نقطة الانطلاق، والنموذج متاح أيضاً عبر منصة OpenAI Presence نفسها لغير المطوّرين المحترفين.

أربع حالات استخدام جاهزة للانطلاق

1. خط دعم عملاء بالاتصال المباشر. دعم telephony المدمج يعني أن الوكيل الصوتي يجيب على خط هاتف حقيقي: يستقبل المكالمة، يفهم الطلب بلهجة المتصل، يراجع بياناته عبر الأدوات، ويسمع مقاطعته فوراً إذا غيّر رأيه. شركات الاتصالات والتوصيل في المنطقة تدير ملايين هذه الدقائق شهرياً، وجدول التكلفة أعلاه يحوّل كل ألف دقيقة إلى خمسين دولاراً فقط عن طبقة الصوت.

2. مساعد مكتبي صوتي داخلي. الموظف يحدّث النظام أثناء العمل بيدين مشغولتين — في المستودع أو المختبر أو المركبة — والوكيل يملي عليه التأكيدات ويقرأ له المعلومات. الجلسات الطويلة الموثوقة وواجهة ASR الأصلية تجعل التدقيق اللاحق سهلاً عبر النصوص المتزامنة.

3. منصة تعليم لغوي محادثية. أثمن ما في الحوار المزدوج للمتعلم هو الشعور بالطبيعية: يقاطع، يُقاطَع، يعيد الصياغة. النبرة القابلة للضبط عبر system prompt تصنع معلماً صبوراً بإيقاع مناسب للمبتدئين، وفهم الأرقام والحروف المسموعة يحل أخطاء التهجئة الشائعة في التمارين.

4. استقبال المواعيد للعيادات والخدمات. الميزة الصغيرة التي تُنسى دائماً هي إدارة الصمت: النموذج لا يسرد كل خطوة ولا ينفجر ضحكاً عند ضوضاء الخلفية، بل ينتظر ويسأل — وهو سلوك بالغ الأهمية في المكالمات الخدمية حيث ينشغل المتصل بالبحث عن رقم ملفه.

في الحالات الأربع، القاعدة الهندسية نفسها: ابدأ بنطاق ضيق (عشرة أنواع أسئلة مثلاً)، قِس نسبة الحل دون تدخل بشري، ثم وسّع. النموذج الخلفي القابل للاستبدال يتيح ترقية «العقل» دون إعادة بناء «الصوت».

الأسئلة الشائعة

ما هو GPT-Live-1 من OpenAI؟

نموذج صوتي مزدوج الاتجاه أُطلق في واجهة البرمجة يوم 10 سبتمبر 2026، يستمع ويتحدث في اللحظة نفسها عبر نموذج واحد بدلاً من سلسلة تحويلات منفصلة، مع تفويض التفكير العميق لنماذج خلفية نصية يختارها المطور مثل GPT-6 Astra.

كم سعر GPT-Live-1 في الـ API؟

خمسة سنتات أمريكية للدقيقة الواحدة عن طبقة الصوت الأمامية — أي ثلاثة دولارات للساعة — بينما تُحاسَب استدعاءات النموذج الخلفي وفق تسعيره المعتاد. الأصوات المخصصة للعلامات التجارية تتطلب اتفاقاً مع فريق المبيعات.

ما الفرق بين GPT-Live-1 وGPT-Realtime؟

GPT-Live-1 يتفوق على GPT-Realtime-2.1 بثلاثين نقطة مئوية في مقياس Full Duplex Bench، ويقلّص المقاطعات الفاشلة بنحو 80% مقارنة بأنظمة الأدوار السابقة، بفضل معمارية النموذج الواحد التي تدير الصوت الداخل والخارج معاً.

هل يدعم GPT-Live-1 اللغة العربية؟

وسّعت OpenAI مكتبة أصوات النموذج عبر لكنات ولهجات ولغات متعددة وأعلنت أن المزيد قادم في الأشهر المقبلة، دون قائمة لغات تفصيلية مرافقة للإعلان؛ والتجربة العملية عبر الـ API هي المرجع الأدق لحالة العربية حالياً.

كيف أبدأ باستخدام GPT-Live-1 في تطبيقي؟

من دليل Live API على developers.openai.com: فعّل الوصول في حسابك، اختر النموذج الصوتي، وحدد النموذج الخلفي المسؤول عن الاستدلال — يمكن أن يكون GPT-6 Astra أو نموذج طرف ثالث — ثم اضبط النبرة والأسلوب عبر system prompt.

المصادر

ماذا نتظر في الأسابيع المقبلة؟

الأرجح ثلاثة أمور: توسع قائمة اللغات واللهجات المعلنة، ومرجعية تسعير أوضح للأحجام الكبيرة مع نضوج التبني، وظهور منافسة مباشرة من محركات الحوار المزدوج لدى Google وغيرها. المؤكد أن خفض حاجز الصوت الطبيعي إلى خمسة سنتات للدقيقة ينقل تجربة «الموظف الصوتي» من تجارب المختبرات إلى دراسات جدوى فعلية — والفرص الأقرب ربحاً هي دائماً لمن جرّب أولاً وبنى خبرته قبل أن يكتظ السوق. إن كنت تبني منتجاً طلابياً أو بحثياً وتريد بيئة موحدة تجمع الأدوات والفرص، فجرّب ما يقدمه Truescho من منح وأدوات دراسية مجانية.