أطلقت شركة Lightricks الإسرائيلية المطورة لتطبيق Facetune الشهير، نموذج LTX-2.5 المفتوح للأوزان بحجم 22 مليار معامل في 11 أغسطس 2026، بالتعاون مع NVIDIA ضمن مبادرة الذكاء الاصطناعي المحلي. النموذج يقدم ميزة فريدة: التوليد متعدد المشاهد (multishot) في عملية واحدة، مع الحفاظ على استمرارية الشخصيات والإضاءة والصوت عبر اللقطات المتتالية.

المصدر: Unsplash — يمثل مفهوم إنتاج الفيديو بالذكاء الاصطناعي
ما هو LTX-2.5؟
LTX-2.5 هو نموذج Diffusion Transformer (DiT) مفتوح الأوزان من شركة Lightricks، مصمم للتوليد المحلي والضبط الدقيق. يولّد النموذج فيديو وصوت عالي الدقة ومتزامن من النصوص والصور والفيديو. تم نشر ورقة بحثية عن النموذج تحت عنوان "LTX-2: Efficient Joint Audio-Visual Foundation Model" على arXiv في يناير 2026.
النموذج متاح بترخيص LTX-2 Community License، وهو مجاني للكيانات التي يقل إيرادها السنوي عن 10 ملايين دولار، مع ترخيص مدفوع للشركات الأكبر.
الميزات الثورية
التوليد متعدد المشاهد (Native Multishot)
هذه هي الميزة الأهم: بدلاً من توليد لقطة واحدة مستمرة، يستطيع LTX-2.5 إنتاج عدة مشاهد متصلة في عملية توليد واحدة. يحافظ النموذج على هوية الشخصيات والإضاءة والصوت وأسلوب التصوير عبر اللقطات المتتالية. هذا يعني أنك تستطيع كتابة سيناريو بسيط بثلاثة مشاهد والحصول على فيديو متماسك يحكي قصة كاملة.
مشغّل نصوص مخصص Gemma 4 12B
يستخدم النموذج مشغّل نصوص مخصص من نوع Gemma 4 12B مع طبقات إسقاط، مصمم خصيصاً للاحتفاع بالأوصاف المعقدة (شخصيات متعددة، حركات كاميرا، إضاءة) دون فقدان التفاصيل.
محسّن لبطاقات NVIDIA RTX
يتوفر النموذج بعدة صيغ:
- BF16: الجودة الكاملة للtraining والضبط الدقيق
- INT8: للأجهزة المحدودة (ComfyUI فقط)
- NVFP4: لبطاقات Blackwell
على بطاقة RTX 6000 PRO، يحقق النموذج أداءً أسرع بنسبة 20% وتوفير في الذاكرة بنسبة 40%.
معالج الفيديو الجديد (Diffusion Video Decoder)
يستبدل LTX-2.5 معالج VAE التقليدي بمعالج diffusion جديد للفيديو ينتج وجوهاً أكثر وضوحاً، نسيجات أفضل، نصاً أوضح على الشاشة، وحركة أكثر سلاسة مع عدد أقل من التشوهات البصرية. هذا تحسين تقني مهم لأن معالج VAE كان نقطة ضعف في نماذج توليد الفيديو السابقة.
التخصيص الديناميكي للحساب
ميزة "العرض بالجودة الكاملة" (diffusion fidelity rendering) تخصص قوة الحوسبة ديناميكياً حسب تعقيد المشهد والميزانية المتاحة. هذا يعني أن المشاهد البسيطة تُولّد بسرعة، بينما المشاهد المعقدة (متعددة الشخصيات، إضاءة معقدة) تحصل على حساب إضافي لضمان الجودة.
تنبؤ المدة (Duration Predictor)
ميزة اختيارية تنبئ بطول المقطع من الوصف النصي تلقائياً، مما يلغي الحاجة لتحديد عدد الإطارات يدوياً. هذا مفيد للمستخدمين الذين لا يعرفون التقنيات الدقيقة لتوليد الفيديو.
محسّن الأوصاف (Prompt Enhancer)
يضم النموذج محسّن أوصاف يوسع الأوصاف القصيرة إلى تعليمات سينمائية أكثر ثراءً، مما يساعد المستخدمين الذين لا يجيدون كتابة prompts المعقدة.
ماذا يعني هذا لك؟
لصناع المحتوى والمنشئين العرب
إنتاج قصص كاملة: الميزة متعددة المشاهد تعني أن صانع المحتوى العربي يمكنه إنتاج فيديو قصير يحكي قصة متكاملة — وليس مجرد لقطة واحدة متحركة. هذا مناسب جداً لمحتوى Instagram Reels و YouTube Shorts الذي يزداد شعبية في الخليج.
الصوت والصورة معاً: مثل MiniMax-H3، يولّد LTX-2.5 الصوت والصورة معاً، لكن مع ميزة تعدد المشاهد المضافة.
تخصيص كامل: كون النموذج مفتوح الأوزان وقابل للضبط الدقيق، يمكنك تدريبه على أنماط بصرية محددة تناسب جمهورك العربي.
للمطورين والشركات
التشغيل المحلي: النموذج يعمل محلياً بالكامل، مما يضمن خصوصية البيانات والتحكم الكامل في المخرجات.
التكامل عبر ComfyUI: يتكامل النموذج بسلاسة مع ComfyUI، مما يتيح دمجه في سير عمل الإنتاج الحالي.
API قابلة للبرمجة: بالإضافة إلى ComfyUI، يوفر النموذج مكتبة Python (ltx-pipelines) للتشغيل المباشر، و diffusers pack للتكامل البرمجي.

الصورة: Unsplash — تمثل مفهوم التوليد متعدد المشاهد
مقارنة سريعة: LTX-2.5 مقابل المنافسين
| الميزة | LTX-2.5 | MiniMax-H3 | Sora | Runway Gen-3 |
|---|---|---|---|---|
| تعدد المشاهد | ✅ أصلي | ❌ | ❌ | محدود |
| الصوت المتزامن | ✅ | ✅ | ✅ | ❌ |
| مفتوح الأوزان | ✅ | ✅ | ❌ | ❌ |
| يعمل محلياً | ✅ | ✅ | ❌ | ❌ |
| الحجم | 22B | 33B | مغلق | مغلق |
| الضبط الدقيق | ✅ | محدود | ❌ | ❌ |
| الترخيص | LTX-2 Community | مفتوح | مغلق | مغلق |
كل من LTX-2.5 و MiniMax-H3 مفتوحان ويعملان محلياً، لكن LTX-2.5 يتميز بتعدد المشاهد الأصلي وإمكانية الضبط الدقيق الكامل، بينما MiniMax-H3 يتميز بحجم أكبر وانتشار أوسع.
كيفية الاستخدام من الخليج
المتطلبات التقنية
- بطاقة الرسومات: NVIDIA RTX بـ 16 جيجابايت VRAM على الأقل (24GB موصى به)
- الذاكرة: 32 جيجابايت RAM
- المساحة: حوالي 50 جيجابايت لنموذج BF16 الكامل، أقل لـ INT8 و NVFP4
- Python: 3.12 أو أحدث، CUDA 12.7+، PyTorch 2.7+
خطوات البدء
- سجّل الدخول على HuggingFace ووافق على شروط النموذج (gated model)
- حمل ملفات النموذج عبر
hf download - استخدم ltx-pipelines للـ Python أو ComfyUI للواجهة الرسومية
- ابدأ بأوصاف بسيطة ودع الـ prompt enhancer يحسّنها
سياق الشركة والمشهد التقني
Lightricks ليست جديدة على عالم المحتوى الرقمي. الشركة التي تأسست في إسرائيل طورت تطبيق Facetune الشهير (أكثر من 200 مليون تحميل) وسلسلة تطبيقات تحرير الصور والفيديو. إطلاق LTX-2.5 يمثل تحولاً استراتيجياً للشركة من تطبيقات تحرير المحتوى إلى بنية تحتية لتوليده.
الورقة البحثية المنشورة في يناير 2026 (arXiv:2601.03233) تحت عنوان "LTX-2: Efficient Joint Audio-Visual Foundation Model" تظهر الاستثمار البحثي الجاد في هذا المجال. النموذج مبني على بنية Diffusion Transformer ويستفيد من تقنيات متقدمة مثل:
- DiffVAE و Conv VAE: نظامين مختلفين لترميز وفك ترميز الفيديو — DiffVAE للجودة العالية و Conv VAE للسرعة
- Audio VAE مع vocoder: نظام متخصص لمعالجة الصوت وتوليده
- Spatial و temporal latent upscalers: أدوات لرفع دقة الفيديو المكاني والزمني
هذا البنيان التقني المتكامل هو ما يمكّن LTX-2.5 من تقديم ميزة تعدد المشاهد — فالنموذج لا يولّد لقطات منفصلة بل يفهم السرد البصري ككل.
مقارنة مع الإصدارات السابقة
LTX-2.5 هو تطور كبير عن الإصدار LTX-2 الأصلي. التحسينات الرئيسية تشمل:
- دعم multishot الذي لم يكن متاحاً في الإصدار السابق
- محسّن الأوصاف الجديد المبني على Gemma 4
- معالج الفيديو diffusion الجديد
- نموذج distilled محسّن يحتفظ بجودة أعلى في حجم أصغر
القيود
- نموذج مقيد (Gated): يتطلب تسجيل دخول وموافقة على HuggingFace لتحميله، مما يضيف خطوة إضافية.
- ترخيص الشركات: الشركات بإيرادات فوق 10 ملايين دولار تحتاج لترخيص مدفوع.
- العتاد: تشغيل النموذج الكامل (BF16) يتطلب عتاداً قوياً. الصيغ الأخف (INT8، NVFP4) تقلل المتطلبات لكن على حساب الجودة.
- الجودة مقابل النماذج المغلقة: بينما يقدم LTX-2.5 جودة ممتازة للنموذج المفتوح، قد تتفوق النماذج المغلقة مثل Sora في بعض السيناريوهات.
الأسئلة الشائعة
هل LTX-2.5 مجاني؟
النموذج مجاني للكيانات بإيرادات أقل من 10 ملايين دولار سنوياً تحت ترخيص LTX-2 Community License. الشركات الأكبر تحتاج لترخيص مدفوع.
ما الفرق بين LTX-2.5 و MiniMax-H3؟
LTX-2.5 يقدم تعدد مشاهد أصلي (multishot) وإمكانية ضبط دقيق كامل، بينما MiniMax-H3 يركز على جودة الفيديو والصوت المتزامن بحجم أكبر (33B مقابل 22B).
هل يدعم اللغة العربية في الأوصاف؟
نعم، يمكن استخدام الأوصاف العربية، لكن الأداء الأمثل يكون مع الأوصاف الإنجليزية. يُنصح باستخدام مترجم ثم تمرير النص الإنجليزي للنموذج.
هل يمكنني استخدامه لتوليد محتوى تجاري؟
نعم، ضمن شروط ترخيص LTX-2 Community License للشركات الصغيرة والمتوسطة. للشركات الكبيرة، يلزم ترخيص مدفوع.
ما أفضل بطاقة رسومات لتشغيله؟
للأداء الأمثل مع BF16: RTX 4090 أو RTX 5090. للاستخدام العملي مع NVFP4: RTX 4070 Ti كافية.
كم مشهداً يمكنني توليده في عملية واحدة؟
لا يوجد حد محدد بدقة، لكن يُنصح بالبدء بـ 2-3 مشاهد للتحقق من الاستمرارية. المشاهد الأكثر تعقيداً تتطلب ذاكرة أكبر ووقت معالجة أطول.
الخلاصة
LTX-2.5 من Lightricks يمثل إضافة قوية لمنظومة الذكاء الاصطناعي المفتوح لتوليد الفيديو. ميزة التوليد متعدد المشاهد هي ما يميزه فعلاً — القدرة على إنتاج فيديو متعدد اللقطات باستمرارية كاملة في عملية واحدة تغيّر قواعد اللعبة لصناع المحتوى. مع الدعم الكامل لـ ComfyUI والقدرة على التشغيل المحلي، يقدم النموذج بديلاً مقنعاً للخدمات المدفوعة المغلقة.
للمزيد من أدوات الذكاء الاصطناعي للمبدعين، تابع دليل الأدوات على Truescho.