Skip to content
IN

مترجم فيديو بالذكاء الاصطناعي

إنّ AI VFX Studio من Pixazo هو مترجم فيديو بالذكاء الاصطناعي يعمل من البداية إلى النهاية: أعطِه مقطعًا تملكه بالفعل، فيترجم حوار الفيديو إلى لغة أخرى، ويستنسخ صوت المتحدّث نفسه من المقطع ذاته، وينطق العبارة المترجمة، ثم يعيد توقيت حركة الشفاه على الصوت الجديد. البدء مجاني — تجربة ⁦7-day trial⁩ دون بطاقة و⁦100 bonus credits⁩. وفي تشغيل مُقاس من الإنجليزية إلى الإسبانية بتاريخ 29 يوليو 2026، استغرق مقطع من خمس ثوانٍ بمتحدّث واحد نحو خمس عشرة دقيقة، والمقطعان معروضان على هذه الصفحة بالصوت.

صورة توضيحية: منصّة دبلجة بطاولة مزج وشاشات مراقبة مرجعية تواجه مؤدّيًا مُضاءً، بإضاءة حدّية بلون الليمون، أُنشئت بواسطة Pixazo AI صورة توضيحية
  • النسخ النصي⁦13 s⁩
  • الترجمةالوكيل
  • الصوت⁦~10 min⁩
  • إعادة المزامنة⁦3 min 09 s⁩

تشغيل مُقاس · 29 يوليو 2026

ما الذي يفعله مترجم الفيديو بالذكاء الاصطناعي من Pixazo بالفيديو فعليًا؟

يُبقي الصورة وصوت المتحدّث نفسه، ويستبدل اللغة، ويعيد توقيت حركة الشفاه على الصوت الجديد — والمقطعان أدناه هما الناتج الحقيقي لتشغيل واحد بتاريخ 29 يوليو 2026، ولأن الدليل صوتي فلا بدّ أن تضغط زر التشغيل.

شغّل المقطع الإنجليزي أولًا ثم الإسباني — واحدًا في كل مرة. الصوت هو كل ما نزعمه هنا.
الوجه نفسه، والأداء نفسه، ولغة مختلفة.
EN · المصدر
“Welcome to our community. We’re so glad you’re here.” — المقطع الإنجليزي المصدر، وقد أُنشئ على Pixazo، فالصوت الذي فيه مِلكنا ويحقّ لنا استنساخه.
ES · مُدبلج
“Bienvenidos a nuestra comunidad — nos alegra mucho que estés aquí.” — الدبلجة الإسبانية من التشغيل نفسه، منطوقة بصوت مُستنسَخ من المقطع المصدر ومُعاد توقيته على الصورة.
اللغةمن الإنجليزية إلى الإسبانية
الصوتمُستنسَخ من كلام المقطع نفسه، دون تقديم أي عيّنة منفصلة
الشفاهأُعيد توقيتها بواسطة sync_mode “remap”

ما طبعه الوكيل قبل أن يُنشئ أي صوت

pixazo_transcribe
“Detected English, ⁦5.68 seconds⁩, 1 speaker”
النص المنسوخ ←
“Welcome to our community. We’re so glad you’re here.”
الترجمة (كتبها الوكيل) ←
“Bienvenidos a nuestra comunidad — nos alegra mucho que estés aquí.”

مدّة ملف المقطع نحو خمس ثوانٍ، أمّا أداة النسخ فأبلغت عن ⁦5.68 seconds⁩ من الكلام. نطبع الرقمين كما وردا تمامًا ولا نوفّق بينهما.

سجل التشغيل — Pixazo AI VFX Studio، 29 يوليو 2026. مقطع واحد، متحدّث واحد، من الإنجليزية إلى الإسبانية.
المرحلةما استدعاه الوكيلما الذي عادالزمن المُقاس
01 النسخ النصي pixazo_transcribe “Detected English, ⁦5.68 seconds⁩, 1 speaker”، ومعها النص الموقّت “Welcome to our community. We’re so glad you’re here.” ⁦13 s⁩
02 الترجمة الوكيل نفسه — دون نموذج ترجمة منفصل “Bienvenidos a nuestra comunidad — nos alegra mucho que estés aquí.”، مصوغة لتناسب مدّة الكلام التي قاسها لم يُقَس على حدة
03a سحب الصوت المصدر pixazo_extract_audio المسار الصوتي المصدر، أُعيد استخدامه كمرجع لاستنساخ الصوت ⁦9 s⁩
03b استنساخ الصوت pixazo_add_voice صوت مبنيّ من كلام المقطع نفسه — لم تُقدَّم أي عيّنة صوتية منفصلة ⁦~10 min⁩ (عنق الزجاجة)
03c النطق تحويل النص إلى كلام بالصوت المُستنسَخ العبارة المترجمة بذلك الصوت ⁦42 s⁩
04 إعادة مزامنة الشفاه pixazo_lip_sync, sync_mode “remap” الصورة مُعاد توقيتها على الصوت الجديد ⁦3 min 09 s⁩
من البداية إلى النهاية ≈ خمس عشرة دقيقة · الجلسة كاملة ⁦$1.88⁩، بما في ذلك إنشاء المقطع المصدر · لم يكشف هذا التشغيل عن نموذج المزوّد الذي نفّذ تحويل النص إلى كلام أو مزامنة الشفاه، ولذلك لا تسمّي هذه الصفحة أي نموذج.

هذان المقطعان هما ناتج الدبلجة الحقيقي الوحيد على هذه الصفحة. وكل صورة أو مقطع متكرر آخر هنا هو صورة توضيحية أُنشئت لشرح مرحلة ما، ويحمل كلٌّ منها وسم “صورة توضيحية” ظاهرًا ويُصرّح بذلك في نصّه البديل.

أربع محطات

كيف تُبنى الدبلجة، محطة بعد محطة؟

تعمل أربع محطات بالترتيب — النسخ النصي، ثم الترجمة، ثم الصوت، ثم مزامنة الشفاه — وتسلّم كل محطة ناتجها مباشرة إلى التي تليها، ولهذا يكفي أمر واحد إلى الوكيل للحصول على دبلجة جاهزة. وهذه السلسلة هي ما يفصل مترجم لغة الفيديو بالذكاء الاصطناعي عن مجرّد تعليق صوتي: الصورة القديمة لا تُترك لتنفلت عن التوقيت، بل تُعاد بناء حركة الشفاه على المسار المنطوق الجديد.

صورة توضيحية: صفحة نص منسوخ بأكواد زمنية على طاولة استوديو، أُنشئت بواسطة Pixazo AI المحطة 01 · النسخ النصي ⁦13 s⁩ صورة توضيحية

الكلام يصبح نصًّا موقّتًا

يستمع الوكيل إلى المقطع الذي أعطيته له ويكتب ما يُقال فعلًا، مع إرفاق التوقيتات.

الأداة
pixazo_transcribe
الناتج
نص مع التوقيتات، واللغة المكتشفة، وعدد المتحدّثين
صورة توضيحية: صفحتا نصّ مترجم جنبًا إلى جنب، أُنشئت بواسطة Pixazo AI المحطة 02 · الترجمة دون استدعاء منفصل صورة توضيحية

الوكيل يكتب الترجمة بنفسه

لا يوجد نموذج ترجمة منفصل في السلسلة — فالوكيل يصوغ العبارة الجديدة مباشرة.

الأداة
الوكيل نفسه — دون نموذج ترجمة منفصل
الناتج
عبارة مصوغة لتناسب مدّة الكلام التي قاسها
صورة توضيحية: ميكروفون في كابينة تسجيل صوتي تحت ضوء بلون الليمون، أُنشئت بواسطة Pixazo AI المحطة 03 · الصوت ⁦~10 min⁩ صورة توضيحية

يُعاد بناء صوت المتحدّث نفسه، ثم ينطق

يُسحَب المسار الصوتي المصدر، ويُستخدم مرجعًا للاستنساخ، ثم يُجعَل ينطق العبارة المترجمة.

الأداة
pixazo_extract_audiopixazo_add_voice → تحويل النص إلى كلام
الناتج
العبارة المترجمة بصوت مُستنسَخ من ذلك المقطع

عنق الزجاجة

صورة توضيحية: شاشة مراقبة مرجعية تُظهر فمًا يتكلّم، أُنشئت بواسطة Pixazo AI المحطة 04 · إعادة المزامنة ⁦3 min 09 s⁩ صورة توضيحية

الصورة يُعاد توقيتها على الصوت الجديد

يعيد remap توقيت المادة المصوّرة على التسجيل المترجم كي تحلّ حركة الشفاه في موضع الكلمات الجديدة.

الأداة
pixazo_lip_sync, sync_mode “remap”
الناتج
الدبلجة النهائية، وحركة الشفاه مطابقة للعبارة الجديدة

ما يعمل وأين

أين ينتهي AI VFX Studio وتبدأ منصة التجارب؟

AI VFX Studio هو المكان الوحيد الذي يشغّل السلسلة كاملة: فمنصة التجارب لا تضمّ تحويل الكلام إلى نص ولا نموذج ترجمة، ولذلك فإن تشغيل النماذج هناك يدويًا يغطّي الصوت وإعادة المزامنة فقط، وعليك أن تأتي بنصّك المترجم بنفسك.

مسار واحد يشغّل كل شيء. والآخر يشغّل محطتين.

أعطِ AI VFX Studio مقطعًا ولغة هدفًا فيمرّ على المحطات الأربع بنفسه. أمّا في منصة التجارب فأنت تفتح نموذجًا واحدًا في كل مرة، ولذلك يجب أن يصل النص المنسوخ والترجمة مكتوبَين مسبقًا — فلا يوجد هناك ما يمكنه إنتاج أيّ منهما.

  • مربّع بلون الليمون — يشغّله AI VFX Studio.
  • إطار بلون الليمون — أنت من يوفّره.
  • مربّع داكن مشطوب — لا أحد يفعله.
  • النص المنسوخ والترجمة والصوت المُستنسَخ وإعادة مزامنة الشفاه، كلها تحدث داخل AI VFX Studio بأمر واحد.
  • يدويًا في منصة التجارب توفّر النصّ المترجم بنفسك، ثم تشغّل محطة الصوت ومحطة مزامنة الشفاه.
  • لا يفصل أيٌّ من المسارَين الحوار عن الموسيقى والمؤثرات، ولا يستبدل أيٌّ منهما النصّ المدمج في الصورة.
صورة توضيحية: رأس منحوت على شاشة استوديو، بتأطير على الفم، أُنشئت بواسطة Pixazo AI صورة توضيحية

صورة توضيحية — أُنشئت لتجسيد مرحلة إعادة المزامنة، وليست ناتج دبلجة

التغطية حسب المسار. كل خلية تذكر حالتها بالكلمات كما بالرمز.
المهمةAI VFX Studio (أمر واحد)منصة التجارب، بتشغيل النماذج يدويًا
نصّ منسوخ من الكلام مشمول. مشمول غير متوفّر. غير متوفّر — أحضر نصّك المنسوخ بنفسك
الترجمة مشمول. مشمولة — الوكيل يكتبها بنفسه غير متوفّر. غير متوفّرة — لا نموذج ترجمة هنا
مرجع استنساخ الصوت مشمول. مشمول — مسحوب من صوت المقطع نفسه غير مُتحقَّق منه. ليست قدرة مُتحقَّقًا منها هنا — فالتشغيل المُقاس لم يستنسخ صوتًا من مرجع داخل منصة التجارب قَط
نطق بالصوت المُستنسَخ مشمول. مشمول مشمول. مشمول — Chatterbox v1، ⁦4 credits⁩
إعادة مزامنة الشفاه على صوت جديد مشمول. مشمول مشمول. مشمولة — MultiTalk، ⁦from 104 credits⁩
فصل الحوار عن الموسيقى والمؤثرات غير متوفّر. غير متوفّر غير متوفّر. غير متوفّر
إخراج ملف ترجمة أو SRT غير متوفّر. غير متوفّر — النص الموقّت يُطبع على الشاشة، ولا يُصدَّر كملف ترجمة غير متوفّر. غير متوفّر
استبدال النصّ المدمج في الصورة غير متوفّر. غير متوفّر غير متوفّر. غير متوفّر

شغّل السلسلة كاملة في AI VFX Studio

مُقاس، لا مُقدَّر

لماذا تستغرق دبلجة مقطع من خمس ثوانٍ نحو خمس عشرة دقيقة؟

لأن استنساخ الصوت هو عنق الزجاجة — فنحو عشر دقائق من تلك الخمس عشرة تذهب إلى بناء صوت من كلام المقطع نفسه، وكل محطة أخرى تنتهي في ثوانٍ.

≈ خمس عشرة دقيقة من البداية إلى النهاية، مقطع واحد من خمس ثوانٍ بمتحدّث واحد
النسخ النصي
⁦13 s⁩
سحب الصوت المصدر
⁦9 s⁩
استنساخ الصوت — عنق الزجاجة
⁦~10 min⁩
نطق العبارة المترجمة
⁦42 s⁩
إعادة مزامنة الشفاه
⁦3 min 09 s⁩
نحو ⁦850 s⁩ من زمن المراحل المُقاس ⁦$1.88⁩ للجلسة كاملة، بما في ذلك إنشاء المقطع المصدر تشغيل واحد، مقطع واحد، زوج لغات واحد

أعرض الأشرطة تمثّل نصيب كل محطة من نحو 850 ثانية من زمن المراحل المُقاس، مع حساب استنساخ الصوت الذي استغرق نحو عشر دقائق كعشر دقائق بالتمام؛ ولم تُقَس خطوة الترجمة على حدة، فهي ليست داخل ذلك المجموع. هذا تشغيل واحد مُقاس بتاريخ 29 يوليو 2026، وليس اختبارًا مرجعيًا — فمقطع أطول أو متحدّثون أكثر أو زوج لغات مختلف لن يعطي الأرقام نفسها.

الصوت، يدويًا

كيف تُنشئ العبارة المنطوقة وحدها بنفسك؟

افتح محطة Chatterbox v1 في منصة التجارب مقابل ⁦4 credits⁩، والصق العبارة المترجمة التي بحوزتك، فتحصل على الصوت المنطوق دون تشغيل بقية السلسلة. وبهذا الاستخدام يكون مترجم صوت بالذكاء الاصطناعي للفيديو لا السلسلة كاملة — فمنصة التجارب لا تستطيع النسخ النصي ولا الترجمة نيابة عنك، ولذلك يجب أن يكون النص من عندك. وأرصدة التسجيل الـ100 لديك تكفي هذه المحطة أضعافًا مضاعفة.

صورة توضيحية: صفّ من أعمدة إضاءة الاستوديو بإضاءة حدّية بلون الليمون، أُنشئت بواسطة Pixazo AI
صورة توضيحية

محطة الصوت وحدها

نموذج واحد، سطر نصّ واحد، تسجيل واحد — مفيد عندما تكون الترجمة موجودة أصلًا وكل ما تحتاجه هو الكلام.

Chatterbox v1 — Resemble AI · ⁦4 credits⁩

ما يفعله. ينطق سطر نصّ تقدّمه أنت، مقابل ⁦4 credits⁩ للتشغيل. وهو يغطّي المهمة نفسها التي تغطّيها المحطة 03 — نطق عبارة — لكن كنموذج تشغّله بنفسك، فيمكنك تحسين التسجيل دون إعادة تشغيل النسخ النصي أو إعادة المزامنة. ولم يُكشف قَط عن النموذج الذي عمل داخل السلسلة، فهذه مقارنة بين مهام لا تحديد لهوية نموذج.

ما لن يفعله. لن ينسخ مقطعك نصًّا ولن يترجم أي شيء — فمنصة التجارب لا تضمّ تحويل الكلام إلى نص ولا نموذج ترجمة، ولذلك يجب أن يصل النصّ المترجم مكتوبًا مسبقًا. كما أنه لا يمسّ الصورة؛ فحركة الشفاه ما زالت تنطق الكلمات الأصلية حتى تشغّل إعادة المزامنة. أمّا استنساخ صوت من مرجع ترفعه أنت فهو أمر لم يختبره التشغيل المُقاس هنا، ولذلك لا تزعم هذه الصفحة أن هذه المحطة تفعله.

افتح محطة الصوت

نقطة المراجعة

مَن يعتمد الترجمة قبل إنشاء أي صوت؟

أنت من يعتمدها، وهي نقطة المراجعة الوحيدة الموجودة — إذ يطبع الوكيل النص المنسوخ والعبارة المترجمة على الشاشة قبل أن يُنشئ ثانية واحدة من الصوت، لأن أحدًا لم يراجع أيًّا منهما بالقراءة، ولم يُنشَر أي رقم دقّة للنص المنسوخ ولا للترجمة.

صورة توضيحية: صفحة نصّ مطبوعة تحت مصباح مكتب وعلامة صحّ مرسومة بالقلم على هامشها، أُنشئت بواسطة Pixazo AI نقطة المراجعة الوحيدة صورة توضيحية
صورة توضيحية — يطبع الوكيل النص المنسوخ والعبارة المترجمة على الشاشة، ولا يُنشأ أي شيء قبل أن تقرأهما.

اقرأ النص المنسوخ المطبوع

قارِنه بما يُقال فعلًا في الصورة. فأداة النسخ هي أول حلقة في السلسلة، وأي كلمة تسمعها خطأً تصبح كلمة تُبنى عليها الترجمة.

اقرأ العبارة المترجمة

تحقّق من المعنى، وتحقّق من إمكانية نطقها داخل المدّة التي قاستها أداة النسخ. فالوكيل يصوغ العبارة لتناسب تلك المدّة، وهذا قرار أدائي أنت من يعتمده.

ثم دعه ينطق

كل ما يأتي بعد هذه النقطة يرث ما اعتمدته، بصوت مُستنسَخ. فمحطة الصوت وإعادة المزامنة لا تعيدان قراءة النص، بل تمرّرانه كما اعتُمد بالحرف.

إن كانت العبارة خطأً هنا، فكل ما يليها خطأ — وبصوت المتحدّث نفسه.

لمن هو

لمن صُمِّم مترجم الفيديو بالذكاء الاصطناعي من Pixazo؟

لكل من يملك مادة مصوّرة جاهزة بلغة واحدة ويحتاج إلى المتحدّث نفسه وهو ينطقها بلغة أخرى. وكأداة ترجمة بالذكاء الاصطناعي لفِرَق مونتاج الفيديو وفِرَق محتوى الفيديو، فهو يناسب فِرَق الدورات والدروس، ومسؤولي الدعم والتهيئة، وتسويق المنتجات، وقنوات صنّاع المحتوى، والتواصل الداخلي، ومسؤولي التوطين الذين يختبرون لغة قبل التعاقد على دبلجة استوديو.

فِرَق الدورات والدروس

تبدأ من تسجيل درس جاهز بمدرّب واحد يتحدّث إلى الكاميرا، وتريد المدرّب نفسه بلغة ثانية.

متحدّث واحدمواجه للكاميرالقطة وجه متحدّث

مسؤولو الدعم والتهيئة

تبدأ من مقطع إرشادي قصير في مركز المساعدة يكون الصوت فيه أهمّ من الصورة.

أقل من ⁦60 s⁩حوار نقيبلا عناوين مدمجة

تسويق المنتجات

تبدأ من نسخة مونتاج معتمدة ومقفلة وتحتاج إلى لغة ثانية دون إعادة فتح المونتاج.

مونتاج جاهزصورة مقفلةزوج لغات واحد

قنوات صنّاع المحتوى

تبدأ من مادتك المصوّرة أمام الكاميرا، حيث الصوت صوتك ويحقّ لك استنساخه ولا مسألة إذن هنا.

مادة خاصة بكصوتك أنتتأطير ثابت

التواصل الداخلي

تبدأ من رسالة قيادية أو رسالة سياسات سُجّلت مرة واحدة، ويجب أن تصل إلى فِرَق لا تتشارك تلك اللغة.

متحدّث واحدلقطة جلوسالنص جاهز

مسؤولو التوطين

تبدأ من مقطع واحد ممثّل وتريد سماع لغة قبل أن تتعاقد على دبلجة استوديو للمكتبة كاملة.

عيّنة قصيرةمقطع واحداقرأ النص المنسوخ

يصمد / يفشل

على أي اللقطات تصمد إعادة مزامنة الشفاه فعلًا؟

تصمد مع متحدّث واحد مؤطَّر مواجهةً للكاميرا وثابت إلى حدّ معقول، ولا تصمد مع التأطير الجانبي، ولا مع لقطات يتحدّث فيها شخصان، ولا تحت ضبابية حركة شديدة — فـremap يعيد توقيت الصورة على الصوت الجديد، ولا يعيد رسم وجه.

صورة توضيحية: رأس منحوت يواجه الكاميرا مباشرة، أُنشئت بواسطة Pixazo AI يصمد صورة توضيحية

وجه واحد، مواجه للكاميرا، والفم غير محجوب — فتجد إعادة المزامنة مرجعًا واضحًا تعمل عليه.

صورة توضيحية: رأس منحوت من الجانب، مشوَّش بالحركة، أُنشئت بواسطة Pixazo AI يفشل صورة توضيحية

في اللقطة الجانبية يكاد الفم لا يظهر في الإطار، وضبابية الحركة تُتلف ما بقي من المرجع.

صورة توضيحية: رأسان منحوتان في إطار واحد، وكلاهما يواجه الأمام، أُنشئت بواسطة Pixazo AI يفشل صورة توضيحية

مع متحدّثَين في إطار واحد لا تجد إعادة المزامنة سبيلًا لمعرفة أي فمٍ تحرّك.

MultiTalk — ⁦from 104 credits⁩

ما يفعله. يعيد مزامنة الفم في مادة مصوّرة موجودة على مسار صوتي تسلّمه له، ابتداءً من ⁦104 credits⁩ للتشغيل. وهو يغطّي المهمة نفسها التي تغطّيها المحطة 04 — إعادة توقيت الصورة على صوت جديد — لكن كنموذج تشغّله بنفسك، فيمكنك إعادة توقيت مقطع على تسجيل أنتجته في مكان آخر. ولم يُكشف قَط عن النموذج الذي عمل داخل السلسلة، فهذه مقارنة بين مهام لا تحديد لهوية نموذج.

ما لن يفعله. لن يترجم ولن ينسخ نصًّا ولن يُنتج الصوت — فالصوت يجب أن يكون موجودًا أولًا. كما أنه لن يُنجِد تأطيرًا لا يستطيع قراءته: فاللقطات الجانبية، ووجود أكثر من متحدّث في الإطار، وضبابية الحركة الشديدة تبقى غير موثوقة، ولا يغيّر ذلك أي إعداد.

افتح محطة مزامنة الشفاه

حكم يصمد هو ما أظهره التشغيل المُقاس، على مقطع واحد بمتحدّث واحد مواجه للكاميرا. أمّا حكمَا يفشل فهما حدّان معروفان لإعادة التوقيت بـremap، وليسا نتيجتين من هذا التشغيل — فهو لم يحتوِ على تأطير جانبي ولا متحدّث ثانٍ ولا ضبابية حركة شديدة. ولا شيء هنا مجموعة اختبار مُقيَّمة، ولا توجد نسبة نجاح منشورة.

حدود صريحة

ما الذي لا يستطيع مترجم الفيديو بالذكاء الاصطناعي فعله بعد؟

أربعة أمور بصراحة: لا يستطيع انتزاع الحوار من مسار سبق مزجه، ولا يستطيع استبدال النصّ المدمج في الصورة، ولا يستطيع أن يضمن مزامنة شفاه موثوقة في التأطير الجانبي أو اللقطات متعدّدة المتحدّثين أو ضبابية الحركة الشديدة، ولا يستطيع أن يعطيك رقم دقّة مضمونًا للنص المنسوخ أو للترجمة.

أربعة أمور لن تتظاهر هذه الصفحة بالقدرة عليها.

استخراج المسارات من مزيج نهائي

  • لا يمكن فصل الحوار والموسيقى والمؤثرات مرة أخرى عن مسار سبق مزجه، ولذلك تستبدل الدبلجة الفراش الصوتي بالكامل.

النصّ المدمج في الصورة

  • العناوين والأشرطة السفلية والتعليقات المطبوعة تبقى باللغة الأصلية؛ فهي بكسلات لا نص.

المزامنة على تأطير غير مناسب

  • اللقطات الجانبية، واللقطات التي فيها أكثر من متحدّث، وضبابية الحركة الشديدة، كلها غير موثوقة، ولا يصلح ذلك أي إعداد.

رقم دقّة مضمون

  • لم يُنشَر أي رقم دقّة للنص المنسوخ ولا للترجمة، والطبعة الظاهرة على الشاشة قبل إنشاء الصوت هي الضابط الوحيد، وإن كان سير عملك يحتاج إلى مستوى دقّة تعاقدي فهذه ليست الأداة المناسبة.

ما لم يكشفه هذا التشغيل

لم يذكر الوكيل سوى أسماء أدوات Pixazo نفسها. ويسرد الكتالوج عدة عائلات للكلام ومزامنة الشفاه، لكن هذا التشغيل لا يُثبت أيًّا منها، ولذلك لا تزعم هذه الصفحة أيّ نموذج مزوّد نطق المقطع أعلاه أو أعاد مزامنته.

قبل أن تدبلج مادة مصوّرة لم تصوّرها أنت.
ما تحتاجهلماذا يهمّمَن يجب أن يوافق
إذن باستنساخ صوت المتحدّث الصوت المُستنسَخ هو صوت ذلك الشخص؛ والموافقة على الظهور ليست موافقة على إعادة النطق بصوته المتحدّث
ترخيص يشمل إعادة الدبلجة ترخيص استخدام مقطع لا يمتدّ إلى وضع كلمات جديدة في فم متحدّثه مالك المادة المصوّرة
اعتماد العبارة المترجمة ترجمة الوكيل مُلائَمة للمدّة المُقاسة، فهي اختيار صياغة لا ترجمة حرفية مالك الرسالة
التكاليف من التشغيل المُتحقَّق منه: ⁦$1.88⁩ للجلسة كاملة بما في ذلك إنشاء المقطع المصدر؛ ويدويًا، ⁦4 credits⁩ في محطة الصوت وابتداءً من ⁦104 credits⁩ في محطة مزامنة الشفاه. ولا تُنشَر أسعار للدبلجة بالدقيقة ولا باللغة.

اطّلع على أسعار Pixazo

أول دبلجة لك

كيف تشغّل أول دبلجة لك في AI VFX Studio؟

أربع خطوات: ارفع مقطعًا بمتحدّث واحد مواجه للكاميرا، واقرأ النص المنسوخ والعبارة المترجمة التي يطبعها الوكيل، واعتمدهما، ثم اتركه وشأنه أثناء استنساخ الصوت — واحسب نحو خمس عشرة دقيقة لمقطع قصير.

صورة توضيحية: طاولة مزج بثّ من الأعلى، ومؤشّر واحد بلون الليمون مُضاء، ولوحة فارغة على حافّتها، أُنشئت بواسطة Pixazo AI صورة توضيحية

ما يطلبه منك التشغيل الأول فعلًا

مقطع واحد مواجه للكاميرا، وأمر واحد، وقراءة واحدة لما يطبعه — ثم نحو خمس عشرة دقيقة من الانتظار، معظمها استنساخ الصوت.

ارفع المقطع

متحدّث واحد، مواجه للكاميرا، والفم غير محجوب. فهذا التأطير هو ما تحتاجه مرحلة إعادة المزامنة لاحقًا، ويستحقّ أن تضبطه قبل أن يعمل أي شيء آخر.

قل ما اللغة التي تريدها

أمر واحد يكفي؛ والوكيل هو من يختار المحطات. فأنت لا تنتقي نماذج ولا توصّل سلسلة بنفسك.

اقرأ ما يطبعه، ثم اعتمِد

يظهر النص المنسوخ والعبارة المترجمة قبل وجود أي صوت. وهذه نقطة مراجعتك الوحيدة — فاقرأهما جيدًا.

انتظر انتهاء استنساخ الصوت

نحو عشر دقائق على مقطع قصير، بلا متابعة؛ وهذا التوقّف متوقَّع وليس تعليقًا. أمّا إعادة المزامنة التي تليه فاستغرقت ⁦3 min 09 s⁩ في التشغيل المُقاس.

ابدأ دبلجة في AI VFX Studio

الأسئلة الشائعة

ما هي الأسئلة الأكثر تكرارًا حول ترجمة الفيديو بالذكاء الاصطناعي؟

تغطّي هذه الأسئلة العشرة التوقيت، وعيّنات الصوت، وأزواج اللغات واتجاهها، وما لا تمسّه الدبلجة، والتكلفة والخطة المجانية، والأذونات، واستخدام مقطع مرفوع من YouTube كمصدر، وما لم يكشفه التشغيل.

كم تستغرق دبلجة واحدة؟

نحو خمس عشرة دقيقة من البداية إلى النهاية لمقطع من خمس ثوانٍ بمتحدّث واحد في التشغيل المُقاس بتاريخ 29 يوليو 2026، وكان نحو عشر دقائق منها لاستنساخ الصوت وحده.

استغرق النسخ النصي ⁦13 s⁩، وسحب الصوت المصدر ⁦9 s⁩، ونطق العبارة المترجمة ⁦42 s⁩، وإعادة مزامنة الشفاه ⁦3 min 09 s⁩. ومقطع أطول أو متحدّثون أكثر أو زوج لغات مختلف لن يعطي الأرقام نفسها.

هل أحتاج إلى رفع عيّنة صوتية منفصلة؟

لا — فقد استنسخ التشغيل الصوت من كلام المقطع نفسه، دون تقديم أي عيّنة منفصلة.

يُسحَب المسار الصوتي المصدر بواسطة pixazo_extract_audio ويُعاد استخدامه مرجعًا للاستنساخ، وهذا يعني أيضًا أن أصلًا مشوّشًا أو مثقلًا بالموسيقى يمنح الاستنساخ مرجعًا أسوأ يعمل عليه.

أي أزواج اللغات تعمل؟

يكتب الوكيل الترجمة بنفسه بدلًا من استدعاء نموذج ترجمة منفصل، وكان التشغيل المُتحقَّق منه من الإنجليزية إلى الإسبانية.

ولأنه لا يوجد نموذج ترجمة منفصل في السلسلة، فلا توجد قائمة منشورة بالأزواج المدعومة يمكن الاستشهاد بها، ولا رقم دقّة للترجمة كذلك. ولاحظ أيضًا أن منصة التجارب لا تضمّ تحويل الكلام إلى نص ولا نموذج ترجمة على الإطلاق — فوحده AI VFX Studio يشغّل السلسلة كاملة.

هل تمسّ الدبلجة أي شيء غير الحوار؟

تستبدل الفراش الصوتي بالكامل وتعيد توقيت الصورة، ولا تمسّ أي شيء آخر.

لا تستطيع فصل الحوار عن الموسيقى والمؤثرات داخل مسار سبق مزجه، ولا تستطيع استبدال النصّ المدمج في الصورة — فالعناوين والأشرطة السفلية والتعليقات المطبوعة تبقى باللغة الأصلية.

ما التكلفة؟

بلغت الجلسة المُتحقَّق منها كاملة نحو ⁦$1.88⁩، وهذا الرقم يشمل إنشاء المقطع المصدر، لا الدبلجة وحدها.

وإن شغّلت المحطات يدويًا بدلًا من ذلك، فإن Chatterbox v1 بـ⁦4 credits⁩ وMultiTalk ابتداءً من ⁦104 credits⁩ للتشغيل. ولا يوجد سعر دبلجة منشور بالدقيقة ولا باللغة.

هل أحتاج إلى إذن لاستنساخ صوت شخص ما؟

نعم — فاستنساخ صوت شخص حقيقي يحتاج إلى إذن ذلك الشخص، وترخيص استخدام مادة مصوّرة لا يمتدّ إلى دبلجتها.

خلّص الأمرين على حدة قبل أن تدبلج أي شيء لم تصوّره بنفسك.

أي نموذج مزوّد نطق المقطع وأعاد مزامنته؟

لم يُكشف عن ذلك: فالوكيل لم يذكر سوى أسماء أدوات Pixazo نفسها — pixazo_add_voice, pixazo_lip_sync.

يسرد الكتالوج عدة عائلات للكلام ومزامنة الشفاه، لكن هذا التشغيل لا يُثبت أيًّا منها، ولذلك لا تنسب هذه الصفحة أي خطوة منهما إلى مزوّد.

هل يمكنه ترجمة الفيديو إلى الإنجليزية، أم من الإنجليزية فقط؟

في الاتجاهين. فمرحلة النسخ النصي تكتشف لغة المصدر بنفسها — وفي التشغيل المُقاس أبلغت “Detected English” دون أن يُخبرها أحد — فتسمّي أنت اللغة التي تريدها في الخارج وهو يعمل على ما دخل أيًّا كان.

التشغيل المعروض على هذه الصفحة كان من الإنجليزية إلى الإسبانية. ومن الإسبانية إلى الإنجليزية، أو أي زوج آخر، هو الأمر نفسه بلغة هدف مختلفة؛ وتغطية اللغة الهدف يحدّدها نموذج الكلام الذي ينطق العبارة، لا Pixazo.

هل يمكنني ترجمة فيديو من YouTube به؟

تحتاج إلى ملف الفيديو لا إلى رابط. فلا شيء في التشغيل المُقاس استورد من عنوان URL، لذلك صدّر المقطع من YouTube — أو استخدم نسختك الأصلية — وارفعه.

متحدّث واحد يواجه الكاميرا هو ما تتعامل معه مرحلة إعادة المزامنة على أفضل وجه، ولذلك تُدبلَج لقطة وجه المتحدّث بنقاء أكبر بكثير من مونتاج سريع القطع.

هل توجد خطة مجانية من مترجم الفيديو بالذكاء الاصطناعي؟

نعم، البدء مجاني: تجربة ⁦7-day trial⁩ دون الحاجة إلى بطاقة و⁦100 bonus credits⁩، وهو ما تنصّ عليه صفحة الأسعار. وهذه الأرصدة تكفي مسافة طويلة في محطة الصوت — إذ يكلّف Chatterbox v1 مقدار ⁦4 credits⁩ للعبارة.

لكن كن واقعيًا بشأن السلسلة كاملة. فمحطة إعادة مزامنة الشفاه تبدأ من ⁦104 credits⁩، ولذلك يحتاج تشغيل كامل من البداية إلى النهاية إلى أكثر من منحة التسجيل. وقد كلّف التشغيل المُقاس على هذه الصفحة نحو ⁦$1.88⁩ في AI VFX Studio، وتفاصيل الخطط الحالية موجودة على صفحة أسعار Pixazo.

Deepak Joshi

أخصائي تسويق المحتوى · Pixazo

يوثّق Deepak نماذج الكلام واستنساخ الصوت ومزامنة الشفاه في Pixazo بتشغيلها بنفسه لا بقراءة أوراق مواصفاتها. والدبلجة المعروضة على هذه الصفحة هي تشغيله التجريبي الخاص في AI VFX Studio بتاريخ 29 يوليو 2026 — والنص المنسوخ والترجمة وتوقيتات الخطوات و تكلفة الجلسة ⁦$1.88⁩، كلها منقولة عن ذلك التشغيل، والمقطعان هما ناتجه الفعلي. وحيث لم يكشف التشغيل عن شيء، مثل نموذج المزوّد الذي نطق العبارة، تقول هذه الصفحة ذلك بدلًا من التخمين.

صفحة المؤلّف على Pixazo LinkedIn

استكشف

أي أدوات Pixazo الأخرى تتكامل مع مترجم الفيديو بالذكاء الاصطناعي؟

تلك التي تصنع المادة المصوّرة التي تدبلجها أو توسّعها — ابدأ من أعلى السلسلة إن كنت لا تزال بحاجة إلى الفيديو، واستخدم الدليل إن كنت تبحث عن مهمة مختلفة تمامًا.

هل أنت مستعدّ لدبلجة أول مقطع لك من البداية إلى النهاية؟

أفلِت مقطعًا واحدًا بمتحدّث واحد مواجه للكاميرا في AI VFX Studio واعتمِد النص المنسوخ والترجمة الذي يطبعهما — فهكذا بالضبط صُنع المقطعان أعلى هذه الصفحة.

افتح AI VFX Studio
آخر تحديث · التشغيل مُقاس بتاريخ 29 يوليو 2026
مع منصة Pixazo نقدّم لك ولعملائك أمانًا وامتثالًا بمعايير المؤسسات في كل تفاعل.