الأدوات
API
الموارد
الميزات
نبذة عنا
تنزيل

كيفية إنشاء فيديوهات الذكاء الاصطناعي من النصوص أو الصور: دليل خطوة بخطوة

يبدأ إنشاء فيديو ذكاء اصطناعي بما هو أكثر من مجرد مطالبة. شاهد كيف تتشكل المدخلات النصية والصورية باستخدام Kling AI، ثم استكشف أمثلة واقعية وطرقاً عملية لتحسين الحركة، والصوت، واتجاه الكاميرا، والاتساق البصري.
Kling AI
Sep 14, 2026
0 دقيقة قراءة
كيفية إنشاء فيديوهات الذكاء الاصطناعي من النصوص أو الصور: دليل خطوة بخطوة

يمكن لأدوات الفيديو المعتمدة على الذكاء الاصطناعي نقل فكرة إلى الشاشة بسرعة، لكن المبتدئين قد يحتاجون إلى بعض التدريب لوصف الحركة، والحفاظ على اتساق العناصر، وضبط إيقاع الأحداث بوضوح. يمنح قليل من التخطيط قبل عملية التوليد مزيداً من التوجيه للعملية الإبداعية. إذا كنت تريد تعلّم كيفية إنشاء فيديوهات ذكاء اصطناعي انطلاقاً من النصوص أو الصور، فابدأ بسير عمل بسيط. مع Kling Video 3.0 يمكنك أخذ فكرة عبر التوليد، والمراجعة، والتنقيح.

كيفية صنع فيديوهات الذكاء الاصطناعي خطوة بخطوة

يبدأ الإخراج الأول الجيد قبل أن تضغط على Generate. حدد ما يجب أن يلاحظه المشاهد أولاً وما الذي ينبغي أن يتغير خلال الثواني القليلة التالية. في Kling Video 3.0 يمكنك البدء من فكرة مكتوبة أو صورة مرجعية، ثم تشكيل بقية المقطع حول تلك اللقطة.

الخطوة 1: خطط لمشهدك وحدد نقطة البداية

اختر نص إلى فيديو عندما لا تملك سوى فكرة أو نص. وإذا كان لديك بالفعل صورة منتج أو رسم توضيحي أو مرجع لشخصية أو أي عنصر بصري آخر، فإن أداة صورة إلى فيديو تمنحك قاعدة بصرية للمشهد.

بعد ذلك حدِّد اللقطة نفسها:

  • من هو أو ما هو الموضوع الرئيسي؟ اختر نقطة تركيز واضحة واحدة، مثل حقيبة ظهر جلدية لإعلان تجارة إلكترونية، أو شخصية متحركة، أو سيارة كلاسيكية.
  • ماذا يجب أن يحدث؟ ركز على حركة رئيسية واحدة، مثل طاهٍ يرش الملح على طبق أو عداء يعبر خط النهاية.
  • أين يجري المشهد؟ امنح الحدث بيئة محددة، مثل استوديو مضاء بنور الشمس في أوستن أو شارع مدينة ممطر ليلاً.
  • كيف يجب أن تبدو اللقطة وتتحرك؟ حدِّد التكوين، وحركة الكاميرا، والإضاءة، مثل لقطة قريبة مع دفع بطيء إلى الداخل أو لقطة واسعة تحت إضاءة علوية دافئة.
  • ما الذي ينبغي أن يسمعه المشاهد؟ أضف الحوار أو الضوضاء المحيطة أو المؤثرات الصوتية فقط عندما تدعم المشهد.

الخطوة 2: اكتب مطالبات فيديو واضحة للذكاء الاصطناعي

بمجرد التخطيط لمشهدك، زوّد مولّد الفيديو بالذكاء الاصطناعي بتفاصيل كافية لفهم كل من العناصر المرئية والصوت. الصيغة العملية للمطالبة هي:

  • المشهد + الموضوع + الحركة + الصوت + الأسلوب / العاطفة / الكاميرا
  • اجعل كل جزء محدداً:
  • المشهد والموضوع: حدّد الموقع والموضوع الرئيسي والتفاصيل المرئية المهمة.
  • الحركة: صف فعل الهدف أولاً، ثم أضف حركة الكاميرا أو التأطير.
  • الحوار: استخدم "الجملة" + العاطفة + سرعة الكلام + النبرة + تسمية الشخصية. على سبيل المثال، [الراكب، بهدوء] يقول: "يبدو الساحل مختلفاً عند غروب الشمس."
  • المؤثرات الصوتية والأجواء: اذكر مصدر الصوت والفعل، مثل [الدراجة النارية] تتسارع + [المؤثر الصوتي: هدير المحرك]. بالنسبة للصوت الخلفي، أضف المشهد، وعناصر الصوت، والإحساس المكاني، مثل رياح الساحل، الأمواج البعيدة، أو صدى حركة المرور.
  • الموسيقى أو الغناء: إذا كان المشهد يحتاج إليها، حدّد النوع، الآلة أو أسلوب الغناء، والعاطفة.

بالنسبة للتحويل من نص إلى فيديو، أدرج ما يكفي من التفاصيل لإرساء المشهد الكامل. بالنسبة للتحويل من صورة إلى فيديو، فإن الصورة المرجعية توفر بالفعل جزءاً كبيراً من المظهر والتكوين، لذا يمكنك التركيز أكثر على الحركة، وسلوك الكاميرا، والصوت.

قد يبدو التوجيه الكامل على النحو التالي:

“جولة في ساعة الغروب على طريق ساحل المحيط الهادئ السريع. [Rider] ينطلق على دراجة نارية عتيقة بينما تتحرك الكاميرا إلى الخلف في لقطة متوسطة أمامية. تنعكس أشعة الشمس الدافئة على الطريق. [Rider، بنبرة مسترخية وبطيئة] يقول: "لا شيء يتفوق على هذا الامتداد من الساحل." [Motorcycle] تتسارع + [Sound Effect: هدير محرك أعمق]. ريح ساحلية وأمواج محيط بعيدة تملآن الخلفية بإحساس هواء طلق ناعم. مزاج سينمائي هادئ.”

يحافظ هذا التنسيق على وضوح التوجيه البصري ويمنح الحوار والمؤثرات الصوتية والأجواء إشاراتها الخاصة، مما يساعد الصوت على الشعور بارتباط أكبر بما يحدث على الشاشة.

الخطوة 3: ضبط الحركة والتوقيت والصوت

فكّر في مقدار الوقت على الشاشة الذي يحتاجه الفعل بالفعل. إذا كان الراكب يكتفي بالالتفات نحو الكاميرا، فقد تكفي لقطة واحدة. وإذا أردت أيضًا لقطة قريبة للعجلة، ومنظور الراكب، وكشفًا أوسع، فامنح تلك اللحظات لقطاتها الخاصة بحيث يحصل كل منها على الوقت الكافي ليُسجَّل.

مع Kling VIDEO 3.0، يتيح تشغيل Multi-Shot للنموذج تخطيط انتقالات اللقطات، والتأطير، وتغييرات زاوية الكاميرا بناءً على مطالبتك. إذا أردت المزيد من التحكم في التسلسل، فاختر Custom Multi-Shot، مما يتيح لك التحكم بدقة في محتوى كل لقطة ومدتها.

مثال: أنشئ تسلسلاً قصيراً باستخدام Custom Multi-Shot

لنفترض أنك تريد إنشاء تسلسل قصير لدراجة نارية من أجل حملة اجتماعية. بعد تشغيل Multi-Shot، افتح Custom Multi-Shot وقسّم الفكرة إلى بضع لقطات مميزة:

توجيه اللقطات

اللقطة 1

لقطة واسعة منخفضة الزاوية من الخلف، تتبع السائق أثناء تقدمه إلى الأمام.

اللقطة 2

لقطة مقرّبة جانبية بزاوية منخفضة، لقطة تفصيلية لعجلة الدراجة النارية.

اللقطة 3

منظور الشخص الأول من السائق، مع ظهور المقود ولوحة العدادات في الأمام.

اللقطة 4

لقطة متوسطة أمامية، تتتبع إلى الخلف أمام الدراجة النارية، مع توجّه خوذة السائق نحو الكاميرا.

اللقطة 5

لقطة تتبع بمستوى العين من الجانب مع حركة جانبية طفيفة.

اللقطة 6

لقطة واسعة من زاوية عالية مع ميل خفيف إلى الأسفل. ترتفع الكاميرا بينما تنطلق الدراجة النارية أعمق داخل حقل الثلج، تاركة مسارات متعرجة عبر الثلج الأبيض النقي، مع غابات مغطاة بالثلوج على كلا الجانبين.

صورة

فيديو

حافظ على تركيز كل لقطة على فكرة بصرية واحدة، ثم عدل مدتها لتتوافق مع مقدار الحركة. تنجح هذه الطريقة بشكل جيد مع مقاطع الفيديو القصيرة للعلامات التجارية، ولقطات السفر، والإعلانات الاجتماعية التي تحتاج إلى عدة إيقاعات بصرية ضمن تسلسل واحد.

إذا كان المشهد يتضمن حوارًا أو صوتًا بيئيًا، فأضف تلك التعليمات قبل عملية التوليد. تدعم Native Audio حوارات مخصصة للشخصيات وعدة لغات. كما تدعم Kling VIDEO 3.0 اللهجات والنبرات الأصيلة.

الخطوة 4: أنشئ وراجع فيديو الذكاء الاصطناعي الخاص بك

الآن أنشئ مقطعك الأول. تقرن الأمثلة أدناه كل مُدخل بنتيجته، بحيث يمكنك مقارنة ما طلبته بما يظهر على الشاشة.

تحويل النص إلى فيديو:

المطالبة

شرفة خارجية لفيلّا أوروبية، بجوار طاولة طعام عليها مفرش ذو مربعات زرقاء وبيضاء، امرأة شابة بيضاء ترتدي قميصاً مخططاً بالأزرق والأبيض بأكمام قصيرة وشورتاً كاكي مع حزام بني، تجلس حافية القدمين مقابل رجل أبيض شاب يرتدي قميصاً أبيض. تقترب الكاميرا، تدور المرأة العصير في الكوب، تنظر بعينيها نحو الغابة البعيدة، وتقول: "هذه الأشجار ستتحول إلى اللون الأصفر خلال شهر، أليس كذلك؟". لقطة مقربة للرجل، يخفض رأسه ويقول: "لكنها ستكون خضراء مرة أخرى في الصيف المقبل.". ثم تدير المرأة رأسها، تبتسم للرجل المقابل وتقول: "هل أنت دائماً متفائلاً هكذا؟ أم فقط بشأن الصيف؟". عندها يرفع الرجل رأسه، ينظر إلى المرأة ويقول: "فقط بشأن صيف يكون معك."

فيديو

تحويل الصورة إلى فيديو:

الموجه

تتحرك الكاميرا تدريجيًا حول الفتاة إلى الأمام، ثم ترفع رأسها وتبتسم بحرارة للكاميرا، كما لو أنها ترى صديقًا قديمًا بعد سنوات عديدة.

الإطار الأول

مرجع الشخصية

فيديو

بمجرد حصولك على نتيجة على الشاشة، شاهدها مرة أخرى مع وضع بعض التفاصيل في الاعتبار:

  • الإجراء الرئيسي: هل ينفذ الشخص الحركة المقصودة بوضوح؟
  • التناسق في الموضوع: هل تبقى السمات الوجهية الرئيسية، والملابس، أو تفاصيل المنتج متسقة؟
  • حركة الكاميرا: هل تتحرك الكاميرا بسلاسة في الاتجاه الذي وصفته؟
  • التغييرات البصرية: هل تبدو الإضاءة، وحركة الخلفية، وغيرها من تغييرات المشهد طبيعية؟
  • توقيت الصوت: هل يتوافق الحوار والمؤثرات الصوتية مع الحركة على الشاشة؟
  • الإيقاع العام: هل تملك الحركة وقتًا كافيًا لتتطور داخل المقطع؟

الخطوة 5: صقّل وصدّر فيديوك

تمنحك النتيجة الأولى نقطة انطلاق واضحة للتنقيح. غيّر أضعف جزء أولاً، مثل الحركة أو اتجاه الكاميرا أو التوقيت أو المرجع، ثم أنشئ نسخة أخرى وقارن الفرق. بمجرد أن يعمل المقطع كما هو مقصود، صدّر النسخة النهائية لسير عمل التحرير أو النشر لديك.

كيفية الحصول على نتائج أفضل من توليد الفيديو بالذكاء الاصطناعي

يمكن أن تجعل التغييرات الصغيرة في تصميم اللقطة الجيل التالي أسهل في التحكم. ركز على الحركة، والتفاصيل التي يجب أن تبقى متسقة، وطريقة تحرك الكاميرا عبر المشهد.

حافظ على تركيز كل لقطة

ابنِ كل لقطة حول موضوع رئيسي واحد وحركة واضحة واحدة. قد لا يحتاج مقطع منتج قصير، على سبيل المثال، سوى إلى كشف بطيء وحركة كاميرا واحدة. إذا كانت الفكرة تتضمن عدة حركات أو نقاط سردية، فقم بتقسيمها إلى لقطات أقصر بحيث يحظى كل لحظة بمساحة كافية لتُقرأ بوضوح.

حافظ على تناسق الشخصيات والعناصر المرئية

حدّد أيّ التفاصيل التي لا يمكن أن تنحرف قبل أن تُنشئ اللقطة التالية. بالنسبة لشخصية متكررة، قد يعني ذلك الوجه وتسريحة الشعر والسترة. أما للمنتج، فأولِ اهتمامًا أكبر بالشعار ولون العبوة وشكل الملصق. يمكن لإعادة استخدام صورة المرجع نفسها أن تساعد تلك التفاصيل على الانتقال إلى زاوية كاميرا جديدة أو خلفية مختلفة.

التحكم في الحركة واتجاه الكاميرا

عامل الموضوع والكاميرا كجزأين منفصلين من اللقطة. دوّن الحركة أولاً، مثل "السيارة تبتعد عن الرصيف"، ثم أضف حركة كاميرا واحدة، مثل "تتبّع بجانب السيارة". إذا طلبت تقريبًا للكاميرا (push-in) وحركة بان وتتبعًا خلال الثواني القليلة نفسها، فقد تبدو اللقطة سريعًا مزدحمة أو تفقد اتجاهها المقصود.

أضف الصوت فقط عندما يدعم المشهد

أضف الصوت عندما تحتوي اللقطة على ما يستحق السماع. قد تحتاج لقطة مقهى فقط إلى طنين الأكواب ودردشة خافتة في الغرفة. قد لا يحتاج تكبير منتج إلى أي صوت مُولَّد على الإطلاق إذا كنت تخطط لإضافة موسيقى لاحقًا في المونتاج. بالنسبة للحوار، اجعل الجملة قصيرة بما يكفي لتناسب الحركة وطول المقطع.

ما الذي ينبغي أن تعرفه عن حقوق الطبع والنشر لفيديوهات الذكاء الاصطناعي؟

عندما تنشئ فيديوهات بالذكاء الاصطناعي، تنحصر حقوق الطبع والنشر عادةً في سؤال واحد: أي الأجزاء جاءت من عملك الإبداعي الخاص، وأي الأجزاء جاءت مباشرة من نظام الذكاء الاصطناعي؟ هذا التمييز مهم إذا كنت تخطط لنشر الفيديو النهائي أو ترخيصه أو إعادة استخدامه.

  • اللقطات المولّدة بالذكاء الاصطناعي لا تصبح تلقائيًا عملاً محميًا بحقوق الطبع والنشر: يمكنك كتابة موجه مفصل وتوجيه المشهد عن كثب، لكن الذكاء الاصطناعي هو الذي ينشئ التعبير البصري النهائي. الموجهات وحدها لا تمنحك عادةً ما يكفي من السيطرة الإبداعية لتطالب بحقوق الطبع والنشر على تلك الأجزاء المولّدة. قد تختلف قواعد حقوق الطبع والنشر باختلاف المنطقة والمنصة. تحقّق دائمًا من القوانين المعمول بها قبل الاستخدام التجاري.
  • يمكن لعملك الإبداعي الخاص أن يحصل على حماية: إذا أضفت لقطات أصلية أو رسومات أو تعليقًا صوتيًا أو تحريرًا أو ترتيبًا أو خيارات إبداعية أخرى، فقد تغطي حقوق الطبع والنشر تلك الأجزاء التي أنشأها البشر. يصبح ذلك مهمًا بشكل خاص عندما تجمع عدة مقاطع من الذكاء الاصطناعي في فيديو أكبر وتشكل البنية النهائية بنفسك.
  • المادة المصدرية المحمية بحقوق الطبع والنشر تحتفظ بحمايتها الأصلية: إذا استخدمت صورة شخص آخر أو رسمًا توضيحيًا أو موسيقى أو فيديو كجزء من سير عمل الذكاء الاصطناعي لديك، فإن إنشاء مقطع جديد لا يمحو الحقوق المرتبطة بتلك المادة المصدرية. قد يظل هناك ترخيص أو إذن أو حالة ملكية عامة أو أساس قانوني آخر سارياً.
  • تحتسب المواد المولَّدة بالذكاء الاصطناعي أيضًا أثناء التسجيل: إذا كان الفيديو النهائي يتضمن قدرًا ملحوظًا من المحتوى المولَّد بالذكاء الاصطناعي، فيجب أن يركِّز طلب حقوق الطبع والنشر على الأجزاء التي أنشأتها بنفسك وأن تحدد الأجزاء المولَّدة بالذكاء الاصطناعي بشكل منفصل.

النهاية

بمجرد أن تعرف كيفية إنشاء مقاطع فيديو بالذكاء الاصطناعي، يصبح من الأسهل تشكيل كل خطوة حول النتيجة التي تريدها. يمكن أن تساعدك المطالبات الواضحة والمراجع القوية وبعض التحسينات المستهدفة على تقريب المشهد من فكرتك الأصلية. يجمع Kling Video 3.0 بين خاصية تعدد اللقطات والصوت الأصلي والاتساق القائم على المراجع ضمن سير العمل نفسه، مما يمنحك طرقًا عملية لحمل الفكرة من أول مطالبة وحتى التوليد النهائي.

الأسئلة الشائعة

كيف يمكنني إنشاء مقاطع فيديو بالذكاء الاصطناعي باستخدام وجهي؟

يمكنك البدء بصورة شخصية واضحة ومضاءة جيدًا واستخدامها كمرجع بصري للشخصية التي تريد تحريكها. إذا كنت ترغب في استبدال وجه في صورة أو فيديو موجود، فإن سير عمل تبديل الوجوه يمنحك خيارًا أكثر تركيزًا. بالنسبة لمشهد يتم توليده حديثًا، حافظ على وضوح المرجع ووصف الحركة واتجاه الكاميرا والمشهد في المطالبة.

هل تحتاج مقاطع الفيديو المُولَّدة بالذكاء الاصطناعي إلى تسميات إفصاح؟

تتطلب بعض المنصات الإفصاح عندما ينشئ الذكاء الاصطناعي محتوى واقعيًا أو يعدله بشكل جوهري. تطلب يوتيوب، على سبيل المثال، من صُنّاع المحتوى الإفصاح عن مقاطع الفيديو الواقعية التي يُنشئها الذكاء الاصطناعي أو يُعدّلها عبر إعداد استخدام الذكاء الاصطناعي. عادةً ما تخضع التعديلات البصرية البسيطة والمحتوى غير الواقعي بوضوح لقواعد مختلفة، لذلك تحقّق من سياسة المنصة قبل النشر.

كيف يمكنني إنشاء مقاطع فيديو بالذكاء الاصطناعي مجانًا؟

تُقدّم بعض منصات الفيديو بالذكاء الاصطناعي وصولًا مجانيًا محدودًا أو اعتمادات ابتدائية، وقد يكون ذلك كافيًا لاختبار الأوامر ومقارنة النص إلى فيديو مع الصورة إلى فيديو. تحقّق من الخطة الحالية قبل تنفيذ مشروع أكبر، إذ يمكن أن تتغير حدود الاعتمادات، وطول الفيديو، وخيارات الإخراج.

لماذا يبدو الفيديو الذي أنشأته بالذكاء الاصطناعي غير متسق؟

كثيرًا ما تظهر التباينات البصرية عندما يطلب المشهد من النموذج التعامل مع عدد كبير جدًا من التغييرات في آن واحد. يمكن أن تؤدي الحركة المعقدة، أو تعدد الأفعال المتنافسة، أو وجود مرجع ضعيف إلى انجراف تفاصيل مثل الملابس أو الخلفيات أو ملامح الوجه بين اللحظات. عادةً ما يمنح تبسيط الحدث واستخدام مرجع بصري أوضح النموذج اتجاهًا أكثر استقرارًا.