مشاوره رایگان
آموزش

آموزش ساخت ویدیو با هوش مصنوعی؛ از ایده تا خروجی نهایی در ۷ مرحله

روشی که در استودیو برای ساخت تیزر با هوش مصنوعی استفاده می‌کنیم؛ هفت مرحله از ایده تا خروجی، و اشتباهی که در هر مرحله زیاد می‌بینیم.

جواب کوتاه: برای ساخت ویدیو با هوش مصنوعی اول هدف و سناریو را بنویسید، استوری‌برد شات‌به‌شات بچینید، تصویر مرجع ثابت برای کاراکتر و محصول بسازید، هر شات را جداگانه با مدل ویدیو تولید کنید، بهترین نسخه‌ها را انتخاب کنید و در آخر صداگذاری، تدوین و اصلاح رنگ را انجام دهید.

بیشتر آموزش‌های فارسی ساخت ویدیو با هوش مصنوعی همین‌جا تمام می‌شوند: «پرامپت را بنویس، دکمه را بزن.» نتیجه‌اش هم همان کلیپ‌های ۵ ثانیه‌ای بی‌ربطی است که اینستاگرام پر از آن‌هاست.

یک تیزر ۳۰ ثانیه‌ای قابل‌پخش، معمولاً از ۱۰ تا ۱۵ شات جدا ساخته می‌شود و هر شات را ده‌ها بار تولید می‌کنیم تا یکی درست دربیاید. این مقاله همان روشی است که در Xeroframe Studio استفاده می‌کنیم؛ همان مراحلی که در روند کاری ما هم آمده: ایده، سناریو، استوری‌برد، تولید با AI، تدوین و صدا.

01مرحله ۱: هدف را در یک جمله بنویسید

قبل از باز کردن هر ابزاری، این جمله را کامل کنید: «بعد از دیدن این ویدیو، مخاطب باید ... .»

«برند ما را بشناسد» هدف نیست. «بفهمد کفش ما برای دویدن روی آسفالت ساخته شده و صفحه خرید را باز کند» هدف است. همین یک جمله تعیین می‌کند ویدیو چند ثانیه باشد، کجا منتشر شود و چه حسی داشته باشد.

اشتباه رایج: شروع از ابزار. خیلی‌ها اول می‌پرسند «با Kling بسازم یا Veo؟» درحالی‌که هنوز نمی‌دانند ویدیو برای ریلز عمودی است یا تبلیغ یوتیوب افقی.

02مرحله ۲: سناریو بنویسید، نه پرامپت

هوش مصنوعی شات می‌سازد، داستان نه. سناریو تعیین می‌کند چه چیزی، به چه ترتیبی و با چه ریتمی دیده شود.

برای یک تیزر کوتاه، ساختار ساده «قلاب، مسئله، راه‌حل، دعوت به اقدام» کافی است. سه ثانیه اول باید مخاطب را نگه دارد؛ اگر نه، باقی ویدیو دیده نمی‌شود. جزئیات این ساختار را در آموزش سناریو نویسی تیزر تبلیغاتی نوشته‌ایم.

اشتباه رایج: نوشتن سناریویی که هوش مصنوعی هنوز خوب نمی‌سازد. دست‌هایی که با دقت یک شیء کوچک را باز می‌کنند، متن خوانا روی بسته‌بندی و صحنه‌های شلوغ با چند آدم که با هم تعامل دارند هنوز نقطه ضعف بیشتر مدل‌ها هستند. سناریو را طوری بنویسید که روی نقاط قوت ابزار بنشیند.

03مرحله ۳: استوری‌برد شات‌به‌شات

سناریو را به شات‌های ۳ تا ۸ ثانیه‌ای بشکنید. برای هر شات این‌ها را بنویسید:

  • اندازه قاب: نمای باز، متوسط یا بسته
  • حرکت دوربین: ثابت، تراولینگ، دالی، پن
  • چه اتفاقی می‌افتد: یک کنش ساده، نه سه کنش پشت سر هم
  • مدت: چند ثانیه در تدوین نهایی
  • صدا: دیالوگ، افکت یا فقط موسیقی

استوری‌برد را می‌توانید با یک مدل تصویر (مثل Nano Banana یا Midjourney) به‌صورت تصویری بسازید. این تصاویر بعداً مستقیم ورودی مرحله ۵ می‌شوند.

اشتباه رایج: شات‌های بلند. هر چه شات طولانی‌تر باشد، احتمال خرابی چهره یا فیزیک بیشتر است. حتی حالا که مدل‌هایی مثل Seedance 2.5 تا ۳۰ ثانیه می‌سازند، ما معمولاً شات‌های کوتاه‌تر را ترجیح می‌دهیم و در تدوین به هم وصلشان می‌کنیم.

04مرحله ۴: تصویرهای مرجع ثابت بسازید

این همان مرحله‌ای است که کار آماتور را از کار حرفه‌ای جدا می‌کند.

اگر کاراکتر، محصول یا لوکیشن شما در چند شات تکرار می‌شود، اول یک «برگه مرجع» بسازید: چهره کاراکتر از چند زاویه، محصول از جلو و پهلو، رنگ‌بندی و نور اصلی صحنه. بعد همین تصاویر را به‌عنوان مرجع به مدل ویدیو بدهید.

مدل‌های ۲۰۲۶ برای همین کار ساخته شده‌اند. Kling 3.0 کتابخانه المان دارد و Seedance 2.5 تا ۳۰ تصویر مرجع قبول می‌کند. (مقایسه کامل‌تر در مرور مدل‌های ویدیوی هوش مصنوعی ۲۰۲۶.)

اشتباه رایج: عوض کردن جزئیات بین شات‌ها. اگر در شات اول کاراکتر کت آبی دارد و در پرامپت شات سوم یادتان رفته بنویسید، احتمالاً کتش سبز می‌شود.

05مرحله ۵: تولید شات‌ها و انتخاب سخت‌گیرانه

حالا نوبت پرامپت است. هر شات را جداگانه بسازید و از هر کدام چند نسخه بگیرید.

یک پرامپت ویدیوی خوب معمولاً این ترتیب را دارد: سوژه، کنش، محیط، دوربین، نور و حس، و در آخر سبک. مثلاً:

زن جوانی با کت آبی در ایستگاه مترو منتظر است، سرش را به سمت دوربین برمی‌گرداند. ایستگاه خلوت، نیمه‌شب. دوربین آرام به جلو حرکت می‌کند، نمای متوسط. نور فلورسنت سرد با لکه‌های نور گرم. حس سینمایی، دانه فیلم ۳۵ میلی‌متری.

برای فرمول کامل و مثال‌های بیشتر، راهنمای پرامپت نویسی ویدیو با هوش مصنوعی را بخوانید.

نسبت ساخت به استفاده را جدی بگیرید. پی‌جی آکتورو برای تبلیغ معروف Kalshi که در فینال NBA پخش شد، حدود ۳۰۰ تا ۴۰۰ بار ساخت انجام داد تا ۱۵ کلیپ قابل‌استفاده بگیرد. یعنی از هر ۲۰ تا ۲۵ نسخه، یکی.

اشتباه رایج: کنار آمدن با «تقریباً خوب». انگشت اضافه، متنی که حروفش به هم ریخته یا ماشینی که یک لحظه چرخش عوض می‌شود را بیننده شاید آگاهانه نبیند، اما حس «یک چیزی درست نیست» را می‌گیرد.

06مرحله ۶: صدا، موسیقی و دیالوگ

مدل‌های جدید صدای هم‌زمان می‌سازند: دیالوگ، صدای محیط، افکت. این برای پیش‌نمایش عالی است، اما خروجی نهایی معمولاً به این‌ها نیاز دارد:

  • موسیقی که با ریتم تدوین هماهنگ باشد (و مجوز استفاده داشته باشد)
  • گوینده برای پیام برند؛ صدای انسانی هنوز برای مخاطب فارسی‌زبان باورپذیرتر است
  • میکس که صدای دیالوگ، موسیقی و افکت را متعادل کند

اشتباه رایج: دیالوگ فارسی با مدل خارجی. لب‌خوانی فارسی در بیشتر مدل‌ها هنوز طبیعی نیست. اگر دیالوگ فارسی مهم است، یا شات را طوری بچینید که دهان کاراکتر دیده نشود، یا لب‌خوانی را جداگانه انجام دهید.

07مرحله ۷: تدوین و اصلاح رنگ

شات‌هایی که از مدل‌های مختلف یا حتی یک مدل در دفعات مختلف آمده‌اند، رنگ و کنتراست یکسانی ندارند. اصلاح رنگ این‌ها را یک‌دست می‌کند و حس «یک فیلم» را می‌سازد، نه «چند کلیپ کنار هم».

تدوین هم ریتم را می‌سازد. بیشتر کلیپ‌های AI در ثانیه‌های اول و آخر ضعیف‌ترند؛ آن‌ها را بِبُرید و فقط هسته شات را نگه دارید.

خروجی نهایی را برای هر پلتفرم جدا بگیرید: عمودی ۹:۱۶ برای ریلز، افقی ۱۶:۹ برای یوتیوب و سایت. اگر ویدیو واقع‌نماست، قوانین برچسب ویدیوهای هوش مصنوعی را قبل از انتشار ببینید.

08چقدر زمان می‌برد؟

برای ما، یک پروژه ساخت ویدیو با هوش مصنوعی معمولاً ۳ تا ۱۰ روز کاری طول می‌کشد. بخش بزرگش مرحله ۲ تا ۴ است، یعنی قبل از اینکه حتی یک فریم ویدیو ساخته شود. این همان چیزی است که در آموزش‌های «یک کلیک» دیده نمی‌شود.

اگر می‌خواهید خودتان امتحان کنید، از یک ویدیوی ۱۵ ثانیه‌ای با ۴ شات شروع کنید. اگر برای برندتان خروجی حرفه‌ای می‌خواهید، سفارش ساخت ویدیو با هوش مصنوعی را ببینید.

FAQسوالات متداول

برای ساخت ویدیو با هوش مصنوعی از کدام سایت استفاده کنیم؟

در ۲۰۲۶ گزینه‌های اصلی Kling، Seedance، Gemini Omni (در Google Flow)، Veo، Wan و MiniMax Hailuo هستند. هر کدام نقطه قوت خودش را دارد و بیشتر آن‌ها برای استفاده از ایران به حساب خارجی و پرداخت ارزی نیاز دارند.

آیا ساخت ویدیو با هوش مصنوعی رایگان است؟

برخی سرویس‌ها اعتبار رایگان محدود می‌دهند که برای تمرین کافی است. برای ویدیوی تجاری باکیفیت، به‌دلیل تعداد زیاد ساخت‌ها، هزینه واقعی چند برابر قیمت هر ثانیه است.

آیا می‌توان با هوش مصنوعی ویدیو با دیالوگ فارسی ساخت؟

بله، اما لب‌خوانی فارسی در بیشتر مدل‌ها هنوز طبیعی نیست. راه‌حل‌های رایج: شات‌هایی که دهان کاراکتر را نشان نمی‌دهند، استفاده از گوینده روی تصویر، یا اصلاح لب‌خوانی در مرحله جداگانه.

ساخت یک تیزر با هوش مصنوعی چقدر طول می‌کشد؟

در استودیوی ما پروژه‌های ساخت ویدیو با هوش مصنوعی معمولاً ۳ تا ۱۰ روز کاری طول می‌کشد. بیشتر این زمان صرف سناریو، استوری‌برد و ساخت تصاویر مرجع می‌شود.

تحریریه Xeroframe Studio

تیم کارگردانی، سناریونویسی و تولید Xeroframe Studio؛ استودیویی که ویدیو را با هوش مصنوعی و روش‌های کلاسیک فیلمسازی می‌سازد. درباره ما بیشتر بخوانید.

ایده‌ت رو بگو، بقیه‌ش با ما.

یه جلسه مشاوره رایگان رزرو کن تا درباره پروژه‌ت حرف بزنیم و بهترین مسیر ساختش رو بهت پیشنهاد بدیم.

درخواست مشاوره رایگان