آموزش ساخت ویدیو با هوش مصنوعی؛ از ایده تا خروجی نهایی در ۷ مرحله
روشی که در استودیو برای ساخت تیزر با هوش مصنوعی استفاده میکنیم؛ هفت مرحله از ایده تا خروجی، و اشتباهی که در هر مرحله زیاد میبینیم.
جواب کوتاه: برای ساخت ویدیو با هوش مصنوعی اول هدف و سناریو را بنویسید، استوریبرد شاتبهشات بچینید، تصویر مرجع ثابت برای کاراکتر و محصول بسازید، هر شات را جداگانه با مدل ویدیو تولید کنید، بهترین نسخهها را انتخاب کنید و در آخر صداگذاری، تدوین و اصلاح رنگ را انجام دهید.
بیشتر آموزشهای فارسی ساخت ویدیو با هوش مصنوعی همینجا تمام میشوند: «پرامپت را بنویس، دکمه را بزن.» نتیجهاش هم همان کلیپهای ۵ ثانیهای بیربطی است که اینستاگرام پر از آنهاست.
یک تیزر ۳۰ ثانیهای قابلپخش، معمولاً از ۱۰ تا ۱۵ شات جدا ساخته میشود و هر شات را دهها بار تولید میکنیم تا یکی درست دربیاید. این مقاله همان روشی است که در Xeroframe Studio استفاده میکنیم؛ همان مراحلی که در روند کاری ما هم آمده: ایده، سناریو، استوریبرد، تولید با AI، تدوین و صدا.
01مرحله ۱: هدف را در یک جمله بنویسید
قبل از باز کردن هر ابزاری، این جمله را کامل کنید: «بعد از دیدن این ویدیو، مخاطب باید ... .»
«برند ما را بشناسد» هدف نیست. «بفهمد کفش ما برای دویدن روی آسفالت ساخته شده و صفحه خرید را باز کند» هدف است. همین یک جمله تعیین میکند ویدیو چند ثانیه باشد، کجا منتشر شود و چه حسی داشته باشد.
اشتباه رایج: شروع از ابزار. خیلیها اول میپرسند «با Kling بسازم یا Veo؟» درحالیکه هنوز نمیدانند ویدیو برای ریلز عمودی است یا تبلیغ یوتیوب افقی.
02مرحله ۲: سناریو بنویسید، نه پرامپت
هوش مصنوعی شات میسازد، داستان نه. سناریو تعیین میکند چه چیزی، به چه ترتیبی و با چه ریتمی دیده شود.
برای یک تیزر کوتاه، ساختار ساده «قلاب، مسئله، راهحل، دعوت به اقدام» کافی است. سه ثانیه اول باید مخاطب را نگه دارد؛ اگر نه، باقی ویدیو دیده نمیشود. جزئیات این ساختار را در آموزش سناریو نویسی تیزر تبلیغاتی نوشتهایم.
اشتباه رایج: نوشتن سناریویی که هوش مصنوعی هنوز خوب نمیسازد. دستهایی که با دقت یک شیء کوچک را باز میکنند، متن خوانا روی بستهبندی و صحنههای شلوغ با چند آدم که با هم تعامل دارند هنوز نقطه ضعف بیشتر مدلها هستند. سناریو را طوری بنویسید که روی نقاط قوت ابزار بنشیند.
03مرحله ۳: استوریبرد شاتبهشات
سناریو را به شاتهای ۳ تا ۸ ثانیهای بشکنید. برای هر شات اینها را بنویسید:
- اندازه قاب: نمای باز، متوسط یا بسته
- حرکت دوربین: ثابت، تراولینگ، دالی، پن
- چه اتفاقی میافتد: یک کنش ساده، نه سه کنش پشت سر هم
- مدت: چند ثانیه در تدوین نهایی
- صدا: دیالوگ، افکت یا فقط موسیقی
استوریبرد را میتوانید با یک مدل تصویر (مثل Nano Banana یا Midjourney) بهصورت تصویری بسازید. این تصاویر بعداً مستقیم ورودی مرحله ۵ میشوند.
اشتباه رایج: شاتهای بلند. هر چه شات طولانیتر باشد، احتمال خرابی چهره یا فیزیک بیشتر است. حتی حالا که مدلهایی مثل Seedance 2.5 تا ۳۰ ثانیه میسازند، ما معمولاً شاتهای کوتاهتر را ترجیح میدهیم و در تدوین به هم وصلشان میکنیم.
04مرحله ۴: تصویرهای مرجع ثابت بسازید
این همان مرحلهای است که کار آماتور را از کار حرفهای جدا میکند.
اگر کاراکتر، محصول یا لوکیشن شما در چند شات تکرار میشود، اول یک «برگه مرجع» بسازید: چهره کاراکتر از چند زاویه، محصول از جلو و پهلو، رنگبندی و نور اصلی صحنه. بعد همین تصاویر را بهعنوان مرجع به مدل ویدیو بدهید.
مدلهای ۲۰۲۶ برای همین کار ساخته شدهاند. Kling 3.0 کتابخانه المان دارد و Seedance 2.5 تا ۳۰ تصویر مرجع قبول میکند. (مقایسه کاملتر در مرور مدلهای ویدیوی هوش مصنوعی ۲۰۲۶.)
اشتباه رایج: عوض کردن جزئیات بین شاتها. اگر در شات اول کاراکتر کت آبی دارد و در پرامپت شات سوم یادتان رفته بنویسید، احتمالاً کتش سبز میشود.
05مرحله ۵: تولید شاتها و انتخاب سختگیرانه
حالا نوبت پرامپت است. هر شات را جداگانه بسازید و از هر کدام چند نسخه بگیرید.
یک پرامپت ویدیوی خوب معمولاً این ترتیب را دارد: سوژه، کنش، محیط، دوربین، نور و حس، و در آخر سبک. مثلاً:
زن جوانی با کت آبی در ایستگاه مترو منتظر است، سرش را به سمت دوربین برمیگرداند. ایستگاه خلوت، نیمهشب. دوربین آرام به جلو حرکت میکند، نمای متوسط. نور فلورسنت سرد با لکههای نور گرم. حس سینمایی، دانه فیلم ۳۵ میلیمتری.
برای فرمول کامل و مثالهای بیشتر، راهنمای پرامپت نویسی ویدیو با هوش مصنوعی را بخوانید.
نسبت ساخت به استفاده را جدی بگیرید. پیجی آکتورو برای تبلیغ معروف Kalshi که در فینال NBA پخش شد، حدود ۳۰۰ تا ۴۰۰ بار ساخت انجام داد تا ۱۵ کلیپ قابلاستفاده بگیرد. یعنی از هر ۲۰ تا ۲۵ نسخه، یکی.
اشتباه رایج: کنار آمدن با «تقریباً خوب». انگشت اضافه، متنی که حروفش به هم ریخته یا ماشینی که یک لحظه چرخش عوض میشود را بیننده شاید آگاهانه نبیند، اما حس «یک چیزی درست نیست» را میگیرد.
06مرحله ۶: صدا، موسیقی و دیالوگ
مدلهای جدید صدای همزمان میسازند: دیالوگ، صدای محیط، افکت. این برای پیشنمایش عالی است، اما خروجی نهایی معمولاً به اینها نیاز دارد:
- موسیقی که با ریتم تدوین هماهنگ باشد (و مجوز استفاده داشته باشد)
- گوینده برای پیام برند؛ صدای انسانی هنوز برای مخاطب فارسیزبان باورپذیرتر است
- میکس که صدای دیالوگ، موسیقی و افکت را متعادل کند
اشتباه رایج: دیالوگ فارسی با مدل خارجی. لبخوانی فارسی در بیشتر مدلها هنوز طبیعی نیست. اگر دیالوگ فارسی مهم است، یا شات را طوری بچینید که دهان کاراکتر دیده نشود، یا لبخوانی را جداگانه انجام دهید.
07مرحله ۷: تدوین و اصلاح رنگ
شاتهایی که از مدلهای مختلف یا حتی یک مدل در دفعات مختلف آمدهاند، رنگ و کنتراست یکسانی ندارند. اصلاح رنگ اینها را یکدست میکند و حس «یک فیلم» را میسازد، نه «چند کلیپ کنار هم».
تدوین هم ریتم را میسازد. بیشتر کلیپهای AI در ثانیههای اول و آخر ضعیفترند؛ آنها را بِبُرید و فقط هسته شات را نگه دارید.
خروجی نهایی را برای هر پلتفرم جدا بگیرید: عمودی ۹:۱۶ برای ریلز، افقی ۱۶:۹ برای یوتیوب و سایت. اگر ویدیو واقعنماست، قوانین برچسب ویدیوهای هوش مصنوعی را قبل از انتشار ببینید.
08چقدر زمان میبرد؟
برای ما، یک پروژه ساخت ویدیو با هوش مصنوعی معمولاً ۳ تا ۱۰ روز کاری طول میکشد. بخش بزرگش مرحله ۲ تا ۴ است، یعنی قبل از اینکه حتی یک فریم ویدیو ساخته شود. این همان چیزی است که در آموزشهای «یک کلیک» دیده نمیشود.
اگر میخواهید خودتان امتحان کنید، از یک ویدیوی ۱۵ ثانیهای با ۴ شات شروع کنید. اگر برای برندتان خروجی حرفهای میخواهید، سفارش ساخت ویدیو با هوش مصنوعی را ببینید.
FAQسوالات متداول
برای ساخت ویدیو با هوش مصنوعی از کدام سایت استفاده کنیم؟
در ۲۰۲۶ گزینههای اصلی Kling، Seedance، Gemini Omni (در Google Flow)، Veo، Wan و MiniMax Hailuo هستند. هر کدام نقطه قوت خودش را دارد و بیشتر آنها برای استفاده از ایران به حساب خارجی و پرداخت ارزی نیاز دارند.
آیا ساخت ویدیو با هوش مصنوعی رایگان است؟
برخی سرویسها اعتبار رایگان محدود میدهند که برای تمرین کافی است. برای ویدیوی تجاری باکیفیت، بهدلیل تعداد زیاد ساختها، هزینه واقعی چند برابر قیمت هر ثانیه است.
آیا میتوان با هوش مصنوعی ویدیو با دیالوگ فارسی ساخت؟
بله، اما لبخوانی فارسی در بیشتر مدلها هنوز طبیعی نیست. راهحلهای رایج: شاتهایی که دهان کاراکتر را نشان نمیدهند، استفاده از گوینده روی تصویر، یا اصلاح لبخوانی در مرحله جداگانه.
ساخت یک تیزر با هوش مصنوعی چقدر طول میکشد؟
در استودیوی ما پروژههای ساخت ویدیو با هوش مصنوعی معمولاً ۳ تا ۱۰ روز کاری طول میکشد. بیشتر این زمان صرف سناریو، استوریبرد و ساخت تصاویر مرجع میشود.
مشاوره رایگان