مشاوره رایگان
خبر و ترند

جدیدترین مدل‌های ساخت ویدیو با هوش مصنوعی در ۲۰۲۶؛ از خداحافظی Sora تا Wan 3.0

OpenAI پرونده Sora را بست و مدل‌های چینی صدر جدول‌ها را گرفتند. مرور ماه‌به‌ماه اتفاقات ۲۰۲۶ و اینکه برای تیزر بعدی برندتان چه معنایی دارد.

  • Sora دیگر وجود ندارد. اپلیکیشن و وب Sora در ۶ اردیبهشت ۱۴۰۵ (۲۶ آوریل ۲۰۲۶) بسته شد و API آن هم ۲ مهر ۱۴۰۵ (۲۴ سپتامبر ۲۰۲۶) خاموش شد.
  • صدای هم‌زمان حالا استاندارد است. Kling 3.0، Seedance 2.5، MiniMax H3 و Wan 3.0 همه دیالوگ، افکت و صدای محیط را همراه تصویر می‌سازند.
  • طول کلیپ‌ها دو برابر شد. سقف رایج از ۸ تا ۱۰ ثانیه به ۱۵ و حالا ۳۰ ثانیه در یک بار ساخت رسیده است.
  • رقابت شرقی شد. در جدول‌های مقایسه‌ای سپتامبر ۲۰۲۶، مدل‌های Alibaba، ByteDance، Kuaishou و MiniMax بالاتر از اغلب نام‌های آمریکایی ایستاده‌اند.

سال ۲۰۲۶ برای ساخت ویدیو با هوش مصنوعی سال عجیبی بود. مدلی که دو سال پیش همه را شوکه کرد، یعنی Sora، کنار رفت. و چند مدلی که آن موقع کسی اسمشان را نمی‌دانست، حالا ابزار اصلی استودیوها هستند.

این مقاله خلاصه همان چیزی است که ما در Xeroframe Studio هر هفته دنبال می‌کنیم: کدام مدل آمد، چه چیزی واقعاً عوض شد و کدام تغییر به کار یک برند ایرانی می‌آید. اعداد و تاریخ‌ها از منابعی است که پایین صفحه لینک داده‌ایم.

01چه اتفاقی برای Sora افتاد؟

OpenAI نسخه Sora 2 را ۳۰ سپتامبر ۲۰۲۵ همراه با یک اپلیکیشن شبکه‌اجتماعی‌مانند منتشر کرد. چند ماه بعد، ۲۴ مارس ۲۰۲۶، اعلام کرد Sora را تعطیل می‌کند. اپ و نسخه وب ۲۶ آوریل بسته شد و API هم ۲۴ سپتامبر ۲۰۲۶ از دسترس خارج شد.

OpenAI دلیل مشخصی اعلام نکرد. گزارش‌هایی که ویکی‌پدیا جمع کرده، کمبود توان پردازشی، هزینه سنگین نگهداری و تمرکز شرکت روی محصولات سازمانی را دلیل اصلی می‌دانند. طبق همین گزارش‌ها تعداد کاربران فعال هم از حدود یک میلیون به زیر ۵۰۰ هزار نفر رسیده بود.

درسی که برای ما داشت ساده بود: هیچ پروژه‌ای را به یک مدل گره نزنید. تیمی که کل خط تولیدش را روی Sora ساخته بود، در عرض چند هفته مجبور شد همه‌چیز را عوض کند.

02مدل‌هایی که ۲۰۲۶ را ساختند

اگر حوصله خواندن همه جزئیات را ندارید، این جدول کافی است. پایین‌تر سراغ هر کدام می‌رویم.

مدل سازنده زمان انتشار حداکثر طول نکته مهم
Kling 3.0 Kuaishou فوریه ۲۰۲۶ ۱۵ ثانیه در هر شات دیالوگ لب‌خوانی‌شده به پنج زبان، چندشاتی
Seedance 2.0 ByteDance فوریه ۲۰۲۶ — واترمارک C2PA داخلی
Gemini Omni Flash Google معرفی در I/O، مه ۲۰۲۶ فعلاً ۱۰ ثانیه در Flow ویرایش ویدیو با گفت‌وگو
Kling 3.0 Turbo Kuaishou ژوئن ۲۰۲۶ — نسخه ارزان‌تر برای حجم بالا
Seedance 2.5 ByteDance ۳۱ ژوئیه ۲۰۲۶ ۳۰ ثانیه تا ۳۰ تصویر و ۱۰ ویدیوی مرجع
MiniMax H3 MiniMax ۳۱ ژوئیه ۲۰۲۶ ۱۵ ثانیه کیفیت 2K و صدای استریو
Wan 3.0 Alibaba ۲۴ اوت ۲۰۲۶ ۳۰ ثانیه ورودی متن، تصویر، ویدیو، صدا و حتی PDF

Kling 3.0؛ اولین مدلی که «کارگردانی» را جدی گرفت

Kuaishou نسخه ۳ کلینگ را فوریه ۲۰۲۶ منتشر کرد و مدتی صدر جدول Artificial Analysis بود. چیزی که ما را جذب کرد کیفیت خام نبود. کنترل بود: ساخت چند شات پشت سر هم در یک درخواست، کنترل حرکت دوربین در شش محور و کتابخانه‌ای از «المان‌ها» که صدای هر کاراکتر را هم به او قفل می‌کند.

برای تیزر تبلیغاتی این یعنی کاراکتر برند شما در شات اول و شات پنجم یک قیافه و یک صدا دارد. همین مشکل، یعنی تغییر چهره بین شات‌ها، تا سال پیش بزرگ‌ترین دردسر ما بود.

خرداد ۱۴۰۵ هم نسخه Turbo آمد که برای کارهای پرتعداد (مثلاً ده نسخه از یک ریلز برای مخاطب‌های مختلف) به‌صرفه‌تر است.

Seedance 2.5؛ سی ثانیه در یک نفس

ByteDance نسخه ۲.۵ را ۳۱ ژوئیه به‌عنوان محصول و ۷ اوت به‌صورت API عمومی منتشر کرد. دو عدد این مدل مهم است: ساخت تا ۳۰ ثانیه ویدیو با صدا در یک بار، و پذیرفتن تا ۳۰ تصویر، ۱۰ ویدیو و ۱۰ فایل صوتی به‌عنوان مرجع.

یک نکته فنی که در تبلیغات این مدل گم می‌شود: سرویس EvoLink که API را بررسی کرده، خروجی تأییدشده را تا 1080p اعلام کرده و صریحاً نوشته روی 4K بومی از طریق API حساب نکنید. اگر کسی به شما وعده 4K مستقیم از Seedance داد، بپرسید از کدام مسیر.

Gemini Omni؛ گوگل بازی را عوض کرد

گوگل ۲۹ اردیبهشت ۱۴۰۵ در کنفرانس I/O مدل Gemini Omni را معرفی کرد. دمیس هاسابیس آن را مدلی توصیف کرد که «از هر ورودی، هر چیزی می‌سازد». نسخه Flash اول در Flow (ابزار فیلم‌سازی گوگل) و برای مشترکان پولی فعال شد.

فرق اصلی Omni با Veo در ویرایش است. به‌جای اینکه پرامپت را از اول بنویسید، با خود ویدیو حرف می‌زنید: «نور را غروب کن»، «ماشین را قرمز کن». Veo 3.1 هم همچنان از طریق Gemini API در دسترس است و نسخه Lite آن از ۳۱ مارس با قیمت ۰٫۰۵ دلار برای هر ثانیه ویدیوی 720p عرضه شده.

MiniMax H3 و Wan 3.0؛ دو رقیب آخر تابستان

MiniMax روز ۳۱ ژوئیه مدل H3 را با خروجی 2K، حداکثر ۱۵ ثانیه و صدای استریوی بومی منتشر کرد و گفت وزن‌های مدل را به‌زودی منتشر می‌کند. تا وقتی این مقاله را می‌نوشتیم، منابع ما هنوز مخزن عمومی آن را تأیید نکرده بودند.

Alibaba هم ۲ شهریور ۱۴۰۵ (۲۴ اوت) نسخه Wan 3.0 را عرضه کرد: ۳۰ ثانیه، تا 1080p، و ورودی‌هایی که از تصویر و صدا فراتر می‌رود (PDF، فایل اکسل و پاورپوینت). برخلاف Wan 2.2 که متن‌باز بود، وزن‌های Wan 3.0 قابل دانلود نیست. قیمت پایه برای هر ثانیه 1080p حدود ۰٫۲۰ دلار اعلام شده؛ یعنی یک کلیپ ۳۰ ثانیه‌ای حدود ۶ دلار.

03سه تغییری که واقعاً مهم‌اند

جدول بالا پر از عدد است، اما اگر صاحب یک برند هستید فقط سه چیز را به خاطر بسپارید.

اول، صدا دیگر جدا ساخته نمی‌شود. تا سال قبل ویدیو را با یک ابزار می‌ساختیم، صدا را با ابزاری دیگر و بعد ساعت‌ها لب‌ها را با دیالوگ هماهنگ می‌کردیم. حالا مدل‌ها دیالوگ، صدای قدم‌ها و همهمه کافه را همراه تصویر تولید می‌کنند. صداگذاری حرفه‌ای هنوز لازم است (موسیقی برند، گوینده، میکس نهایی)، ولی مرحله‌های خسته‌کننده کم شده.

دوم، ثبات کاراکتر حل شده؛ تقریباً. ورودی‌های مرجع چندگانه یعنی می‌شود صورت یک بازیگر، محصول شما یا لوگو را در کل تیزر ثابت نگه داشت. هنوز هم در شات‌های نزدیک گاهی جزئیات جابه‌جا می‌شود و برای همین بازبینی فریم‌به‌فریم را حذف نکرده‌ایم.

سوم، یک مدل برای همه‌چیز وجود ندارد. در پروژه‌هایمان معمولاً شات‌های محیطی را با یک مدل، دیالوگ‌ها را با مدلی دیگر و ویرایش نهایی را با ابزار سوم انجام می‌دهیم. تعطیلی Sora نشان داد این تنوع فقط سلیقه نیست؛ بیمه است.

04این اخبار برای کسب‌وکارهای ایرانی چه معنایی دارد؟

خبر خوب این است که هزینه ساخت هر ثانیه ویدیو با هوش مصنوعی در یک سال چند برابر ارزان‌تر شده. خبر نه‌چندان خوب: دسترسی به این مدل‌ها از ایران معمولاً حساب خارجی و پرداخت ارزی می‌خواهد، و هر مدل منحنی یادگیری خودش را دارد. یک تیزر خوب حاصل صدها بار ساخت و انتخاب است، نه یک پرامپت.

کالشی (Kalshi) را یادتان هست؟ تبلیغی که خرداد ۱۴۰۴ در فینال NBA پخش شد با Veo 3 ساخته شده بود و کمتر از ۲ هزار دلار هزینه تولید داشت. سازنده‌اش، پی‌جی آکتورو، گفته بود برای ۱۵ کلیپ قابل‌استفاده حدود ۳۰۰ تا ۴۰۰ بار ویدیو ساخته. جمله‌ای هم دارد که ما خیلی قبولش داریم: «اینکه ارزان بود معنی‌اش این نیست که هر کسی می‌تواند بسازدش.»

اگر می‌خواهید خودتان شروع کنید، آموزش قدم‌به‌قدم ساخت ویدیو با هوش مصنوعی و راهنمای پرامپت نویسی ویدیو را بخوانید. اگر وقتش را ندارید، خدمات ساخت ویدیو با هوش مصنوعی ما دقیقاً برای همین است.

05قدم بعدی چیست؟

انتظار ما برای چند ماه آینده: کلیپ‌های طولانی‌تر از یک دقیقه در یک بار ساخت، ابزارهای ویرایش گفت‌وگومحور بیشتر و قانون‌های سخت‌گیرانه‌تر برای برچسب‌گذاری. از ۱۱ مرداد ۱۴۰۵ قانون هوش مصنوعی اتحادیه اروپا برچسب‌گذاری دیپ‌فیک‌ها را اجباری کرده و یوتیوب هم ویدیوهای واقع‌نما را خودکار برچسب می‌زند. جزئیات را در مقاله قوانین برچسب ویدیوهای هوش مصنوعی نوشته‌ایم.

این مقاله را با هر خبر مهم به‌روز می‌کنیم.

FAQسوالات متداول

آیا Sora هنوز قابل استفاده است؟

خیر. اپلیکیشن و وب Sora از ۲۶ آوریل ۲۰۲۶ بسته شده و API آن هم ۲۴ سپتامبر ۲۰۲۶ خاموش شد. ویدیوهایی که قبلاً ساخته‌اید فقط تا زمانی که OpenAI امکان دانلود داده بود قابل دریافت بودند.

بهترین مدل ساخت ویدیو با هوش مصنوعی در ۲۰۲۶ کدام است؟

یک جواب واحد وجود ندارد. Seedance 2.5 و Wan 3.0 برای کلیپ‌های بلند ۳۰ ثانیه‌ای، Kling 3.0 برای کنترل دوربین و چندشاتی، و Gemini Omni برای ویرایش گفت‌وگومحور قوی‌ترند. استودیوهای حرفه‌ای معمولاً چند مدل را کنار هم استفاده می‌کنند.

ساخت هر ثانیه ویدیو با هوش مصنوعی چقدر هزینه دارد؟

قیمت API بسته به مدل و کیفیت بین حدود ۰٫۰۵ تا ۰٫۴۰ دلار برای هر ثانیه است. این فقط هزینه ساخت خام است؛ چون برای هر شات خوب ده‌ها بار ساخت لازم است، هزینه واقعی چند برابر می‌شود.

این مقاله با اخبار تازه به‌روز می‌شود. آخرین بازبینی: ۱۰ مهر ۱۴۰۵

تحریریه Xeroframe Studio

تیم کارگردانی، سناریونویسی و تولید Xeroframe Studio؛ استودیویی که ویدیو را با هوش مصنوعی و روش‌های کلاسیک فیلمسازی می‌سازد. درباره ما بیشتر بخوانید.

ایده‌ت رو بگو، بقیه‌ش با ما.

یه جلسه مشاوره رایگان رزرو کن تا درباره پروژه‌ت حرف بزنیم و بهترین مسیر ساختش رو بهت پیشنهاد بدیم.

درخواست مشاوره رایگان