جدیدترین مدلهای ساخت ویدیو با هوش مصنوعی در ۲۰۲۶؛ از خداحافظی Sora تا Wan 3.0
OpenAI پرونده Sora را بست و مدلهای چینی صدر جدولها را گرفتند. مرور ماهبهماه اتفاقات ۲۰۲۶ و اینکه برای تیزر بعدی برندتان چه معنایی دارد.
- Sora دیگر وجود ندارد. اپلیکیشن و وب Sora در ۶ اردیبهشت ۱۴۰۵ (۲۶ آوریل ۲۰۲۶) بسته شد و API آن هم ۲ مهر ۱۴۰۵ (۲۴ سپتامبر ۲۰۲۶) خاموش شد.
- صدای همزمان حالا استاندارد است. Kling 3.0، Seedance 2.5، MiniMax H3 و Wan 3.0 همه دیالوگ، افکت و صدای محیط را همراه تصویر میسازند.
- طول کلیپها دو برابر شد. سقف رایج از ۸ تا ۱۰ ثانیه به ۱۵ و حالا ۳۰ ثانیه در یک بار ساخت رسیده است.
- رقابت شرقی شد. در جدولهای مقایسهای سپتامبر ۲۰۲۶، مدلهای Alibaba، ByteDance، Kuaishou و MiniMax بالاتر از اغلب نامهای آمریکایی ایستادهاند.
سال ۲۰۲۶ برای ساخت ویدیو با هوش مصنوعی سال عجیبی بود. مدلی که دو سال پیش همه را شوکه کرد، یعنی Sora، کنار رفت. و چند مدلی که آن موقع کسی اسمشان را نمیدانست، حالا ابزار اصلی استودیوها هستند.
این مقاله خلاصه همان چیزی است که ما در Xeroframe Studio هر هفته دنبال میکنیم: کدام مدل آمد، چه چیزی واقعاً عوض شد و کدام تغییر به کار یک برند ایرانی میآید. اعداد و تاریخها از منابعی است که پایین صفحه لینک دادهایم.
01چه اتفاقی برای Sora افتاد؟
OpenAI نسخه Sora 2 را ۳۰ سپتامبر ۲۰۲۵ همراه با یک اپلیکیشن شبکهاجتماعیمانند منتشر کرد. چند ماه بعد، ۲۴ مارس ۲۰۲۶، اعلام کرد Sora را تعطیل میکند. اپ و نسخه وب ۲۶ آوریل بسته شد و API هم ۲۴ سپتامبر ۲۰۲۶ از دسترس خارج شد.
OpenAI دلیل مشخصی اعلام نکرد. گزارشهایی که ویکیپدیا جمع کرده، کمبود توان پردازشی، هزینه سنگین نگهداری و تمرکز شرکت روی محصولات سازمانی را دلیل اصلی میدانند. طبق همین گزارشها تعداد کاربران فعال هم از حدود یک میلیون به زیر ۵۰۰ هزار نفر رسیده بود.
درسی که برای ما داشت ساده بود: هیچ پروژهای را به یک مدل گره نزنید. تیمی که کل خط تولیدش را روی Sora ساخته بود، در عرض چند هفته مجبور شد همهچیز را عوض کند.
02مدلهایی که ۲۰۲۶ را ساختند
اگر حوصله خواندن همه جزئیات را ندارید، این جدول کافی است. پایینتر سراغ هر کدام میرویم.
| مدل | سازنده | زمان انتشار | حداکثر طول | نکته مهم |
|---|---|---|---|---|
| Kling 3.0 | Kuaishou | فوریه ۲۰۲۶ | ۱۵ ثانیه در هر شات | دیالوگ لبخوانیشده به پنج زبان، چندشاتی |
| Seedance 2.0 | ByteDance | فوریه ۲۰۲۶ | — | واترمارک C2PA داخلی |
| Gemini Omni Flash | معرفی در I/O، مه ۲۰۲۶ | فعلاً ۱۰ ثانیه در Flow | ویرایش ویدیو با گفتوگو | |
| Kling 3.0 Turbo | Kuaishou | ژوئن ۲۰۲۶ | — | نسخه ارزانتر برای حجم بالا |
| Seedance 2.5 | ByteDance | ۳۱ ژوئیه ۲۰۲۶ | ۳۰ ثانیه | تا ۳۰ تصویر و ۱۰ ویدیوی مرجع |
| MiniMax H3 | MiniMax | ۳۱ ژوئیه ۲۰۲۶ | ۱۵ ثانیه | کیفیت 2K و صدای استریو |
| Wan 3.0 | Alibaba | ۲۴ اوت ۲۰۲۶ | ۳۰ ثانیه | ورودی متن، تصویر، ویدیو، صدا و حتی PDF |
Kling 3.0؛ اولین مدلی که «کارگردانی» را جدی گرفت
Kuaishou نسخه ۳ کلینگ را فوریه ۲۰۲۶ منتشر کرد و مدتی صدر جدول Artificial Analysis بود. چیزی که ما را جذب کرد کیفیت خام نبود. کنترل بود: ساخت چند شات پشت سر هم در یک درخواست، کنترل حرکت دوربین در شش محور و کتابخانهای از «المانها» که صدای هر کاراکتر را هم به او قفل میکند.
برای تیزر تبلیغاتی این یعنی کاراکتر برند شما در شات اول و شات پنجم یک قیافه و یک صدا دارد. همین مشکل، یعنی تغییر چهره بین شاتها، تا سال پیش بزرگترین دردسر ما بود.
خرداد ۱۴۰۵ هم نسخه Turbo آمد که برای کارهای پرتعداد (مثلاً ده نسخه از یک ریلز برای مخاطبهای مختلف) بهصرفهتر است.
Seedance 2.5؛ سی ثانیه در یک نفس
ByteDance نسخه ۲.۵ را ۳۱ ژوئیه بهعنوان محصول و ۷ اوت بهصورت API عمومی منتشر کرد. دو عدد این مدل مهم است: ساخت تا ۳۰ ثانیه ویدیو با صدا در یک بار، و پذیرفتن تا ۳۰ تصویر، ۱۰ ویدیو و ۱۰ فایل صوتی بهعنوان مرجع.
یک نکته فنی که در تبلیغات این مدل گم میشود: سرویس EvoLink که API را بررسی کرده، خروجی تأییدشده را تا 1080p اعلام کرده و صریحاً نوشته روی 4K بومی از طریق API حساب نکنید. اگر کسی به شما وعده 4K مستقیم از Seedance داد، بپرسید از کدام مسیر.
Gemini Omni؛ گوگل بازی را عوض کرد
گوگل ۲۹ اردیبهشت ۱۴۰۵ در کنفرانس I/O مدل Gemini Omni را معرفی کرد. دمیس هاسابیس آن را مدلی توصیف کرد که «از هر ورودی، هر چیزی میسازد». نسخه Flash اول در Flow (ابزار فیلمسازی گوگل) و برای مشترکان پولی فعال شد.
فرق اصلی Omni با Veo در ویرایش است. بهجای اینکه پرامپت را از اول بنویسید، با خود ویدیو حرف میزنید: «نور را غروب کن»، «ماشین را قرمز کن». Veo 3.1 هم همچنان از طریق Gemini API در دسترس است و نسخه Lite آن از ۳۱ مارس با قیمت ۰٫۰۵ دلار برای هر ثانیه ویدیوی 720p عرضه شده.
MiniMax H3 و Wan 3.0؛ دو رقیب آخر تابستان
MiniMax روز ۳۱ ژوئیه مدل H3 را با خروجی 2K، حداکثر ۱۵ ثانیه و صدای استریوی بومی منتشر کرد و گفت وزنهای مدل را بهزودی منتشر میکند. تا وقتی این مقاله را مینوشتیم، منابع ما هنوز مخزن عمومی آن را تأیید نکرده بودند.
Alibaba هم ۲ شهریور ۱۴۰۵ (۲۴ اوت) نسخه Wan 3.0 را عرضه کرد: ۳۰ ثانیه، تا 1080p، و ورودیهایی که از تصویر و صدا فراتر میرود (PDF، فایل اکسل و پاورپوینت). برخلاف Wan 2.2 که متنباز بود، وزنهای Wan 3.0 قابل دانلود نیست. قیمت پایه برای هر ثانیه 1080p حدود ۰٫۲۰ دلار اعلام شده؛ یعنی یک کلیپ ۳۰ ثانیهای حدود ۶ دلار.
03سه تغییری که واقعاً مهماند
جدول بالا پر از عدد است، اما اگر صاحب یک برند هستید فقط سه چیز را به خاطر بسپارید.
اول، صدا دیگر جدا ساخته نمیشود. تا سال قبل ویدیو را با یک ابزار میساختیم، صدا را با ابزاری دیگر و بعد ساعتها لبها را با دیالوگ هماهنگ میکردیم. حالا مدلها دیالوگ، صدای قدمها و همهمه کافه را همراه تصویر تولید میکنند. صداگذاری حرفهای هنوز لازم است (موسیقی برند، گوینده، میکس نهایی)، ولی مرحلههای خستهکننده کم شده.
دوم، ثبات کاراکتر حل شده؛ تقریباً. ورودیهای مرجع چندگانه یعنی میشود صورت یک بازیگر، محصول شما یا لوگو را در کل تیزر ثابت نگه داشت. هنوز هم در شاتهای نزدیک گاهی جزئیات جابهجا میشود و برای همین بازبینی فریمبهفریم را حذف نکردهایم.
سوم، یک مدل برای همهچیز وجود ندارد. در پروژههایمان معمولاً شاتهای محیطی را با یک مدل، دیالوگها را با مدلی دیگر و ویرایش نهایی را با ابزار سوم انجام میدهیم. تعطیلی Sora نشان داد این تنوع فقط سلیقه نیست؛ بیمه است.
04این اخبار برای کسبوکارهای ایرانی چه معنایی دارد؟
خبر خوب این است که هزینه ساخت هر ثانیه ویدیو با هوش مصنوعی در یک سال چند برابر ارزانتر شده. خبر نهچندان خوب: دسترسی به این مدلها از ایران معمولاً حساب خارجی و پرداخت ارزی میخواهد، و هر مدل منحنی یادگیری خودش را دارد. یک تیزر خوب حاصل صدها بار ساخت و انتخاب است، نه یک پرامپت.
کالشی (Kalshi) را یادتان هست؟ تبلیغی که خرداد ۱۴۰۴ در فینال NBA پخش شد با Veo 3 ساخته شده بود و کمتر از ۲ هزار دلار هزینه تولید داشت. سازندهاش، پیجی آکتورو، گفته بود برای ۱۵ کلیپ قابلاستفاده حدود ۳۰۰ تا ۴۰۰ بار ویدیو ساخته. جملهای هم دارد که ما خیلی قبولش داریم: «اینکه ارزان بود معنیاش این نیست که هر کسی میتواند بسازدش.»
اگر میخواهید خودتان شروع کنید، آموزش قدمبهقدم ساخت ویدیو با هوش مصنوعی و راهنمای پرامپت نویسی ویدیو را بخوانید. اگر وقتش را ندارید، خدمات ساخت ویدیو با هوش مصنوعی ما دقیقاً برای همین است.
05قدم بعدی چیست؟
انتظار ما برای چند ماه آینده: کلیپهای طولانیتر از یک دقیقه در یک بار ساخت، ابزارهای ویرایش گفتوگومحور بیشتر و قانونهای سختگیرانهتر برای برچسبگذاری. از ۱۱ مرداد ۱۴۰۵ قانون هوش مصنوعی اتحادیه اروپا برچسبگذاری دیپفیکها را اجباری کرده و یوتیوب هم ویدیوهای واقعنما را خودکار برچسب میزند. جزئیات را در مقاله قوانین برچسب ویدیوهای هوش مصنوعی نوشتهایم.
این مقاله را با هر خبر مهم بهروز میکنیم.
FAQسوالات متداول
آیا Sora هنوز قابل استفاده است؟
خیر. اپلیکیشن و وب Sora از ۲۶ آوریل ۲۰۲۶ بسته شده و API آن هم ۲۴ سپتامبر ۲۰۲۶ خاموش شد. ویدیوهایی که قبلاً ساختهاید فقط تا زمانی که OpenAI امکان دانلود داده بود قابل دریافت بودند.
بهترین مدل ساخت ویدیو با هوش مصنوعی در ۲۰۲۶ کدام است؟
یک جواب واحد وجود ندارد. Seedance 2.5 و Wan 3.0 برای کلیپهای بلند ۳۰ ثانیهای، Kling 3.0 برای کنترل دوربین و چندشاتی، و Gemini Omni برای ویرایش گفتوگومحور قویترند. استودیوهای حرفهای معمولاً چند مدل را کنار هم استفاده میکنند.
ساخت هر ثانیه ویدیو با هوش مصنوعی چقدر هزینه دارد؟
قیمت API بسته به مدل و کیفیت بین حدود ۰٫۰۵ تا ۰٫۴۰ دلار برای هر ثانیه است. این فقط هزینه ساخت خام است؛ چون برای هر شات خوب دهها بار ساخت لازم است، هزینه واقعی چند برابر میشود.
منابع
این مقاله با اخبار تازه بهروز میشود. آخرین بازبینی: ۱۰ مهر ۱۴۰۵
مشاوره رایگان