Kling VIDEO 3.0 نسل جدید مدل ویدئوساز Kling AI است که با تمرکز بر افزایش کنترل روایی، ثبات عناصر بصری و تولید همزمان صدا و تصویر توسعه یافته است. این نسخه در ادامه مسیر مدلهای VIDEO O1 و VIDEO 2.6 قرار میگیرد و با استفاده از یک چارچوب یکپارچه چندوجهی، ارتباط دقیقتری میان متن، تصویر، شخصیت، صدا و حرکت برقرار میکند.
پشتیبانی از ویدئوهای 3 تا 15 ثانیهای، تولید Native Audio، مدیریت چند شخصیت و امکان تعریف چند شات، دامنه استفاده از مدل را برای تولید محتوای تبلیغاتی، سینمایی و شبکههای اجتماعی گستردهتر کرده است. در ادامه، مهمترین قابلیتهای این مدل و تفاوت آن با نسخه 2.6 را بررسی میکنیم تا مشخص شود این ارتقا دقیقاً چه تغییراتی ایجاد کرده است.
امکانات Kling VIDEO 3.0
Kling VIDEO 3.0 صرفاً یک مدل Text-to-Video با کیفیت بالاتر نیست؛ معماری و قابلیتهای آن برای کنترل دقیقتر اجزای یک ویدئو توسعه یافتند. در این قسمت به معرفی کامل قابلیتهای این AI تصویر میپردازیم.
مدت زمان انعطافپذیر
یکی از تغییرات کاربردی Kling VIDEO 3.0، حذف محدودیت ثابت در مدت خروجی است. این مدل میتواند ویدئوهایی با طول 3 تا 15 ثانیه تولید کند؛ بنابراین کاربر مجبور نیست برای هر سناریو از یک زمان خروجی مشخص استفاده کند. در پروژههای ساده، انتخاب مدت کوتاهتر میتواند برای کنترل بهتر هزینه و تمرکز روی یک حرکت مشخص مناسب باشد؛ در حالی که سناریوهای پیچیدهتر میتوانند از زمان طولانیتر برای نمایش پیوسته رویدادها استفاده کنند.
این قابلیت بهخصوص در اجرای حرکتهای چندمرحلهای، تغییر وضعیت شخصیت یا توسعه تدریجی یک صحنه اهمیت دارد. خروجی 15 ثانیهای همچنین امکان روایت یک توالی کاملتر را در یک تولید فراهم میکند و در نتیجه، نیاز به اتصال چند کلیپ مستقل برای نمایش یک حرکت یا اتفاق واحد کمتر خواهد شد.
گویشها و لهجههای متفاوت

Native Audio در Kling VIDEO 3.0 علاوه بر تولید صدا، کنترل بیشتری روی نحوه صحبتکردن شخصیتها فراهم میکند. مدل از تولید دیالوگ در پنج زبان چینی، انگلیسی، ژاپنی، کرهای و اسپانیایی پشتیبانی میکند و امکان جابهجایی میان زبانها در یک ویدئو نیز وجود دارد. بخش مهمتر، پشتیبانی از برخی لهجهها و گویشها است.
برای نمونه، مدل میتواند در زبان انگلیسی لهجههایی مانند آمریکایی، بریتانیایی و هندی را شبیهسازی کند و در زبان چینی نیز نمونههایی مانند کانتونی، پکن، تایوانی، شمالشرقی و سیچوانی را هدف قرار دهد. کافی است مشخصات زبانی و لهجهای شخصیت در Prompt تعیین شود. این ویژگی در صحنههای چندفرهنگی و دیالوگهای واقعگرایانه، هماهنگی میان گفتار، حالت چهره و حرکت لب را بهبود میدهد.
استفاده از فریم شروع + مرجع عنصر
Kling VIDEO 3.0 امکان ترکیب Start Frame با Element Reference را فراهم میکند تا کنترل بیشتری روی هویت و ثبات عناصر صحنه ایجاد شود. در حالت عادی، یک تصویر شروع میتواند نقطه آغاز ویدئو باشد؛ اما با اتصال عنصر مرجع، ویژگیهای مشخص شخصیت، شیء یا سایر عناصر مهم نیز به مدل معرفی میشوند.
این ساختار برای صحنههایی که حرکت دوربین، زوم، پن و تغییر موقعیت دارند اهمیت زیادی دارد؛ زیرا هدف آن جلوگیری از تغییر محسوس ظاهر سوژه در طول تولید است. عنصر شخصیت را میتوان از طریق ویدئو یا چند تصویر مرجع ایجاد کرد و در مورد شخصیتها، حتی ویژگی صوتی نیز به عنصر متصل میشود. بنابراین کنترل فقط به ظاهر محدود نیست و میتواند ثبات بصری و صوتی شخصیت را همزمان تقویت کند.
ارجاع چند کاراکتری
مدیریت همزمان چند شخصیت یکی از بخشهایی است که Kling VIDEO 3.0 نسبت به نسل قبلی توسعه داد. در صحنههایی که سه شخصیت یا بیشتر حضور دارند، میتوان نام یا نقش هر کاراکتر را مستقیما در Prompt مشخص کرد و دیالوگ مربوط به همان شخصیت را کنار آن قرار داد. مدل سپس تلاش میکند ارتباط میان شخصیت و جمله را حفظ کند تا گفتوگوها میان افراد مختلف جابهجا نشوند.
این قابلیت برای صحنههای خانوادگی، مصاحبه، گفتوگوهای گروهی و موقعیتهای داستانی اهمیت ویژهای دارد. در نسخه 2.6 مدیریت چنین ارجاعهایی در صحنههای چندشخصیتی محدودتر بود؛ اما VIDEO 3.0 با تمرکز بیشتر بر Coreference میتواند روابط میان شخصیتها، دیالوگها و نقش آنها را دقیقتر دنبال کند و خروجی منسجمتری ارائه دهد.
قابلیت چند شاتی
Multi-Shot در Kling VIDEO 3.0 به مدل اجازه میدهد یک سناریو را به مجموعهای از نماها و تغییرات دوربین تبدیل کند. با فعالکردن این گزینه، مدل میتواند بر اساس Prompt، انتقال میان نماها، قاببندی و زاویه دوربین را برنامهریزی کند؛ بنابراین یک سناریوی گفتوگومحور ممکن است بهصورت خودکار از نمای عمومی به کلوزآپ شخصیتها تغییر کند.
در حالت Custom Multi-Shot کنترل دقیقتری در اختیار کاربر قرار میگیرد و میتوان تعداد شاتها، محتوای هر نما و مدتزمان آنها را مشخص کرد. این قابلیت برای ساخت سکانسهای داستانی، تبلیغات و ویدئوهای سینمایی اهمیت دارد؛ زیرا بخشی از تصمیمگیری مربوط به پوشش صحنه و تدوین بصری را به مدل واگذار میکند؛ بدون آنکه کاربر الزاما چند کلیپ جداگانه تولید و مونتاژ کند.
جدول مقایسه Kling VIDEO 3.0 با Kling VIDEO 2.6

برای درک تفاوت دو نسل، بررسی قابلیتها در کنار یکدیگر تصویر دقیقتری ارائه میدهد. جدول زیر این تفاوتها را بهصورت فشرده به نمایش میگذارد تا پیش از خرید اکانت Kling AI، راحتتر تصمیم بگیرید.
| قابلیت | Kling VIDEO 2.6 | Kling VIDEO 3.0 |
| Text-to-Video | ✅ | ✅ |
| Image-to-Video | ✅ | ✅ |
| Start & End Frames-to-Video | ✅ | ✅ |
| Native Audio | ✅ | ✅ |
| Multi-Shot | ❌ | ✅ |
| Start Frame + Element Reference | ❌ | ✅ |
| Multi-Character Coreference (3+) | ❌ | ✅ |
| زبانهای چندگانه | ❌ | ✅ |
| گویش و لهجه | ❌ | ✅ |
| خروجی 15 ثانیهای | ❌ | ✅ |
| مدت زمان انعطافپذیر | ❌ | ✅ |
جمعبندی
Kling VIDEO 3.0 را میتوان یک ارتقای مهم در زمینه کنترل روایی، ثبات عناصر و تولید ویدئوی چندوجهی دانست. نقطه تمایز اصلی این مدل تنها افزایش مدت خروجی نیست؛ بلکه ترکیب Multi-Shot، Element Reference، ارجاع دقیق چند شخصیت، Native Audio و پشتیبانی از زبانها و لهجههای مختلف، فرایند ساخت سکانسهای پیچیدهتر را ساختاریافتهتر میکند.
امکان تولید ویدئو از 3 تا 15 ثانیه نیز دست کاربر را برای انتخاب مدت مناسب باز میگذارد. در کنار این موارد، قابلیت حفظ متن و جزئیات بصری در صحنه میتواند برای تبلیغات و محتوای تجاری ارزشمند باشد. اگر هدف، تولید کلیپهایی با شخصیتهای پایدار، دیالوگ مشخص، حرکت دوربین و روایت چندمرحلهای باشد، VIDEO 3.0 نسبت به 2.6 ابزارهای کنترلی گستردهتری در اختیار کاربر قرار میدهد.
سوالات متداول
1. مهمترین قابلیت نسخه دوم مدل فیلمسازی کلینگ چیست؟
مهمترین ارتقای Kling VIDEO 3.0، ترکیب Native Audio، ثبات عناصر، Multi-Shot و کنترل چندشخصیتی است که امکان تولید ویدئوهای روایی پیچیدهتر را فراهم میکند.
2. منظور از قابلیت چند شاتی Kling VIDEO 3.0 چیست؟
Multi-Shot امکان تولید چند نمای متوالی در یک ویدئو را فراهم میکند و مدل میتواند انتقال نماها، قاببندی و زاویه دوربین را براساس سناریو تنظیم کند.
3. چه تفاوتی میان نسخه 2 و 3 Kling VIDEO وجود دارد؟
VIDEO 3.0 نسبت به 2.6 قابلیتهایی مانند Multi-Shot، ارجاع عناصر، مدیریت چند شخصیت، پشتیبانی لهجهها، زبانهای بیشتر و خروجی 3 تا 15 ثانیهای دارد.



