انقلاب گوگل در تولید و ویرایش ویدیو با Gemini Omni
گوگل سالهاست که درباره هوش مصنوعی چندوجهی (Multimodal AI) صحبت میکند. متن، تصویر، صدا، ویدیو، کدنویسی، جستجو و عاملهای هوشمند (Agents): همه و همه به آرامی در حال کشیده شدن به مدار یکپارچهی خانوادهی Gemini هستند.
معرفی Gemini Omni به عنوان گام بعدی و بدیهی در این مسیر احساس میشود، اما همزمان این گام به طرز عجیبی جاهطلبانه است.
این سیستم که در کنفرانس Google I/O 2026 معرفی شد، خانواده مدل بهروز گوگل برای ایجاد و ویرایش رسانه از طریق ورودیهای ترکیبی است. اولین ادیشن ارائه شده از این خانواده، Gemini Omni Flash نام دارد و گوگل کار خود را مستقیما با «ویدیو» آغاز کرده است.
این بخش آخر بسیار مهم است. Omni صرفا یک ارتقای ساده برای چتباتها نیست. این مدل، تلاش بلندپروازانهی گوگل برای فروپاشی و ادغام چندین جریان کاری خلاقانه مبتنی بر هوش مصنوعی در یک مدل واحد است: تبدیل متن به ویدیو (Text-to-video)، تبدیل تصویر به ویدیو (Image-to-video)، ویرایش ویدیو، تولید محتوای حساس به صدا (Audio-aware generation)، انتقال سبک، ساخت آواتار و در نهایت پشتیبانی از انواع خروجیهای دیگر.
اگر پیگیر مقایسهی نسل فعلی تولیدکنندگان ویدیوی هوش مصنوعی بودهاید، باید بدانید که Omni در تلاش است تا این دستهبندی را از «تولید یکباره» به چیزی بسیار «قابل ویرایشتر» و تعاملیتر تبدیل کند.
اگر این همه قابلیت برای یک مدل، بیش از حد سنگین و زیاد به نظر میرسد، باید بگوییم: بله، حق با شماست؛ و دقیقا نکته اصلی ماجرا همین است!
Gemini Omni مدل نوین و چندوجهی گوگل برای تولید محتواست. گوگل این سیستم را به عنوان نقطهای توصیف میکند که در آن «توانایی استدلال Gemini با توانایی خلق کردن تلاقی پیدا میکند.»
از منظر کاربردی، Omni میتواند انواع مختلفی از ورودیها، از جمله متن، تصویر، صدا و ویدیو را دریافت کرده و سپس طبق آن ورودیها، ویدیوی تازهی تولید یا ویرایش کند.
به عنوان مثال، شما میتوانید موارد زیر را به آن بدهید:
سپس میتوانید از آن بخواهید ویدیوی تازهی تولید کند که از حرکت کلیپ اصلی پیروی کند، با سبک و استایل تصویر مرجع مطابقت داشته باشد، به صدای مرجع واکنش نشان دهد و بخشهای خاصی از صحنه را تغییر دهد.
این همان بخشی است که گوگل به شدت روی آن مانور میدهد: Omni فقط درباره تولید یک چیز از صفر نیست. بلکه درباره ویرایش از طریق مکالمه است.
شما میتوانید از این هوش مصنوعی بخواهید یک شیء را تغییر دهد، زاویه دوربین را تنظیم کند، یک شخصیت را به محیط متفاوتی منتقل کند، جلوههای ویژه اضافه کند یا یک صحنه را در طول چندین پرامپتِ متوالی اصلاح و پالایش کند. به گفته گوگل، این مدل به گونهای طراحی شده است که در طول یک ویرایش چندمرحلهای (Multi-turn edit)، شخصیتها را ثابت نگه دارد، بافت صحنه را حفظ کند و دقیقا بفهمد که پیش از این چه اتفاقی افتاده است.
اولین عضو خانواده Omni، مدل Gemini Omni Flash است. گوگل در شرایط فعلی این مدل را برای مشترکین سرویسهای Google AI Plus، Pro و Ultra از طریق اپلیکیشن Gemini و پلتفرم Google Flow عرضه میکند. علاوه بر این از همان هفتهی معرفی، این قابلیت به صورت مجانی برای کاربران 18 سال به بالایِ نرمافزار YouTube Create و بخش YouTube Shorts Remix در دسترس قرار گرفته است.
توسعهدهندگان و مشتریان سازمانی بلافاصله به آن دسترسی نخواهند داشت. گوگل خبر داده است که دسترسی به رابط برنامهنویسی (API) در ماههای آینده فراهم خواهد شد.
این نحوه عرضه تبیینات زیادی درباره دیدگاه گوگل نسبت به اولین کاربرد این سیستم به ما میدهد. Omni پیش از آنکه به یک مدل پلتفرمی برای برنامهنویسان و توسعهدهندگان تبدیل شود، به عنوان یک ابزار خلاقانه برای کاربران عادی، تولیدکنندگان محتوا و جریانهای کاری ویدیویی در حال راهاندازی است.
ادیشن کوتاه: Gemini Omni میتواند با استفاده از ترکیبی از ورودیهای متنی، تصویری، صوتی و ویدیویی، ویدیوهای بهروز بسازد و ویرایش کند.
ویرایش جذابتر: نحوه ترکیب این ورودیها با یکدیگر است.
بارزترین خصوصیت این مدل، ویرایش ویدیو با استفاده از زبان طبیعی است. به جای باز کردن یک تایملاین (Timeline) در نرمافزارهای سنتی مثل پریمیر (Premiere Pro)، ماسک کردن دستی اشیاء، افزودن افکتها و تنظیم لایهها، شما به سادگی چیزی را که میخواهید تغییر کند، توصیف میکنید.
مثالهای گوگل شامل پرامپتهایی از این دست است:
این مدل میتواند دستورالعملهای قبلی را به خاطر بسپارد و روی آنها بسازد؛ بنابراین فرآیند ویرایش جامعا به صورت محاورهای درمیآید. شما یک تغییر ایجاد میکنید، به برآیند نگاه میکنید و سپس بدون نیاز به شروع کار مجدد از صفر، درخواست تغییر دیگری میدهید.
اگر این قابلیت همانطور که نشان داده شده است کار کند، میتواند یکی از مفیدترین بخشهای Omni باشد. اکثر ابزارهای ویدیوییِ هوش مصنوعی در تولید یک کلیپ اولیه خوب عمل میکنند، اما زمانی که شما یک تغییر خاص میخواهید، کلافهکننده میشوند. Omni به وضوح در تلاش است تا «بازبینی و اصلاح» را به بخشی از جریان کاری هستهای تبدیل کند.
Omni میتواند به طور همزمان از چندین ورودی استفاده کند. شما میتوانید تصویری از یک شخصیت، عکسی به عنوان مرجع استایل (Style reference)، یک ویدیوی موجود و یک ترک صوتی ارائه دهید، سپس از مدل بخواهید کلیپ نوینی تولید کند که همه این قطعات را در یک خروجی واحد ترکیب کند.
این مبحث درها را به سوی جریانهای کاری بسیار کنترلشدهتر باز میکند. به جای اینکه از یک مدل هوش مصنوعی بخواهید “یک ویدیوی علمی-تخیلی بسازد” و امیدوار باشید که درست حدس بزند، میتوانید برآیند را با مراجع و رفرنسهای واقعی لنگر کنید.
این قابلیت مخصوصا برای سازندگانی که از قبل داراییهایی (Assets) دارند بسیار مفید است: طرحهای اولیه (Sketches)، عکسهای محصول، فیلمهای تستی، مودبوردها (Moodboards)، موسیقی یا انیمیشنهای خام. Omni میتواند از این موارد به عنوان دستورالعملهای خلاقانه استفاده کند، نه صرفا به عنوان یک فایل پیوست.
گوگل علاوه بر این Omni را به عنوان مدلی با “درک بهتر از جهان فیزیکی” معرفی میکند. در مثالها به گرانش، انرژی جنبشی، دینامیک سیالات، حرکت دوربین و تداوم صحنه اشاره شده است. به زبان ساده: فرض بر این است که این مدل درک میکند اشیاء چگونه باید در دنیای واقعی حرکت کنند، نه اینکه فقط یک ویدیو فریم به فریم چگونه باید به نظر برسد.
این دقیقا همان نقطهضعف واقعی در هوش مصنوعیهای ویدیویی فعلی است. بسیاری از کلیپهای تولید شده در ثانیه اول چشمگیر به نظر میرسد، اما بعد از آن ناگهان دستها ذوب میشوند، اشیاء جابجا میشوند، قوانین فیزیک نقض میگردد یا صحنه به آرامی قوانین منطقی خود را فراموش میکند.
گوگل ادعا میکند که Omni شهود و درک قویتری برای تداوم دارد. البته ما هنوز برای درک میزان موفقیت این ادعا به آزمایشهای دنیای واقعی نیاز داریم، اما مسیر جامعا مشخص است: “کلیپهای زیباتر” دیگر کافی نیستند. نسل بعدی مدلهای ویدیویی باید در یک سیستم واحد، بیشتر شبیه به یک کارگردان، تدوینگر، انیماتور و شبیهساز آگاه به فیزیک عمل کنند.
یکی از کاربردیترین مثالهای ارائه شده توسط گوگل، استفاده از Gemini Omni برای ساخت ویدیوهای آموزشی و تبیینی است. به جای تولید صرفا یک صحنه سینمایی، Omni میتواند یک پرامپت کوتاه را به یک شرح بصری تبدیل کند. گوگل نمونههایی مانند یک ویدیوی تبیینی به سبک خمیری (Claymation) درباره تا شدن پروتئینها، و یک ویدیوی استاپموشن درباره نحوه عملکرد هیپوکامپ مغز را به نمایش گذاشت.
این دقیقا همان جایی است که Omni میتواند فراتر از تولیدکنندگان محتوای فانتزی که به دنبال جلوههای سورئال هستند، برای اقشار دیگر نیز مفید واقع شود. معلمان، بازاریابان، تیمهای محصول و نویسندگان فنی زمان زیادی را صرف تبدیل ایدههای پیچیده به عکسها بصری میکنند. اگر Omni بتواند ویدیوهای بیانی دقیق و قابل ویرایشی را از روی پرامپتهای کوتاه و مطالب مرجع تولید کند، به ابزاری جامعا متفاوت از یک تولیدکننده ویدیوی سرگرمکننده تبدیل میشود.
البته مشکل اصلی در اینجا “دقت علمی” است. یک مدل میتواند یک ویدیوی شرحی را بسیار متقاعدکننده جلوه دهد، در حالی که هنوز علم یا مکانیک پشت آن را اشتباه متوجه شده است. برای هرگونه محتوای آموزشی، پزشکی، قانونی یا فنی، خروجی Omni همچنان به بازبینی دقیق انسانی نیاز خواهد داشت.
گوگل در ادامه Omni را به آواتارها گره میزند. در زمان راهاندازی، کاربران میتوانند ویدیوهایی با صدای خودشان از طریق خصوصیت Avatars گوگل (که یک ادیشن دیجیتالی از کاربر ایجاد میکند) بسازند. گوگل میگوید قابلیتهای گستردهتر ویرایش صدا و گفتار، پیش از انتشار عمومی همچنان در حال آزمایش هستند.
این یکی از حوزههایی است که پیامدهای ایمنی و امنیتی آن مفصلا واضح است. مدلی که میتواند ویدیو را ویرایش کند، گفتار را تغییر دهد و محتوای آواتار واقعگرایانه (Deepfake) تولید کند، به کنترلهای هویتی بسیار قوی نیاز دارد. گوگل میگوید ویدیوهای ساخته شده توسط Omni دارای واترمارک غیرقابل حذف SynthID هستند. بخش Google DeepMind نیز عنوان کرده محتوایی که با Omni در اپلیکیشن Gemini، پلتفرم Google Flow یا YouTube ایجاد یا ویرایش میشود، دارای اعتبارنامههای محتوایی استاندارد C2PA است.
اگرچه این امر تمام مشکلات سوءاستفاده را حل نمیکند، اما حداقل به پلتفرمها و کاربران راهی برای شناسایی محتوای تولید شده یا ویرایش شده توسط هوش مصنوعی میدهد.
در زمان راهاندازی، Gemini Omni Flash از طریق این پلتفرمها در دسترس است:
گوگل خبر داده است که در دسترس بودن این قابلیت به سطح اشتراک کاربر و منطقه جغرافیایی او بستگی دارد. مشترکین پولیِ Google AI Plus، Pro و Ultra به طور پیشفرض در عرضه اولیه اپلیکیشن Gemini و Flow گنجانده شدهاند. در ادامه بخشهای YouTube Shorts Remix و YouTube Create از همان هفته معرفی، بدون هزینه برای کاربران بالای 18 سال فعال شدهاند.
همانطور که گفته شد، دسترسی به API برای توسعهدهندگان به زودی منتشر میشود، اما گوگل هنوز ارزشگذاری عمومی یا تاریخ دقیق انتشار آن را اعلام نکرده است.
نه دقیقا.
Veo خط تولید مدلهای تولید ویدیوی گوگل است. اما Gemini Omni یک مدل ایجاد محتوای چندوجهی و بسیار گستردهتر است که تواناییهای استدلالی Gemini را با تولید و ویرایش رسانهها ترکیب میکند.
تفاوت مهم در جریان کاری (Workflow) است. Veo عمدتا به عنوان یک مدل «تولید ویدیو» شناخته میشود. اما Omni به عنوان یک مدل «خلق و ویرایشِ همهکاره با هر نوع ورودی» معرفی میشود که کار خود را با ویدیو آغاز کرده، اما برای همیشه محدود به آن نخواهد بود. گوگل میگوید ویرایشهای آینده Omni از سایر روشهای خروجی، از جمله تصویر و صدا نیز پشتیبانی خواهند کرد.
بنابراین بهترین راه برای درک این تفاوت این است: Veo به گوگل کمک کرد تا در رقابت تولید ویدیوی هوش مصنوعی (در برابر شرکتهایی مثل OpenAI) حضور داشته باشد. اما Gemini Omni تلاش گوگل است تا تولید ویدیو، ویرایش ویدیو، پرامپتنویسی چندوجهی و استدلال خلاقانه را به یک جریان کاری پیوسته و یکپارچه تبدیل کند.
