گوگل در جریان کنفرانس I/O 2026 از نسل جدید مدلهای هوش مصنوعی خود پرده برداشت؛ خانوادهای که نهتنها در کدنویسی و درک چندوجهی رکورد میزند، بلکه میتواند از هر ورودی، ویدیوهای واقعگرایانه خلق کند.
نخستین عضو در دسترس این خانواده، جمینای ۳.۵ فلش است که هماکنون برای تمامی کاربران از طریق اپلیکیشن Gemini و حالت هوش مصنوعی در جستجوی گوگل فعال شده است. این مدل از نظر هوشمندی با مدلهای پرچمدار برابری میکند و همزمان سرعت سری فلش را حفظ کرده است. جمینای ۳.۵ فلش در بنچمارکهای دشوار برنامهنویسی حتی از جمینای ۳.۱ پرو نیز پیشی گرفته و به عنوان قدرتمندترین نسخه جمینای در حوزه عملکرد عاملمحور و کدنویسی شناخته میشود.
اما ستاره اصلی این رویداد، مدل جدیدی به نام Gemini Omni است. این مدل میتواند با دریافت ترکیبی از تصاویر، صوت، ویدیو و متن، ویدیوهایی با کیفیت بالا و مبتنی بر دانش دنیای واقعی جمینای تولید کند. کاربران پس از ساخت ویدیو میتوانند آن را در چند مرحله و از طریق چت ویرایش کنند، بدون آنکه ارتباط با محتوای اولیه از دست برود.
نکته فنی برجسته، درک شهودی این مدل از پدیدههای فیزیکی مانند گرانش، انرژی جنبشی و دینامیک سیالات است که صحنههای واقعگرایانهتری را پدید میآورد. همچنین کاربران میتوانند از صدای شخصی خود و آواتارهای دیجیتالی که نسخه مجازی آنها را میسازند، بهره ببرند. تمامی ویدیوهای تولید شده نیز با واترمارک دیجیتال SynthID نشانهگذاری میشوند تا اصالتسنجی محتوا ممکن باشد.
نخستین مدل از این خانواده با نام Gemini Omni Flash از امروز برای مشترکین طرحهای گوگل AI پلاس، پرو و اولترا در سطح جهانی در دسترس است و کاربران یوتیوب شورتس و یوتیوب کریت نیز میتوانند رایگان از آن استفاده کنند.
با این رونمایی، گوگل عملاً وارد عرصهای تازه از رقابت هوش مصنوعی شده است: مدلهایی که نه فقط متن و تصویر، بلکه ویدیو میسازند و آن را با درکی از دنیای واقعی تلفیق میکنند. باید دید رقبا چه پاسخی به این جهش خواهند داد.
