گوگل با معرفی قابلیت جدید «درک ایجنتی ویدیو» (Agentic Video Understanding)، استانداردهای تحلیل ویدیو در مدلهای هوش مصنوعی خود را تغییر داد. این فناوری جدید که به مدلهای پیشرفته جمینای افزوده شده است، به جای پردازش یکسان و ثابت تمام فریمها، به هوش مصنوعی اجازه میدهد تا مانند یک عامل (Agent) هوشمند، تصمیم بگیرد کدام بخشها، با چه سرعتی و از چه منابعی (فریم، صدا یا متن) برای پاسخگویی به درخواست کاربر، تحلیل شوند. این رویکرد نهتنها دقت تحلیل را در ویدیوهای طولانی بالا میبرد، بلکه مصرف توکن را تا ۸۸ درصد و هزینههای پردازش را تا ۶۶ درصد کاهش میدهد.
خداحافظی با پردازش ثابت؛ هوشمندی در انتخاب فریمها و منابع
تا پیش از این، کاربران میتوانستند ویدیوهای خود را در جمینای بارگذاری کنند، اما مدل بر پایه «پردازش ثابت» عمل میکرد؛ به این معنا که ویدیو با یک نرخ مشخص (معمولاً یک فریم در ثانیه) بررسی میشد. این روش در ویدیوهای طولانی و پیچیده، هم منجر به مصرف بالای توکن و هزینههای سنگین میشد و هم احتمال از دست رفتن جزئیات حیاتی را به شدت افزایش میداد. در روش جدید «ایجنتمحور»، جمینای میتواند ابزار داخلی خود را فراخوانی کرده و تنها بخشهای مرتبط با سوال کاربر را با دقت بالا بارگذاری و بررسی کند.
دسترسی از طریق API و برنامههای آینده برای کاربران اپلیکیشن
در حال حاضر، قابلیت Agentic Video Understanding برای ویدیوهای بارگذاریشده و همچنین ویدیوهای یوتیوب، از طریق Gemini API در پلتفرم Google AI Studio و همچنین پلتفرم Gemini Enterprise Agent در دسترس قرار گرفته است. گوگل تأکید کرده است که این قابلیت بهزودی به اپلیکیشن جمینای نیز اضافه خواهد شد تا کاربران عادی نیز از دقت بالاتر و سرعت بیشتر در تحلیل محتوای تصویری بهرهمند شوند.
تحول در یوتیوب و ابزاری قدرتمند برای تولیدکنندگان محتوا
یکی از کاربردهای استراتژیک این فناوری، ادغام آن با سرویس Ask YouTube خواهد بود. گوگل قصد دارد از این قابلیت برای کمک به تولیدکنندگان محتوا (Creators) استفاده کند تا بتوانند ویدیوهای خود را با دقت بسیار بیشتری تحلیل کرده و از دادههای استخراجشده برای بهبود تولیدات خود بهره ببرند. این حرکت، گامی بزرگ در جهت تبدیل هوش مصنوعی از یک ابزار پاسخگو به یک دستیار تحلیلگر حرفهای در اکوسیستم یوتیوب محسوب میشود.
