شیائومی از مدل‌های هوش مصنوعی متن‌باز MiMo V2.5 با قابلیت پردازش همزمان متن، تصویر، ویدیو و صدا رونمایی کرد

تیم پلازا - انتشار: 10 اردیبهشت 1405 20:41
ز.م مطالعه: 2 دقیقه
-

شیائومی از سری مدل‌های هوش مصنوعی متن‌باز MiMo V2.5 رونمایی کرد. این مدل‌ها با معماری پیشرفته، توانایی پردازش همزمان انواع رسانه‌ها از جمله متن، تصویر، ویدیو و صدا را دارند.

مدل‌های جدید شامل دو نسخه MiMo-V2.5 و MiMo-V2.5-Pro هستند که بر اساس معماری پیشرفته ترکیبی از متخصصان (MoE - Mixture of Experts) ساخته شده‌اند. هر دو مدل از پنجره زمینه ۱ میلیون توکنی پشتیبانی می‌کنند و تحت مجوز MIT برای استفاده تجاری رایگان عرضه شده‌اند.

معرفی مدل MiMo-V2.5

مدل MiMo-V2.5 یک هوش مصنوعی بومی چندوجهی (Omnimodal) است که برای پردازش یکپارچه متن، تصویر، ویدیو و صدا طراحی شده است. این مدل با مجموع ۳۱۰ میلیارد پارامتر (۱۵ میلیارد پارامتر فعال) بر روی داده‌هایی به حجم تقریبی ۴۸ تریلیون توکن آموزش دیده است و برای درک چندرسانه‌ای و وظایف مبتنی بر عامل (Agent) بهینه شده است.

معرفی مدل MiMo-V2.5-Pro

نسخه MiMo-V2.5-Pro قدرتمندترین مدل این سری محسوب می‌شود که برای وظایف پیچیده برنامه‌نویسی، مهندسی نرم‌افزار و استدلال‌های طولانی طراحی شده است. این مدل با مجموع ۱.۰۲ تریلیون پارامتر (۴۲ میلیارد پارامتر فعال) و پشتیبانی از پنجره زمینه ۱ میلیون توکنی، برای اجرای گردش‌کارهای خودکار و پیچیده بسیار کارآمد است.

مشخصات کلیدی هر دو مدل:

  • معماری MoE (ترکیبی از متخصصان)

  • پنجره زمینه ۱ میلیون توکن

  • مجوز MIT برای استفاده تجاری رایگان

  • قابلیت پردازش همزمان متن، تصویر، ویدیو و صدا

مدل‌های MiMo V2.5 با رویکرد متن‌باز و رایگان، رقیبی برای مدل‌های بزرگ تجاری در حوزه هوش مصنوعی چندوجهی محسوب می‌شوند و توسعه‌دهندگان می‌توانند از آن‌ها در پروژه‌های تجاری خود استفاده کنند.

دیدگاه های کاربران
هیچ دیدگاهی موجود نیست