شرکت Stability AI، خالق مدل مشهور Stable Diffusion، نسل جدیدی از مدلهای صوتی خود را با نام Stable Audio 3.0 معرفی کرد؛ خانوادهای که میتواند آهنگهای باکیفیت تا ۶ دقیقه و ۲۰ ثانیه تولید کند و دو عضو آن متنباز و رایگان عرضه شدهاند.
این خانواده شامل چهار مدل است: دو مدل کوچک مخصوص جلوههای صوتی (SFX) با ۴۵۹ میلیون پارامتر که برای تولید روی دستگاه تا ۲ دقیقه بهینه شدهاند، یک مدل متوسط با ۱.۴ میلیارد پارامتر و یک مدل بزرگ با ۲.۷ میلیارد پارامتر. مدلهای متوسط و بزرگ میتوانند قطعات کامل موسیقی با ساختار و لحن ملودیک پایدار در طول بیش از ۶ دقیقه تولید کنند؛ جهشی چشمگیر نسبت به نسخه سال گذشته که آهنگهای بسیار کوتاهتری میساخت.
Stability AI اعلام کرده مدلهای کوچک و متوسط را متنباز منتشر میکند، اما مدل بزرگ تنها از طریق API و سرویسهای ابری پولی در دسترس خواهد بود. شرکتهایی با درآمد سالانه بیش از یک میلیون دلار نیز ملزم به دریافت مجوز سازمانی هستند.
نکته کلیدی در این عرضه، تأکید Stability AI بر رعایت کپیرایت است. این شرکت سال گذشته با دو غول موسیقی جهان، Warner Music Group و Universal Music Group، قرارداد امضا کرد و مدعی است مدلهای جدید را بر پایه دادههایی با مجوز کامل آموزش داده است؛ رویکردی که میتواند آن را از چالشهای حقوقی رقبایی چون Suno و Udio مصون نگه دارد.
در اقدامی دیگر، Stability AI «ایتن کپلن»، مدیر ارشد دیجیتال سابق در Universal Audio و Fender را به خدمت گرفته تا بخش موسیقی حرفهای شرکت را هدایت کند. به نظر میرسد این استارتاپ میخواهد از تولید موسیقی مصرفی فراتر رود و ابزارهایی برای موزیسینهای حرفهای بسازد.
با این عرضه، Stability AI عملاً وارد رقابتی تازه با پلتفرمهایی شده که مرز میان خلاقیت انسانی و تولید ماشینی را هر روز باریکتر میکنند. باید دید واکنش صنعت موسیقی به این نسل تازه از آهنگسازان مصنوعی چه خواهد بود.
