Продължете към съдържанието

ByteDance пуска Seed Audio 1.0: Модел за генериране на аудио с фино времево управление за създаване на звук от кино клас

  • от



ByteDance пуска Seed Audio 1.0: Модел за генериране на аудио с фино времево управление за създаване на звук от кино клас

Екипът на ByteDance Seed пусна Seed Audio 1.0, всеобхватен модел за създаване на аудио, който обединява реч, звукови ефекти и генериране на околен звук в една рамка, за да произведе аудио съдържание от кинематографичен клас от край до край. Моделът бележи навлизането на ByteDance в пространството за генериране на AI аудио, присъединявайки се към конкурентно поле, което включва ElevenLabs текст към реч и Meta AudioBox, с отличителен фокус върху прецизния времеви контрол и многоелементна оркестрация в рамките на едно поколение.

Основната техническа иновация е унифицираната времева оркестрация. Една единствена подкана може едновременно да посочи диалог със специфично емоционално предаване, прецизни звукови ефекти, синхронизирани с наративни събития, и околен фонов звук, създаващ среда и настроение, всички подредени по споделена времева линия. Това елиминира традиционния постпродукционен работен процес за отделно генериране на реч, звукови ефекти и атмосфера и ръчното им смесване. Моделът извежда пълен аудио запис с всички елементи, вече подравнени към предвиденото време, което значително намалява циклите на итерация в професионалното аудио производство.

Seed Audio 1.0 поддържа последователност на символите в дългосрочно и многооборотно генериране. Един и същи глас може естествено да изразява различни емоции и стилове на говорене, като същевременно запазва разпознаваема гласова идентичност. Многоезичната поддръжка се простира до над 20 езика с естествено произношение, ритъм и модели на изразяване за всеки език, изискване за глобалната екосистема на съдържание на ByteDance, обхващаща Douyin, TikTok и международните пазари. В субективните оценки на AB моделът демонстрира значителни предимства в качеството на тембъра, степента на използваемост и степента на отлични постижения в сравнение с аудио моделите от предишно поколение.

Моделът постига над 90% аудио наличност в повечето оценки на сценарии, обхващащи филми, телевизия, кратка драма, аниме, подкаст диалози, стрийминг на живо, създаване на онлайн съдържание, театър и гласов синтез. При многоезичното тестване за естественост на звука повечето езици имат резултат над 4,0 MOS, което показва отлично качество на звука. Сложна инструкция за генериране на аудио след резултат над 3,5 MOS за всички тествани езици с изключение на виетнамски. Тези резултати предполагат, че Seed Audio 1.0 е постигнала производствена способност в широк спектър от сценарии за създаване на съдържание, което потенциално позволява значителна демократизация на професионалното аудио производство.

Seed Audio 1.0 вече е достъпен на платформата Seed Experience. Изданието сигнализира, че ByteDance се разширява отвъд текстовите и визуалните AI модели в аудио домейна, където компанията вече има значителен опит от своите платформи за кратко видео Douyin и TikTok, които са стимулирали иновациите в откриването на музика, аудио ефектите и създаването на гласово съдържание. В комбинация със съществуващите инвестиции на ByteDance във видео генериране, дългосрочни текстови модели и инструменти за кодиране с изкуствен интелект, Seed Audio 1.0 представлява друг градивен елемент в все по-всеобхватната екосистема за създаване на съдържание с изкуствен интелект на ByteDance.



Source link