Az ElevenLabs Lip Sync eszközével egyetlen állókép vagy videó is megszólalhat: a platform AI-val szinkronizálja a szájmozgást a feltöltött vagy generált hanghoz, így valósághű beszélő animáció születik.
A használat három lépésben zajlik. Először fel kell tölteni egy képet vagy videót, majd hozzá szöveges vagy hangalapú bemenetet kell megadni. Másodikban ki lehet választani a kívánt modellt – ilyen például az Omnihuman 1.5 –, végül a rendszer legenerálja és MP4 formátumban exportálja a kész videót, akár 4K felbontásban, H.264 vagy H.265 kódolással.
A funkció a hangklónozással és a 30 nyelvet támogató AI hangszintézissel kombinálva többnyelvű tartalmak gyors elkészítését is lehetővé teszi. Ez különösen hasznos lehet oktatási videóknak, marketinganyagoknak vagy közösségimédia-tartalmaknak, ahol egy karakter vagy avatar több nyelven is megszólalhat ugyanazzal az arcanimációval.
Fontos tudni, hogy a videógenerálás kizárólag fizetős csomagban érhető el, a felhasználandó kreditmennyiséget a generálás előtt mutatja a rendszer.
Forrás: elevenlabs.io/lip-sync