Google представила Gemini 3.8 Live with Live Avatar. Нова функція дозволяє ШІ спілкуватися через цифрового персонажа з голосом, мімікою та синхронізованими рухами губ.
Що вміє аватар
Live Avatar поєднує можливості Gemini 3.8 Live із генерацією потокового відео з низькою затримкою. Аватар слухає та бачить співрозмовника, а потім відповідає голосом і відео.
Google заявляє, що система точно синхронізує рухи губ із мовленням, відтворює природну міміку та підтримує почергову розмову.
Live Avatar одночасно обробляє візуальну та звукову інформацію. Це дозволяє аватару реагувати не лише на слова користувача, а й на те, що він бачить.
Компанія орієнтує технологію передусім на корпоративне використання. Серед можливих сценаріїв Google називає обслуговування клієнтів та інтерактивні демонстрації.
Gemini 3.8 Live with Live Avatar вже доступна в Gemini Enterprise.
Live Avatar може звертатися до зовнішніх інструментів і отримувати з них інформацію у фоновому режимі. При цьому аватар продовжує розмовляти з користувачем.
Live Avatar також підтримує 97 мов і може перемикатися між ними безпосередньо під час розмови. Під час зміни мови система автоматично адаптує рухи губ і міміку аватара. За твердженням Google, це не має погіршувати якість відео або спричиняти візуальні спотворення.
Кастомні аватари
Google пропонує набір готових цифрових персонажів із різною зовнішністю, голосами та манерою поведінки.
Організації також можуть створювати власних Live Avatar на основі якісного зображення. Система перетворює його на анімованого персонажа, зберігаючи зовнішність і заданий стиль.
Наразі створення власних аватарів доступне лише окремим корпоративним користувачам, яким Google надала відповідний доступ.
Усі аудіо та відео, створені Live Avatar, отримують непомітне цифрове маркування SynthID. Воно має допомагати визначати контент, створений штучним інтелектом
















