
Google не забыл о создателях контента на базе ИИ в последнем раунде анонсов Gemini в рамках Google I/O. Компания официально представила Gemini Omni, новую модель, способную «создавать что угодно из любого ввода — начиная с видео», по словам Google. Первая модель под названием Gemini Omni Flash сегодня становится доступной в приложении Gemini, Google Flow и YouTube Shorts.
Google назвал Gemini Omni «следующим шагом» после Nano Banana и, предположительно, своего текущего генератора видео Veo 3.1. Он позволяет «объединять изображения, аудио, видео и текст в качестве входных данных и генерировать высококачественные видео, основанные на реальных знаниях Gemini», — сообщает технологический гигант. Затем вы можете редактировать эти видео посредством естественного диалога, причем каждая инструкция строится на предыдущей, чтобы сохранять персонажей и другие элементы неизменными.
В то время как Veo 3.1 был ограничен созданием видео с помощью текстовых подсказок и изображений, Gemini Omni будет принимать более широкий спектр входных данных и делать гораздо больше. Например, вы можете снять видео, а затем просто попросить Omni изменить происходящее. «Ваше видео становится отправной точкой для того, чего вы никогда не смогли бы снять сами», — объясняет Google. «Редактируйте действие, добавляйте новых персонажей или объекты или превращайте момент во что-то неожиданное. Изменяйте окружение, угол обзора, стиль или даже конкретные детали».
Omni также лучше понимает физические силы, такие как гравитация, кинетическая энергия и гидродинамика, благодаря чему сцены будут более реалистичными. Он сочетает это со «знаниями Gemini в области истории, науки и культурного контекста, преодолевая разрыв от фотореализма до содержательного повествования». Приложение якобы может создавать увлекательные объясняющие ролики на основе коротких подсказок, генерируя визуальные материалы, которые раскрывают более сложные идеи. Однако изначально оно будет поддерживать только голосовые ссылки для аудиовыхода.
Если вы хотите создавать видео, в которых вы — главный герой, Omni позволяет использовать ваш собственный голос для создания цифрового аватара, который выглядит и звучит как вы. Если это звучит как потенциальный кошмар с точки зрения конфиденциальности, Google утверждает, что имеет «четкие политики для защиты пользователей от вреда и регулирования использования наших инструментов на базе ИИ». Что касается редактирования видео для изменения аудио и речи, компания все еще тестирует эту функцию, чтобы «ответственно» предоставить ее пользователям. Все видео также будут использовать незаметный цифровой водяной знак SynthID от Google для подтверждения того, что видео были сгенерированы с помощью Gemini Omni.
Все это звучит отлично, но основная проблема Veo 3.1 и других приложений для генерации видео заключается в том, что видео имеет «зловещую долину» и часто не нравится конечным пользователям. Поэтому будет интересно посмотреть, соответсвует ли качество вывода заоблачным заявлениям Google. Мы узнаем это скоро, поскольку Gemini Omni Flash теперь доступен всем подписчикам Google AI Plus, Pro и Ultra по всему миру и начинает распространяться среди пользователей YouTube Shorts и приложения YouTube Create на этой неделе.





















