Google анонсувала модель штучного інтелекту Gemini Omni 1.1 Flash, призначену для генерації відео. Проєкт є спробою вирішити завдання щодо того, як за заданим зразком із декількох кадрів згенерувати органічний ролик — розробникам надається більший контроль над тим, що відбувається між першим і останнім кадром.
Найважливіше нововведення Google Gemini Omni 1.1 Flash — здатність моделі запам’ятовувати існуюче відео, коли вона отримує інструкцію продовжити сцену; модель спирається не лише на останні кадри, а й на 10 секунд попереднього відеоматеріалу. Це допомагає їй зберігати персонажів, оточення та загальний напрямок сцени більш узгодженими, і не доводиться вгадувати, що має статися далі. Розширився набір можливостей для продовження вихідних сцен. Відео можна подовжувати фрагментами по 10 секунд, доки загальна тривалість ролика не досягне 40 секунд. Цей проміжок може здатися не таким вже й тривалим порівняно з традиційним відео, але відкривається ширший набір можливостей для генерації послідовностей за допомогою ШІ — із заданими початком, серединою та кінцем.
Це означає, що користувач може надати перший і останній кадри, а Google Gemini Omni 1.1 Flash згенерує все необхідне для їхнього з’єднання. Це може бути рух камери навколо об’єкта, плавне масштабування композиції або зациклене відео. Можна надіслати моделі до трьох секунд реального відео для додаткового візуального контексту, а вона сама, наприклад, зобразить появу персонажа у згенерованій сцені. На етапі підготовки попередніх матеріалів максимальна якість відео не потрібна — вони можуть генеруватися у роздільній здатності 360p, що дозволяє ШІ працювати на 60 % швидше, ніж у випадку з 720p, і втричі дешевше. Можна протестувати задум, скоригувати підказки, опрацювати кілька версій, і коли результат виявиться оптимальним, Omni 1.1 Flash створить відео в 1080p або масштабує його до 4K.

Доступ до Google Gemini Omni 1.1 Flash уже відкрито через API Gemini в Google AI Studio, корпоративні клієнти можуть працювати з моделлю через Google Agent Platform. Приватні користувачі за наявності передплати Google AI Plus, Pro та Ultra можуть відкрити нову модель у Google Flow; для них функція розширення сцени з’явиться й у основному додатку Gemini.