Gemini Omni теперь может увеличивать продолжительность видео до 40 секунд и повышать их разрешение до 4K.
Google
Создание короткого AI-видео — это одно, а заставить несколько кадров выглядеть так, будто они принадлежат одному и тому же видео — гораздо более сложная задача. Google снова пытается решить эту проблему с помощью Gemini Omni 1.1 Flash, своей последней модели генеративного видео, направленной на то, чтобы дать создателям и разработчикам гораздо больше контроля над тем, что происходит между первым и последним кадром.
Самое большое изменение заключается в том, сколько существующего видео Gemini может запомнить, когда вы просите его продолжить сцену. Omni 1.1 может просматривать до 10 секунд предыдущих кадров для контекста, а не полагаться только на последнюю секунду. Это должно помочь сохранить персонажей, окружение и общее направление сцены более последовательными, а не просто угадывать, что должно произойти дальше.
Ваши AI-видео не обязательно должны заканчиваться так быстро
Google также предоставляет создателям значительно больше возможностей для продолжения этих сцен. Видео можно продлить на 10-секундные фрагменты, пока они не достигнут общей длины 40 секунд. Это может не звучать особенно долго по сравнению с традиционным видео, но это открывает гораздо больше возможностей для AI-сгенерированных последовательностей с реальным началом, серединой и концом.
Shimul Sood / Digital Trends
Создатели также могут предоставить как первый, так и последний кадр, который они хотят для сцены. Затем Gemini генерирует все необходимое для соединения этих двух кадров. Это может быть полезно для создания движения камеры вокруг объекта, плавного зумирования между композициями или создания клипа, предназначенного для зацикливания без очевидного скачка. Также поддерживаются видео-референсы. Вы можете предоставить Gemini до трех секунд существующего видео, чтобы дать модели дополнительный визуальный контекст, что, по словам Google, должно помочь сохранить такие вещи, как внешний вид персонажей, в сгенерированных сценах.
Вам не нужно рендерить все в 4K
Не каждый эксперимент должен начинаться с максимального качества, и одно из более практичных дополнений Omni 1.1 именно это и признает. Разработчики могут генерировать предварительные просмотры в 360p, которые, по утверждению Google, на 60% быстрее, чем его обычный выход в 720p, при этом стоя примерно в три раза дешевле. Это упрощает быструю проверку идеи, корректировку подсказок или работу над несколькими версиями, прежде чем тратить больше времени и денег на окончательный результат. Как только вы будете довольны, Omni 1.1 может производить видео в 1080p или увеличивать готовое видео до 4K.
Google
Компания уже делает Omni 1.1 Flash доступным для разработчиков через API Gemini в Google AI Studio, в то время как бизнес может получить к нему доступ через корпоративную платформу Agent от Google. Вам не обязательно нужно разрабатывать приложение, чтобы попробовать некоторые из этих трюков. Omni 1.1 внедряется по всему миру в Google Flow для подписчиков AI Plus, Pro и Ultra. Расширение сцен также будет доступно этим подписчикам непосредственно в приложении Gemini, что делает одну из самых интересных новых возможностей модели значительно проще для испытания.
Shimul является автором в Digital Trends, с более чем пятилетним опытом в области технологий.
Anthropic представляет новый стандарт для упрощения соединений AI с машинами
Стандарт аппаратного обеспечения модели предоставляет универсальный слой перевода, давая AI-агентам стандартные элементы управления для работы с лабораторным оборудованием и заводскими машинами.
Anthropic запустила исследовательский предварительный просмотр своего Стандарта аппаратного обеспечения модели (MHS), общей спецификации, предназначенной для безопасного управления AI-агентами лабораторными инструментами и заводским оборудованием. Компания утверждает, что MHS сокращает время, необходимое для интеграции сложной техники с AI, с месяцев до часов или минут. Стандарт в настоящее время доступен для избранных исследовательских лабораторий и производителей через список ожидания, но Anthropic планирует сделать его открытым в будущем.
Как стандарт соединяет AI с физическими устройствами
Читать далее
Почему мышление как инженер имеет решающее значение для детей в эпоху AI
Возможно, лучший подарок, который вы можете подарить своим детям, — это опыт неудачи. Это звучит радикально, возможно, даже немного неудобно, особенно когда так много в родительстве связано с попытками защитить детей от разочарования и огорчения. Тем не менее, вмешиваясь каждый раз, когда что-то становится трудным, мы также можем лишать их возможностей развивать те навыки, которые им понадобятся для навигации в все более непредсказуемом мире.
Вопрос стал более актуальным, поскольку искусственный интеллект меняет наше представление о работе. В предыдущем разговоре Trending Forward я исследовал, что происходит, когда AI начинает брать на себя задачи и навыки, которые когда-то требовали многолетнего обучения. Проблема заключается не только в том, чтобы предсказать, какие профессии могут исчезнуть. Нужно понять, как подготовить людей к рынку труда, где навыки, которые ценны сегодня, могут не выглядеть столь же ценными через десятилетие или два.
Читать далее
Microduck от Pollen Robotics нацелен на то, чтобы сделать обучение физическому AI гораздо менее хрупким и дешевле
Microduck — это крошечный бипед за 399 долларов, созданный для разработчиков, чтобы экспериментировать с физическим AI, предлагая доступный способ обучения и тестирования новых роботизированных поведений без риска повреждения дорогого оборудования.
Pollen Robotics и Hugging Face снова представляют нового робота, и этот робот восхитительно нестандартный. Microduck — это бипед высотой 25 см, созданный для того, чтобы вывести AI с вашего экрана на ваш стол. Предзаказы открываются сегодня, с первыми поставками, запланированными до Рождества 2026 года.
В отличие от своего предшественника, Reachy Mini, Microduck полностью сосредоточен на действии. Он работает на 15 моторах, с артикулированным клювом для захвата объектов, камерой, датчиком глубины, двумя ИМУ и достаточной устойчивостью, чтобы ходить, приседать и даже кататься на роликах.
Читать далее
Other articles
Gemini Omni теперь может увеличивать продолжительность видео до 40 секунд и повышать их разрешение до 4K.
Видеоподборка Gemini стала значительно больше, с более длинными клипами, 4K выводом и гораздо большим контролем над каждым кадром.
