Почему видео является первой границей, когда ИИ учится читать физический мир
TL;DRСотни миллионов камер уже развернуты, но большинство записей все еще требует, чтобы человек знал, на что обращать внимание. Lumana, основанная бывшими лидерами в области компьютерного зрения Intel, обрабатывает более миллиарда изображений ежедневно с помощью более чем 50 000 камер, используя свою модель VIA-1, которая учится определять, что является нормой для каждой отдельной камеры, и отмечает отклонения. Компания фильтрует данные локально, прежде чем отправлять что-либо в облако, следуя принципу «фильтруй, прежде чем тратить». Видео может быть естественной отправной точкой физического ИИ, поскольку инфраструктура уже существует.
Камера, смотрящая на погрузочную площадку, может записывать двенадцать часов, когда грузовики прибывают, рабочие перемещаются по площадке, а коробки покидают здание. В большинстве случаев никто не имеет причины смотреть на это. Запись становится полезной только тогда, когда посылка пропадает, происходит авария или кто-то должен проанализировать событие и выяснить, что произошло.
Это была одна из странных ограничений видеонаблюдения на протяжении многих лет. Камеры стали цифровыми давно, но записи, которые они производят, все еще сильно зависят от того, знает ли человек, на что обращать внимание и где это найти. ИИ начинает делать больше этих записей понятными и доступными для поиска, пока события все еще разворачиваются.
Axis Communications оценивает, что к концу 2025 года по всему миру, за исключением Китая, было установлено 562 миллиона камер видеонаблюдения. Большинство из этих камер также поступают с встроенным интеллектом. По данным исследования компании, около двух третей камер, отправленных в 2024 году, включали аналитику глубокого обучения.
Для компаний, занимающихся тем, что все чаще называют физическим ИИ, большая часть инфраструктуры уже висит на стенах и потолках. Возможность заключается в том, чтобы сделать эти существующие камеры более полезными, обучая программное обеспечение понимать, что происходит перед ними.
Lumana — одна из компаний, ставящих на этот переход. Ее основатели подошли к проблеме с многолетним опытом в области компьютерного зрения в Intel. Генеральный директор Саги Бен Моше ранее возглавлял бизнес Intel RealSense, в то время как технический директор Офир Мулла работал над архитектурой ее 3D и LiDAR камер.
Стартап из Калифорнии привлек 40 миллионов долларов в июле 2025 года в рамках раунда Series A, возглавляемого Wing Venture Capital, с участием Norwest Venture Partners и S Capital, доведя общий объем финансирования до 64 миллионов долларов. К декабрю он сообщил, что более 50 000 камер подключены к его платформе, среди клиентов — компании из списка Fortune 500 по всей территории США.
Компания утверждает, что ее системы видеонаблюдения с ИИ теперь обрабатывают более миллиарда изображений в день с более чем 50 000 камер. Однако для клиентов ранние изменения обычно гораздо более обыденные, чем это число предполагает.
Сначала перестаньте пялиться на экраны
На протяжении десятилетий привычным зрелищем в охранных контрольных комнатах была стена видеопотоков и люди, ожидающие, что заметят, когда что-то выглядит неправильно.
Офир Мулла, технический директор Lumana — Кредит: Lumana
Технический директор Lumana Офир Мулла говорит, что команды проводят первый месяц после развертывания своей технологии, в основном разбираясь с гораздо более обыденными проблемами. Команды находят камеры, которые не работают, выясняют, где покрытие непостоянно, и решают, кто должен получать какие уведомления.
Когда эта работа улаживается, операторы могут тратить меньше времени на попытки следить за каждым потоком и больше времени на события, которые система отметила для расследования.
«Вместо того чтобы тратить время на просмотр пассивных видеостен и попытки заметить что-то необычное, операторы могут сосредоточить свое внимание на событиях, которые требуют расследования», — сказал Мулла в интервью.
Хорошее выполнение этого зависит от контекста, что традиционное обнаружение движения и фиксированные правила с трудом могут уловить.
Человек, стоящий рядом с дверью склада, может быть совершенно нормальным в 14:00 и заслуживать расследования в 2:00. Грузовик с доставкой, припаркованный на погрузочной площадке на 20 минут, может быть ожидаемым. Тот же грузовик, стоящий там три часа, может не быть таким.
Модель VIA-1 от Lumana предназначена для обучения на основе окружающей среды, видимой каждой камерой, а не для применения точно одного и того же определения нормы повсюду. Компания утверждает, что это может снизить количество ложных срабатываний на 90% по сравнению с устаревшими системами обнаружения движения и основанными на правилах системами, хотя Мулла осторожен в описании этой цифры как верхнего предела того, что Lumana наблюдала, а не как результата, которого должен ожидать каждый клиент.
Но гораздо более сложное испытание возникает, когда сама среда меняется.
Что происходит, когда норма меняется?
То, что выглядит нормальным для камеры, может быстро измениться. Склад может изменить свою планировку за выходные, в то время как розничный продавец внезапно должен справиться с рождественской суетой или фабрика вводит ночную смену, которая приводит десятки людей в область, которая раньше была пустой в это время. В каждом случае активность, которая могла бы вызвать тревогу вчера, может быть совершенно обычной сегодня.
Мулла говорит, что VIA-1 может корректировать свое понимание индивидуальной камеры по мере изменения ее окружения, при этом обратная связь от операторов помогает, когда что-то существенно изменилось. Он не стал бы давать фиксированное время, за которое происходит эта корректировка, сказав, что это зависит от масштаба и типа изменения.
Полезная система видеонаблюдения с ИИ должна научиться тому, что новый график смен теперь является рутинным, при этом все еще замечая активность, которая должна вызывать вопросы. Поскольку время, необходимое для корректировки, зависит от того, что изменилось, обратная связь от операторов остается частью этого процесса, особенно когда объект претерпел значительное изменение. На практике система учится вместе с окружением, которое не остается неподвижным долго.
Упрощение поиска и понимания всех этих записей также поднимает вопросы конфиденциальности, особенно на рабочих местах и в других местах, где люди регулярно записываются. Lumana позволяет клиентам устанавливать политики хранения и доступа и отключать функции, такие как распознавание лиц и пола, в зависимости от местных требований. Но по мере того как существующие камеры становятся более способными, компаниям также необходимо учитывать, что они должны собирать, кто должен иметь возможность это искать и как долго эта информация должна храниться.
Сегодня большая часть работы все еще заключается в том, чтобы помочь людям решить, куда смотреть. Lumana видит более широкую роль для той же технологии, поскольку эти системы становятся более способными.
Мулла описывает «физических ИИ-агентов», которые могут разделять мониторинг, проверку и реагирование. Платформа Lumana уже поддерживает действия, начиная от отправки уведомлений и активации вебхуков до активации подключенных систем, когда обнаруживаются определенные события.
Это ставит камеру в другое положение внутри бизнеса. Запись может стать входными данными для программного обеспечения, которое интерпретирует событие и, в некоторых случаях, инициирует то, что происходит дальше.
Фильтруй, прежде чем тратить
Выполнение этого на десятках тысяч камер быстро становится дорогим, потому что видео дорого перемещать и обрабатывать в больших масштабах. Отправка каждого кадра в облако для более интенсивной обработки ИИ быстро станет дорогостоящей, особенно по мере роста разрешения камер и размеров развертывания.
Lumana обрабатывает большую часть непрерывной обработки локально. Ее оборудование Core находится близко к камерам и выполняет начальную обработку там. Согласно обзору платформы компании, большая часть обработки видео выполняется локально, в то время как облако предоставляет дополнительную обработку, удаленный доступ и управление по объектам.
«Большинство видео рутинное и никогда не должно покидать объект», — сказал Мулла.
Только записи, которые требуют более глубокого анализа, нуждаются в более дорогой обработке. Принцип компании более прост: «Мы фильтруем, прежде чем тратить».
Та же экономика, вероятно, будет иметь значение и за пределами Lumana. Камеры и другие датчики генерируют слишком много информации, чтобы каждый кадр получал одинаковое количество вычислений, что делает решение о том, что заслуживает более глубокого анализа, частью технической и экономической проблемы.
Видео также имеет одно преиму
Другие статьи
Почему видео является первой границей, когда ИИ учится читать физический мир
С 562 миллионами установленных камер наблюдения по всему миру и двумя третьими из них, которые теперь поставляются с аналитикой на основе глубокого обучения, Lumana делает ставку на то, что возможность поиска и интеллектуального анализа существующих видеопотоков является самым быстрым путем физического ИИ к масштабированию.
