Por qué el video es la primera frontera a medida que la IA aprende a leer el mundo físico

Por qué el video es la primera frontera a medida que la IA aprende a leer el mundo físico

      TL;DR Cientos de millones de cámaras ya están desplegadas, pero la mayoría de las grabaciones aún requieren que un humano sepa qué buscar. Lumana, fundada por exlíderes de visión por computadora de Intel, procesa más de mil millones de imágenes diariamente a través de más de 50,000 cámaras utilizando su modelo VIA-1, que aprende lo que es normal para cada cámara individual y señala las desviaciones. La empresa filtra localmente antes de enviar cualquier cosa a la nube, siguiendo el principio de "filtrar antes de gastar". El video puede ser el punto de partida natural de la IA física porque la infraestructura ya existe.

      Una cámara que observa un muelle de carga podría grabar doce horas de camiones llegando, trabajadores moviéndose por el sitio y cajas saliendo del edificio. La mayoría de los días, nadie tiene razón para ver nada de eso. La grabación solo se vuelve útil cuando un paquete desaparece, ocurre un accidente o alguien necesita trabajar hacia atrás desde un evento y averiguar qué sucedió.

      Esa ha sido una de las extrañas limitaciones de la vigilancia por video durante años. Las cámaras se volvieron digitales hace mucho tiempo, pero las grabaciones que producen aún dependen en gran medida de que una persona sepa qué buscar y dónde encontrarlo. La IA está comenzando a hacer que más de esas grabaciones sean comprensibles y buscables mientras los eventos aún se están desarrollando.

      Axis Communications estima que 562 millones de cámaras de vigilancia se instalaron en todo el mundo fuera de China para finales de 2025. Más de esas cámaras también están llegando con inteligencia incorporada. Aproximadamente dos tercios de las cámaras enviadas en 2024 incluían análisis de aprendizaje profundo, según la investigación de la empresa.

      Para las empresas que están construyendo lo que cada vez se llama más IA física, gran parte de la infraestructura ya está colgando de paredes y techos. La oportunidad está en hacer que esas cámaras existentes sean más útiles al enseñar al software a entender lo que está sucediendo frente a ellas.

      Lumana es una de las empresas que apuesta por esa transición. Sus fundadores llegaron al problema con años de experiencia en visión por computadora en Intel. El CEO Sagi Ben Moshe anteriormente lideró el negocio RealSense de Intel, mientras que el CTO Ofir Mulla trabajó en la arquitectura detrás de sus cámaras 3D y LiDAR.

      La startup con sede en California recaudó 40 millones de dólares en julio de 2025 en una Serie A liderada por Wing Venture Capital, con la participación de Norwest Venture Partners y S Capital, llevando su financiación total a 64 millones de dólares. Para diciembre, informó que más de 50,000 cámaras estaban conectadas a su plataforma, con clientes que incluyen empresas de Fortune 500 en los Estados Unidos.

      La empresa dice que sus sistemas de vigilancia por video con IA ahora procesan más de mil millones de imágenes al día a través de más de 50,000 cámaras. Sin embargo, para los clientes, los cambios iniciales suelen ser mucho más ordinarios de lo que sugiere ese número.

      Primero, deja de mirar las pantallas

      Durante décadas, una vista familiar en las salas de control de seguridad ha sido una pared de transmisiones de video y personas que se espera que noten cuando algo parece estar mal.

      Ofir Mulla, CTO de Lumana — Crédito: Lumana

      El CTO de Lumana, Ofir Mulla, dice que los equipos pasan el primer mes después de desplegar su tecnología principalmente resolviendo problemas mucho más ordinarios. Los equipos encuentran cámaras que están fuera de línea, averiguan dónde la cobertura es inconsistente y deciden quién debe recibir qué alertas.

      A medida que ese trabajo se asienta, los operadores pueden pasar menos tiempo tratando de seguir cada transmisión y más tiempo observando los eventos que el sistema ha señalado para investigación.

      “En lugar de gastar tiempo mirando paredes de video pasivas y tratando de detectar algo inusual, los operadores pueden concentrar su atención en eventos que merecen investigación”, dijo Mulla en una entrevista.

      Hacer eso bien depende en gran medida del contexto, algo que la detección de movimiento tradicional y las reglas fijas han luchado por capturar.

      Una persona de pie junto a una puerta de almacén podría ser perfectamente normal a las 2 p.m. y digna de investigación a las 2 a.m. Un camión de entrega estacionado en un muelle de carga durante 20 minutos podría ser esperado. El mismo camión sentado allí durante tres horas puede no serlo.

      El modelo VIA-1 de Lumana está diseñado para aprender del entorno visto por cada cámara en lugar de aplicar exactamente la misma definición de normal en todas partes. La empresa dice que esto puede reducir las alertas falsas en hasta un 90% en comparación con los sistemas de detección de movimiento heredados y basados en reglas, aunque Mulla es cuidadoso al describir esa cifra como el extremo superior de lo que Lumana ha observado en lugar de un resultado que cada cliente debería esperar.

      Pero la prueba mucho más difícil llega cuando el entorno mismo cambia.

      ¿Qué sucede cuando lo normal cambia?

      Lo que parece normal para una cámara puede cambiar rápidamente. Un almacén podría reorganizar su diseño durante un fin de semana, mientras que un minorista de repente tiene que lidiar con la afluencia navideña o una fábrica introduce un turno nocturno que trae a docenas de personas a un área que solía estar vacía a esa hora. En cada caso, la actividad que podría haber levantado una alerta ayer podría ser perfectamente rutinaria hoy.

      Mulla dice que VIA-1 puede ajustar su comprensión de una cámara individual a medida que su entorno cambia, con retroalimentación de los operadores que ayuda cuando algo ha cambiado materialmente. No daría un tiempo fijo para cuánto tiempo lleva ese ajuste, diciendo que depende de la escala y el tipo de cambio.

      Un sistema de video con IA útil tiene que aprender que un nuevo patrón de turno ahora es rutinario mientras aún nota la actividad que debería plantear preguntas. Debido a que el tiempo necesario para ajustarse depende de lo que ha cambiado, la retroalimentación del operador sigue siendo parte de ese proceso, particularmente cuando un sitio ha experimentado un cambio sustancial. En la práctica, el sistema está aprendiendo junto a un entorno que no se queda quieto por mucho tiempo.

      Hacer que todo este material sea más fácil de buscar y entender también plantea preguntas de privacidad, particularmente en lugares de trabajo y otros espacios donde las personas son grabadas rutinariamente. Lumana permite a los clientes establecer políticas de retención y acceso y desactivar funciones como el reconocimiento facial y de género dependiendo de los requisitos locales. Pero a medida que las cámaras existentes se vuelven más capaces, las empresas también tienen que considerar qué deberían recopilar, quién debería poder buscarlo y cuánto tiempo debería conservarse esa información.

      Hoy, gran parte del trabajo sigue siendo ayudar a las personas a decidir dónde mirar. Lumana ve un papel más grande para la misma tecnología a medida que estos sistemas se vuelven más capaces.

      Mulla describe "agentes de IA física" que pueden dividir la monitorización, verificación y respuesta. La plataforma de Lumana ya admite acciones que van desde enviar notificaciones y activar webhooks hasta activar sistemas conectados cuando se detectan eventos particulares.

      Eso coloca a la cámara en un lugar diferente dentro del negocio. La grabación puede convertirse en una entrada para un software que interpreta un evento y, en algunos casos, desencadena lo que sucede a continuación.

      Filtrar antes de gastar

      Hacer esto a través de decenas de miles de cámaras se vuelve costoso rápidamente porque el video es costoso de mover y procesar a gran escala. Enviar cada fotograma a la nube para un procesamiento de IA más intensivo se volvería rápidamente costoso, particularmente a medida que la resolución de la cámara y los tamaños de despliegue crecen.

      Lumana maneja gran parte del procesamiento continuo localmente en su lugar. Su hardware Core se sitúa cerca de las cámaras y realiza el procesamiento inicial allí. Según la descripción general de la plataforma de la empresa, la mayor parte del procesamiento de video se realiza localmente, mientras que la nube proporciona procesamiento adicional, acceso remoto y gestión a través de sitios.

      "La gran mayoría del video es rutinario y nunca necesita salir del sitio", dijo Mulla.

      Solo las grabaciones que merecen un análisis más profundo necesitan un procesamiento más costoso. El principio de la empresa es más simple: "Filtramos antes de gastar".

      La misma economía probablemente importará mucho más allá de Lumana. Las cámaras y otros sensores generan demasiada información para que cada fotograma reciba la misma cantidad de computación, lo que hace que decidir qué merece un análisis más profundo sea parte del problema técnico y económico.

      El video también tiene una ventaja sobre algunas de las ideas más ambiciosas en torno a la IA física. Las empresas no tienen que esperar a millones de nuevos robots o reconstruir sus sitios alrededor de nuevo hardware. Cientos de millones de cámaras ya están apuntando a fábricas, tiendas, universidades, almacenes y calles.

      La mayoría de esas cámaras se instalaron para grabar lo que sucedía. Si la IA puede entender de manera confiable más de ese material a medida que los eventos se desarrollan, la misma infraestructura puede ayudar a las empresas a comprender lo que está sucediendo mientras aún está sucediendo y, en algunos casos, decidir qué debería suceder a continuación. Y eso podría ser lo que hace que el video sea un punto de partida tan natural para el

Por qué el video es la primera frontera a medida que la IA aprende a leer el mundo físico

Otros artículos

Una pantalla al estilo de Tesla puede modernizar un Silverado más antiguo. La parte difícil es hacer que todo lo demás funcione. Una pantalla al estilo de Tesla puede modernizar un Silverado más antiguo. La parte difícil es hacer que todo lo demás funcione. Las camionetas pickup pueden durar décadas, pero sus sistemas de infoentretenimiento envejecen rápidamente. Merge Screens ofrece pantallas Android al estilo Tesla para Silverados de 2007 a 2026, pero el verdadero desafío es integrarse con los controles del volante, cámaras, sistemas de clima y audio de fábrica. Nvidia confirma que está comprando Hugging Face por $12.93 mil millones y promete dejarlo abierto. Nvidia confirma que está comprando Hugging Face por $12.93 mil millones y promete dejarlo abierto. Nvidia ha confirmado una adquisición de $12.93 mil millones de Hugging Face, valorando la plataforma en aproximadamente 86 veces los ingresos. Jensen Huang dice que seguirá siendo abierta en todos los modelos, marcos, nubes y plataformas de computación. Por qué el video es la primera frontera a medida que la IA aprende a leer el mundo físico Por qué el video es la primera frontera a medida que la IA aprende a leer el mundo físico Con 562 millones de cámaras de vigilancia ya instaladas en todo el mundo y dos tercios de ellas ahora enviándose con análisis de aprendizaje profundo, Lumana está apostando a que hacer que las transmisiones de video existentes sean buscables e inteligentes es el camino más rápido para escalar de la IA física. Nueva Jersey acaba de legalizar paneles solares de balcón enchufables y económicos. Nueva Jersey acaba de legalizar paneles solares de balcón enchufables y económicos. Nueva Jersey ha prohibido a los propietarios y consejos bloquear la energía solar conectada. Alemania otorgó ese derecho a los inquilinos en 2024, y Gran Bretaña legalizó los kits la semana pasada. OpenAI lanza GPT-6 Astra, y Greg Brockman dice que la AGI ha llegado. OpenAI lanza GPT-6 Astra, y Greg Brockman dice que la AGI ha llegado. El presidente de OpenAI dice que Astra califica como AGI. La revisión de EE. UU. que cita es voluntaria y renuncia a la autorización previa, y Europa no tiene un control previo al lanzamiento. Las 10 mejores herramientas de pentesting autónomas, clasificadas por prueba de explotación (2026) Las 10 mejores herramientas de pentesting autónomas, clasificadas por prueba de explotación (2026) Diez plataformas de pentesting autónomas comparadas en prueba de explotación, profundidad de la cadena de ataque y cobertura. Astra Security lidera en explotación web y de API con un validador aislado que re-explota cada hallazgo antes de que llegue a tu cola.

Por qué el video es la primera frontera a medida que la IA aprende a leer el mundo físico

Con 562 millones de cámaras de vigilancia ya instaladas en todo el mundo y dos tercios de ellas ahora enviándose con análisis de aprendizaje profundo, Lumana está apostando a que hacer que las transmisiones de video existentes sean buscables e inteligentes es el camino más rápido para escalar de la IA física.