Perché il video è la prima frontiera mentre l'IA impara a leggere il mondo fisico

Perché il video è la prima frontiera mentre l'IA impara a leggere il mondo fisico

      TL;DR Centinaia di milioni di telecamere sono già state installate, ma la maggior parte dei filmati richiede ancora un umano per sapere cosa cercare. Lumana, fondata da ex leader della visione artificiale di Intel, elabora oltre un miliardo di immagini al giorno attraverso più di 50.000 telecamere utilizzando il suo modello VIA-1, che apprende cosa è normale per ciascuna telecamera e segnala le deviazioni. L'azienda filtra localmente prima di inviare qualsiasi cosa al cloud, seguendo il principio di "filtrare prima di spendere". Il video potrebbe essere il punto di partenza naturale dell'IA fisica perché l'infrastruttura esiste già.

      Una telecamera che sovrasta un'area di carico potrebbe registrare dodici ore di camion in arrivo, lavoratori che si muovono nel sito e scatole che escono dall'edificio. Nella maggior parte dei giorni, nessuno ha motivo di guardare nulla di tutto ciò. I filmati diventano utili solo quando un pacco scompare, si verifica un incidente o qualcuno ha bisogno di risalire a un evento e scoprire cosa è successo.

      Questa è stata una delle strane limitazioni della videosorveglianza per anni. Le telecamere sono diventate digitali molto tempo fa, ma i filmati che producono dipendono ancora fortemente da una persona che sa cosa cercare e dove trovarlo. L'IA sta iniziando a rendere più comprensibili e ricercabili quei filmati mentre gli eventi si stanno ancora svolgendo.

      Axis Communications stima che entro la fine del 2025 siano state installate 562 milioni di telecamere di sorveglianza in tutto il mondo al di fuori della Cina. Molte di queste telecamere stanno anche arrivando con intelligenza integrata. Circa due terzi delle telecamere spedite nel 2024 includevano analisi di deep learning, secondo la ricerca dell'azienda.

      Per le aziende che stanno costruendo ciò che viene sempre più chiamato IA fisica, gran parte dell'infrastruttura è quindi già appesa a pareti e soffitti. L'opportunità sta nel rendere quelle telecamere esistenti più utili insegnando al software a comprendere cosa sta accadendo di fronte a loro.

      Lumana è una delle aziende che scommettono su questa transizione. I suoi fondatori sono arrivati al problema con anni di esperienza nella visione artificiale presso Intel. Il CEO Sagi Ben Moshe ha precedentemente guidato il business RealSense di Intel, mentre il CTO Ofir Mulla ha lavorato all'architettura dietro le sue telecamere 3D e LiDAR.

      La startup con sede in California ha raccolto 40 milioni di dollari a luglio 2025 in un round di finanziamento di Serie A guidato da Wing Venture Capital, con la partecipazione di Norwest Venture Partners e S Capital, portando il suo totale di finanziamenti a 64 milioni di dollari. A dicembre, ha riportato che più di 50.000 telecamere erano collegate alla sua piattaforma, con clienti che includevano aziende Fortune 500 in tutto il paese.

      L'azienda afferma che i suoi sistemi di videosorveglianza AI ora elaborano più di un miliardo di immagini al giorno attraverso più di 50.000 telecamere. Tuttavia, per i clienti, i cambiamenti iniziali sono solitamente molto più ordinari di quanto quel numero suggerisca.

      Prima di tutto, smettere di fissare gli schermi

      Per decenni, una vista familiare nelle sale di controllo della sicurezza è stata un muro di feed video e persone che si aspettavano di notare quando qualcosa sembrava sbagliato.

      Ofir Mulla, CTO di Lumana — Credito: Lumana

      Il CTO di Lumana, Ofir Mulla, afferma che i team trascorrono il primo mese dopo aver implementato la sua tecnologia principalmente a risolvere problemi molto più ordinari. I team trovano telecamere che sono offline, capiscono dove la copertura è incoerente e decidono chi dovrebbe ricevere quali avvisi.

      Man mano che quel lavoro si stabilizza, gli operatori possono trascorrere meno tempo cercando di seguire ogni feed e più tempo a guardare gli eventi che il sistema ha contrassegnato per l'indagine.

      “Invece di trascorrere tempo a guardare muri di video passivi e cercare di individuare qualcosa di insolito, gli operatori possono concentrare la loro attenzione su eventi che meritano un'indagine”, ha dichiarato Mulla in un'intervista.

      Fare bene ciò dipende fortemente dal contesto, qualcosa che la tradizionale rilevazione del movimento e le regole fisse hanno faticato a catturare.

      Una persona in piedi accanto a una porta di magazzino potrebbe essere perfettamente normale alle 14:00 e meritevole di indagine alle 2:00. Un camion di consegna parcheggiato a un'area di carico per 20 minuti potrebbe essere previsto. Lo stesso camion che rimane lì per tre ore potrebbe non esserlo.

      Il modello VIA-1 di Lumana è progettato per apprendere dall'ambiente visto da ciascuna telecamera piuttosto che applicare esattamente la stessa definizione di normale ovunque. L'azienda afferma che questo può ridurre gli avvisi falsi fino al 90% rispetto ai sistemi di rilevamento del movimento e basati su regole tradizionali, anche se Mulla è cauto nel descrivere quella cifra come l'estremità superiore di ciò che Lumana ha osservato piuttosto che un risultato che ogni cliente dovrebbe aspettarsi.

      Ma la prova molto più difficile arriva quando l'ambiente stesso cambia.

      Cosa succede quando il normale cambia?

      Ciò che sembra normale a una telecamera può cambiare rapidamente. Un magazzino potrebbe riorganizzare il suo layout durante un fine settimana, mentre un rivenditore deve improvvisamente affrontare il rush natalizio o una fabbrica introduce un turno notturno che porta decine di persone in un'area che prima era vuota a quell'ora. In ciascun caso, l'attività che potrebbe aver sollevato un avviso ieri potrebbe essere perfettamente routinaria oggi.

      Mulla afferma che VIA-1 può adattare la sua comprensione di una telecamera individuale man mano che il suo ambiente cambia, con il feedback degli operatori che aiuta quando qualcosa è cambiato materialmente. Non avrebbe fornito un tempo fisso per quanto tempo richiede quell'adattamento, affermando che dipende dalla scala e dal tipo di cambiamento.

      Un sistema video AI utile deve apprendere che un nuovo modello di turno è ora routinario pur continuando a notare l'attività che dovrebbe sollevare domande. Poiché il tempo necessario per adattarsi dipende da ciò che è cambiato, il feedback degli operatori rimane parte di quel processo, in particolare quando un sito ha subito un cambiamento sostanziale. In pratica, il sistema sta apprendendo insieme a un ambiente che non rimane fermo a lungo.

      Rendere tutto questo filmato più facile da cercare e comprendere solleva anche domande di privacy, in particolare nei luoghi di lavoro e in altri spazi dove le persone vengono registrate di routine. Lumana consente ai clienti di impostare politiche di conservazione e accesso e disabilitare funzionalità come il riconoscimento facciale e di genere a seconda dei requisiti locali. Ma man mano che le telecamere esistenti diventano più capaci, le aziende devono anche considerare cosa dovrebbero raccogliere, chi dovrebbe poterlo cercare e per quanto tempo tali informazioni dovrebbero essere conservate.

      Oggi, gran parte del lavoro riguarda ancora l'aiutare le persone a decidere dove guardare. Lumana vede un ruolo più ampio per la stessa tecnologia man mano che questi sistemi diventano più capaci.

      Mulla descrive “agenti di IA fisica” che possono dividere monitoraggio, verifica e risposta. La piattaforma di Lumana supporta già azioni che vanno dall'invio di notifiche e attivazione di webhook all'attivazione di sistemi connessi quando vengono rilevati eventi particolari.

      Questo pone la telecamera in un luogo diverso all'interno dell'azienda. I filmati possono diventare un input per il software che interpreta un evento e, in alcuni casi, attiva ciò che accade dopo.

      Filtrare prima di spendere

      Fare questo attraverso decine di migliaia di telecamere diventa rapidamente costoso perché il video è costoso da spostare e elaborare su larga scala. Inviare ogni fotogramma al cloud per un'elaborazione AI più intensiva diventerebbe rapidamente costoso, in particolare man mano che la risoluzione delle telecamere e le dimensioni delle installazioni crescono.

      Lumana gestisce gran parte dell'elaborazione continua localmente. Il suo hardware Core si trova vicino alle telecamere e svolge l'elaborazione iniziale lì. Secondo la panoramica della piattaforma dell'azienda, la maggior parte dell'el

Perché il video è la prima frontiera mentre l'IA impara a leggere il mondo fisico

Altri articoli

Perché il video è la prima frontiera mentre l'IA impara a leggere il mondo fisico Perché il video è la prima frontiera mentre l'IA impara a leggere il mondo fisico Con 562 milioni di telecamere di sorveglianza già installate in tutto il mondo e due terzi di esse ora in spedizione con analisi basate su deep learning, Lumana scommette che rendere i flussi video esistenti ricercabili e intelligenti sia il modo più veloce per l'IA fisica di scalare. OpenAI lancia GPT-6 Astra, e Greg Brockman afferma che l'AGI è arrivata OpenAI lancia GPT-6 Astra, e Greg Brockman afferma che l'AGI è arrivata Il presidente di OpenAI afferma che Astra si qualifica come AGI. La revisione degli Stati Uniti che cita è volontaria e non richiede approvazione preventiva, e l'Europa non ha controlli pre-rilascio. I 10 migliori strumenti di pentesting autonomo, classificati in base alla prova di exploit (2026) I 10 migliori strumenti di pentesting autonomo, classificati in base alla prova di exploit (2026) Dieci piattaforme autonome di pentesting confrontate su proof-of-exploit, profondità della catena di attacco e copertura. Astra Security è in testa per l'exploitation web e API con un validatore isolato che riesamina ogni scoperta prima che raggiunga la tua coda. Nvidia conferma di acquistare Hugging Face per 12,93 miliardi di dollari e promette di mantenerlo aperto. Nvidia conferma di acquistare Hugging Face per 12,93 miliardi di dollari e promette di mantenerlo aperto. Nvidia ha confermato un'acquisizione di 12,93 miliardi di dollari di Hugging Face, valutando la piattaforma a circa 86 volte il fatturato. Jensen Huang afferma che rimarrà aperta tra modelli, framework, cloud e piattaforme di calcolo. La scadenza di 24 ore del CRA sta cambiando la visibilità della catena di fornitura del software. La scadenza di 24 ore del CRA sta cambiando la visibilità della catena di fornitura del software. Il Regolamento sulla Resilienza Cibernetica dell'UE richiede ai produttori di segnalare le vulnerabilità attivamente sfruttate entro 24 ore a partire dall'11 settembre. Aaron Branson di FossID sostiene che la fiducia nell'SBOM, non solo il possesso dell'SBOM, è il vero collo di bottiglia. OpenAI lancia GPT-6 Astra, e Greg Brockman afferma che l'AGI è arrivata OpenAI lancia GPT-6 Astra, e Greg Brockman afferma che l'AGI è arrivata Il presidente di OpenAI afferma che Astra si qualifica come AGI. La revisione degli Stati Uniti che cita è volontaria e non richiede approvazione preventiva, e l'Europa non ha un controllo pre-rilascio.

Perché il video è la prima frontiera mentre l'IA impara a leggere il mondo fisico

Con 562 milioni di telecamere di sorveglianza già installate in tutto il mondo e due terzi ora in spedizione con analisi di deep learning, Lumana scommette che rendere i flussi video esistenti ricercabili e intelligenti sia il modo più veloce per l'IA fisica di scalare.