Intelligenza artificiale applicata alle immagini
Far capire a una telecamera cosa sta guardando
Una telecamera produce immagini. Un modello di intelligenza artificiale, guardando quelle immagini, produce una conclusione: questa è una persona, quel quadrante segna 4,2 bar, quel pezzo ha un difetto.
Da lì in poi cambia tutto, perché una conclusione si archivia, si confronta con una soglia, fa scattare un allarme e finisce in un rapporto. Un’immagine, se nessuno la guarda nel momento giusto, non serve a niente.
Questa pagina spiega come funziona e, soprattutto, come si sceglie fra le due strade possibili. Sono due mestieri diversi e confonderli è il modo più rapido per spendere male.
Cosa fa davvero un modello, detto senza mitologia
Un modello non capisce, e non ragiona. Misura quanto quello che vede assomiglia a quello che gli è stato mostrato durante l’addestramento, e restituisce due cose: una risposta e un numero che dice quanto ci crede.
Quel numero è il cuore di tutto. Non esiste un modello che dica sì o no. Esiste un modello che dice «persona, con il novantadue per cento di somiglianza». Chi progetta l’impianto decide sotto quale valore quella risposta va ignorata. È una decisione di progetto, non un’impostazione tecnica da lasciare al valore di fabbrica.
Il modello sa solo quello che gli è stato mostrato. Se durante l’addestramento non ha mai visto un carrello elevatore, non lo riconoscerà: nella migliore delle ipotesi lo classificherà come camion, nella peggiore non lo vedrà. Non è un difetto, è la definizione stessa di come funziona.
Il calcolo avviene sul posto, in millisecondi. Dentro la telecamera o su un apparato in sede. Verso l’esterno esce il dato, non il video: è la differenza che pesa in una valutazione d’impatto e la ragione per cui funziona anche dove le immagini non possono uscire per legge o per contratto. La spiegazione per esteso sta nella pagina I nostri server.
La scelta che decide tutto il progetto
Due famiglie di modelli, due problemi opposti
Non sono due livelli di qualità, uno economico e uno buono. Sono due strumenti che risolvono problemi diversi, e quasi sempre chi sbaglia progetto ha scelto quello giusto per il problema sbagliato.
Sanno riconoscere il mondo
Sono modelli, come quelli della famiglia YOLO, addestrati su milioni di immagini generiche. Arrivano sapendo già distinguere una persona, un veicolo, un animale, una borsa. Non imparano niente sul vostro impianto e non hanno bisogno delle vostre immagini per funzionare.
- Funzionano dal primo giorno
- Costo prevedibile, nessun dato vostro da raccogliere
- Riconoscono categorie generali, non cose vostre
- In taratura si decide dove guardare e cosa considerare normale
Imparano una cosa sola, la vostra
Quando quello che deve essere riconosciuto non esiste come categoria del mondo, un difetto su un pezzo, la lancetta di un quadrante, una posa anomala, non c’è modello pronto che tenga. Bisogna raccogliere le vostre immagini, etichettarle e insegnare al modello la differenza fra normale e non normale.
- Servono immagini vostre, molte, e tempo
- Costa di più e va rifatto se la scena cambia
- Riconosce quello che nessun modello generico vedrebbe
- È l’unica strada quando l’anomalia non deve sfuggire
Nella videosorveglianza il modello serve soprattutto a escludere
È il punto che quasi nessuno dice, e che cambia il modo di valutare questi sistemi. Il problema di un impianto perimetrale non è vedere l’intruso: quello lo vede anche un sensore di movimento di trent’anni fa. Il problema è tutto il resto che fa suonare l’allarme.
Il falso allarme è il vero costo
Una foglia, un gatto, un ramo mosso dal vento, un ragno che cammina sull’obiettivo, il faro di un’auto che passa. Un impianto che suona dieci volte a notte viene disattivato dopo una settimana, e da quel momento non protegge più niente. Il danno non è tecnico: è che l’impianto smette di essere usato.
Il modello dice cosa non è
Un modello già addestrato guarda la sagoma che ha fatto scattare il movimento e risponde: quello è un animale, quella è una persona, quello è un veicolo. L’allarme parte solo per le categorie che avete deciso. Le altre restano registrate ma non chiamano nessuno.
Funziona subito perché le categorie sono universali
Una persona è una persona in un piazzale di Giussano come in un porto. Per questo non serve addestrare niente: il lavoro è tutto nella taratura sulla scena reale, cioè dove guardare, con quale sensibilità, e in quali orari.
Quello che scrive resta cercabile
Ogni riconoscimento diventa un dato scritto insieme alla registrazione. Mesi dopo si può chiedere quante volte è passato un veicolo su quel varco di notte, senza rivedere niente. È la parte che si dimentica di preventivare e che decide se il sistema verrà usato o abbandonato.
Fuori dalla sorveglianza il problema si rovescia: niente deve sfuggire
Nel controllo di un processo, nella lettura di uno strumento, nella verifica di un pezzo, un allarme di troppo è una seccatura. Una cosa non vista è un danno. Qui il modello generico non basta, perché quello che va riconosciuto non esiste come categoria del mondo.
L’oggetto è vostro
Un difetto di saldatura, una lancetta su un quadrante che avete solo voi, un’etichetta storta, un pezzo montato al contrario. Nessun modello generico ha mai visto quelle immagini, e nessuno le ha mai etichettate.
Servono le vostre immagini
Si parte raccogliendo esempi reali dalla scena vera: casi normali e casi anomali, con la luce e lo sporco che ci sono davvero. Poi si etichettano uno a uno. È la parte lunga, ed è quella che decide la qualità del risultato.
Si accetta di suonare di più
Quando una cosa non deve sfuggire, si tara il modello perché segnali anche nei casi incerti. Vuol dire qualche verifica in più a vuoto, e va detto prima, perché è una scelta consapevole e non un difetto.
Se la scena cambia, si riaddestra
Un modello tarato su una linea produttiva non regge se la linea viene ridisegnata. È un costo ricorrente che va messo nel conto all’inizio, non scoperto al secondo anno.
Il numero che nessuno mette nell’offerta
Falsi allarmi contro cose non viste
Non esiste un sistema che non sbagli mai. Esiste una manopola. Girandola da una parte il sistema segnala anche nei casi incerti: non gli sfugge quasi niente, e in cambio chiama più spesso a vuoto. Girandola dall’altra parte chiama solo quando è sicuro: non disturba quasi mai, e in cambio qualcosa può passargli davanti.
Dove sta la manopola lo decide il progetto, non il fornitore. Su un perimetro sorvegliato di notte da una vigilanza che esce in macchina, ogni chiamata a vuoto costa soldi veri: la manopola va verso la prudenza. Su un controllo di qualità dove un pezzo difettoso che passa arriva al cliente, si accetta di scartare qualche pezzo buono in più.
Chi promette zero falsi allarmi e zero cose non viste sta vendendo una cosa che non esiste. La domanda giusta da fare in offerta non è «quanto è preciso», è «in quale delle due direzioni lo tarate, e chi paga l’errore quando arriva».
È anche la ragione per cui prima di proporre qualcosa chiediamo immagini vere della vostra scena. Una dimostrazione fatta con il filmato del fornitore non dice niente sul vostro impianto: cambiano la luce, gli angoli, lo sporco, il traffico.
Come si sceglie, in pratica
Cinque domande. Le risposte dicono da sole quale delle due strade prendere, e a volte dicono di non prenderne nessuna.
| Quello che devo riconoscere esiste già nel mondo? | Persone, veicoli, animali, targhe: modello già addestrato. Un difetto sul mio pezzo, il mio strumento, la mia etichetta: modello da addestrare. |
|---|---|
| Il problema è che suona troppo, o che non vede abbastanza? | Suona troppo: già addestrato, tarato verso la prudenza. Non vede abbastanza: da addestrare, tarato verso il sospetto. |
| Ho immagini reali della scena, e posso raccoglierne altre? | Senza immagini vostre un modello da addestrare non si può fare. Se non ci sono e non si possono raccogliere, la strada è una sola. |
| Quante volte all’anno succede? | Un compito ripetitivo, decine di volte al giorno, si automatizza. Una cosa che capita due volte l’anno costa meno lasciarla a una persona che guarda. |
| La scena resta la stessa nel tempo? | Se cambia ogni mese, un modello tarato su quella scena va rifatto ogni mese. Va detto prima, non scoperto dopo. |
La regola che seguiamo. Prima una prova sul campo con le vostre immagini reali, poi si decide. Se dalla prova risulta che non ha senso, lo diciamo e ci fermiamo lì: abbiamo visto fallire abbastanza progetti nati da una dimostrazione fatta con il filmato di qualcun altro.
Due esempi, uno per famiglia
Non sono un listino. Servono a mostrare come le due strade portano a due impianti diversi, con costi e rischi diversi.
Documentazione visiva dei carichi imbarcati
Ogni mezzo che sale a bordo viene riconosciuto, fotografato e associato alla missione. Alla fine dell’imbarco esiste un documento con targa, orario e immagine per ogni passaggio.
- Targhe, veicoli e persone: categorie del mondo, nessun addestramento
- Tre canali indipendenti che si controllano a vicenda
- Quando i canali non concordano il sistema lo dichiara invece di scegliere in silenzio
In esercizio presso una compagnia di navi cargo
Lettura automatica di strumenti analogici
Le telecamere leggono i quadranti che oggi qualcuno va a guardare di persona, a intervalli regolari e senza entrare in zona. Il valore diventa un dato con soglie, allarmi e storico.
- Ogni tipo di quadrante va insegnato: scala, fondo, posizione della lancetta
- Nessun intervento sullo strumento esistente
- Funziona anche in zona classificata, dove la persona non dovrebbe andare
In esercizio
Avete un compito ripetitivo che oggi fa una persona?
Descrivetecelo e mandateci qualche immagine reale della scena. Vi diciamo quale delle due strade ha senso, se conviene farlo a bordo della telecamera o su un apparato dedicato, e se secondo noi non ne vale la pena ve lo diciamo lo stesso.
