Monitorare la reputazione di un’azienda su YouTube è un problema risolto. Con i podcast no. Uno dei più importanti provider dell’energia in Italia riceveva già alert periodici sui video che citavano il gruppo, ma sui contenuti solo audio non aveva alcuna copertura: una citazione in un podcast poteva passare inosservata. Ci ha chiesto di colmare questo vuoto, con un requisito preciso: il podcast deve essere presente su Spotify. La piattaforma ha un bacino di ascoltatori abbastanza ampio perché l’opinione espressa in un episodio su temi energetici possa orientare chi ascolta.
La Sfida: trovare citazioni dentro ore di audio
Il valore non stava nei podcast di settore, già noti e presidiabili a mano, ma nella citazione inattesa dentro un canale mai mappato. Gli ostacoli erano tre.
- Scoprire le fonti. Il primo prototipo chiedeva a un LLM di suggerire show e link. Su 12 programmi proposti, solo 2 esistevano davvero: gli ID Spotify sono stringhe opache, e un modello linguistico li inventa con la stessa sicurezza con cui scrive tutto il resto.
- Recuperare l’audio. Spotify non espone gli MP3. Per ogni episodio bisogna risalire al feed RSS originale e trovare la puntata giusta, senza scaricare l’intero archivio dello show.
- Il costo dell’ascolto. Con Whisper in locale un minuto di audio richiede circa un minuto di calcolo. Su 181 episodi già scaricati, circa 98 ore di audio, trascrivere tutto era impraticabile.
L’Approccio Tecnico: invertire il flusso
1. Real-show-first. Abbiamo tolto all’LLM il compito di produrre ID e link. La pipeline interroga la Spotify Search API con 16 query tematiche su mercati, tecnologie e geopolitica dell’energia e raccoglie solo show esistenti. L’LLM legge titolo e descrizione veri e risponde con il numero d’ordine degli show pertinenti: non scrive mai un ID o un URL, quindi non ha niente da inventare. In un run misurato del prototipo: 77 candidati reali, 19 show selezionati, 55 episodi in coda.
2. Una mappa del dominio, non una lista di parole. Accanto agli show istituzionali seguiti via RSS, la pipeline ha una seconda traccia di discovery OSINT. La sigla sta per Open Source Intelligence: la disciplina che raccoglie, analizza e combina informazioni di pubblico dominio provenienti da fonti aperte per rispondere a domande specifiche. Per questa traccia la lista di termini scritta a mano è stata sostituita da una mappa configurabile di 28 entità (società, persone, temi di policy) su tre livelli di affidabilità. Ogni entità ha sinonimi in più lingue e regole per i casi ambigui, come una persona chiave e un suo omonimo. Abbiamo provato sei canali di ricerca e ne abbiamo tenuti due; gli altri quattro li abbiamo scartati sulla base dei numeri, non a impressione. Nel test migliore, la ricerca per nome di una persona chiave su PodcastIndex ha restituito 32 risultati pertinenti su 34; altre query hanno dato risultati molto più scarsi.
3. Acquisizione con match multi-segnale. Il resolver passa da Spotify al feed RSS tramite iTunes e PodcastIndex. L’episodio viene riconosciuto combinando somiglianza del titolo, data e durata: il download parte solo sopra una soglia composita di 0,72, che ha eliminato i falsi positivi riscontrati nei test.
4. Scoring prima dell’ascolto. Un affinity score calcolato sui soli metadati pesa tre gruppi di termini (entità del gruppo, temi energetici, ancore di contesto) con regole di co-occorrenza. La lingua di pubblicazione non è un filtro ma un fattore di peso: l’italiano non subisce penalità, l’inglese e le altre lingue pesano meno ma restano in classifica. È una scelta che conta per i canali noti a livello nazionale, e ancora di più per quelli stranieri, sconosciuti in Italia, dove una citazione del gruppo passerebbe altrimenti inosservata. Solo la testa della classifica passa a Whisper: su 181 episodi, 23 hanno uno score almeno pari a 0,5.
Il Risultato: un presidio che cresce da solo
La campagna guidata dalla mappa del dominio ha portato in coda 31 episodi da 17 programmi (rassegne finanziarie, canali di informazione indipendente, podcast di politica), nessuno dei quali era nella lista di partenza. Tre programmi sono risultati fuori tema, circa il 10% degli episodi, e li abbiamo lasciati visibili nel report: una misura che nasconde i propri errori non serve a migliorare. Quattro soggetti che cercavamo, tre società del gruppo e un partner internazionale, sono emersi dentro episodi trovati per altre vie, senza che una ricerca diretta sui loro nomi li avesse mai restituiti. Ogni episodio verificato arricchisce la mappa, e la mappa migliora la ricerca successiva. Sono i numeri di una prima campagna, destinati a crescere con le migliorie previste.
La pipeline è idempotente ed esclude a monte i canali già coperti dal flusso YouTube; la campagna di discovery non ha attivato costi aggiuntivi. I prossimi passi sono l’analisi delle menzioni (in quale minuto se ne parla, con quale tono) e l’alert unico YouTube più podcast.
Per chi valuta un progetto simile, la lezione è trasferibile: in una pipeline di intelligence gli identificativi devono arrivare dalla fonte, e il modello deve limitarsi a giudicare. È una scelta di architettura, non di prompt, ed è quella che separa un prototipo che sembra funzionare da un servizio su cui si può costruire.