Mobilità Articolare
- Dettagli
- 88357
Uno sguardo dietro gli strumenti e le tecniche che usiamo per preparare i contenuti di CASO: automazione, elaborazione audio/video, e tutto ciò che sta "dietro lo schermo" del nostro lavoro quotidiano.
Prima puntata di una serie dedicata a strumenti e tecniche che usiamo per preparare i contenuti di CASO
A novembre torna il nostro FestivALT SOUNDS, e nei giorni scorsi la presidentessa, la direttrice artistica e il produttore musicale dell'associazione sono stati ospiti di un'emittente radiofonica locale per presentarlo. Un bel momento di visibilità — e un contenuto che vogliamo assolutamente condividere anche su casoweb.eu.
C'è però un problema pratico: la trasmissione radiofonica alterna il parlato dell'intervista a brani musicali. Per motivi sia editoriali che di diritti d'autore, quello che vogliamo pubblicare è solo la parte parlata, ripulita dagli intermezzi musicali. Fatto a mano, su una registrazione di oltre due ore, sarebbe un lavoro lunghissimo di ascolto e taglio manuale. Abbiamo quindi deciso di lasciarci aiutare da un po' di automazione, e raccontarvi il percorso.
La registrazione è stata catturata dallo streaming della radio con VLC, ottenendo un file audio pulito e già nel formato ideale per gli strumenti che avremmo usato in seguito (mono, 16kHz) — un colpo di fortuna che ci ha risparmiato un passaggio di conversione.
Per individuare automaticamente "dove si parla" e "dove c'è musica" servono strumenti di riconoscimento vocale. Ne abbiamo provati un paio pensati apposta per distinguere voce e musica, ma si sono rivelati troppo pesanti per il computer su cui stavamo lavorando — macchine anche datate possono benissimo occuparsi di amministrazione e contenuti, ma un conto è gestire un sito, un altro è far girare modelli di intelligenza artificiale piuttosto corposi.
Siamo quindi passati a whisper.cpp, un'implementazione molto leggera ed efficiente del noto modello di trascrizione automatica Whisper (sviluppato da OpenAI). A differenza delle alternative provate prima, gira bene anche solo su processore, senza bisogno di schede video dedicate — perfetto per il nostro hardware.
Non essendo disponibile come programma già pronto per la nostra distribuzione Linux (Ubuntu), l'abbiamo compilato direttamente dal codice sorgente: un procedimento che suona più complicato di quanto sia davvero, in pratica un paio di comandi da terminale, e in pochi minuti avevamo l'eseguibile pronto all'uso.
Con lo strumento compilato e il modello di riconoscimento vocale scaricato, abbiamo avviato l'elaborazione dell'intera registrazione. Su un computer senza scheda grafica dedicata i tempi si allungano — probabilmente ci vorrà più tempo dell'ascolto stesso della registrazione — ma è un'elaborazione che può tranquillamente girare in background mentre ci si dedica ad altro.
Il risultato di questa fase non è ancora l'audio "pulito", ma una trascrizione con tanto di indicazione precisa di quando si parla nel file. Il prossimo passo sarà analizzare questi dati per distinguere in modo affidabile il parlato vero e proprio da eventuali "abbagli" del programma durante i brani musicali cantati, e infine tagliare l'audio nei punti giusti con uno strumento dedicato al montaggio.
Ve lo racconteremo nella prossima puntata — con, se tutto va come previsto, il file finale pronto per l'ascolto.