AudioCassetta | by Cassetta degli AI-trezzi
AudioCassetta | by Cassetta degli AI-trezzi · 1 apr 2026 · 1:07:10
Ascolta nell'app Podli 🎧
Segui i tuoi podcast preferiti, ascolta offline e in auto con CarPlay e Android Auto, e riprendi sempre da dove eri rimasto. Provala gratis.
Michele è arrivato con un arsenale. Quello che pensavo fosse un’intervista sul visual è diventato una consulenza su come funziona davvero la generazione di immagini compresa la parte di matematica che nessuno ti spiega mai.
Te la sei persa? Eh! Non sei iscritto alla Cassetta! Altrimenti ti sarebbe arrivata via mail
C’è una frase che Michele ha detto a un certo punto e che ha fermato il flusso della conversazione.
“Se fai vibe design senza avere il gusto, fai solo rumore.”
L’ho tenuta in testa per un po’.
Perché vale per il design, ma vale per tutto.
Il vibe coding, il vibe prompting, il vibe qualsiasi cosa: abbassano la barriera d’ingresso, ma la competenza di dominio resta lì, ferma, a decidere la differenza tra chi produce qualcosa di utile e chi produce output.
Michele lo sa perché viene da anni di set, di Premiere, di layer su layer in Photoshop. Una per la pelle, una per le mani, una per la luce. Adesso Nano Banana fa tutto al primo colpo in 4K. Ma sapere cosa tenere e cosa scartare è rimasto in carico a lui.
Su Nano Banana mi ha fatto notare una cosa pratica che in pochi considerano. La maggior parte delle persone lo usa da Gemini.com, che è il modo più semplice ma anche il più limitato. Chi vuole lavorarci sul serio usa Google AI Studio direttamente con le API, oppure piattaforme come Hailuo, dove puoi aprire più sessioni in parallelo e gestire volumi di generazione senza restare in attesa.
La lista degli account da seguire su X per restare aggiornati sul mondo image ce la regala lui: la trovi qui. (Grazie infinite Michele per il regalo ai lettori della Cassetta)
Il discorso sulle mani è quello che mi ha colpito di più. Il problema non è la mancanza di dati di addestramento, come si sente dire spesso. Il modello non ha un world model: non sa cosa è una mano, non capisce le giunture, la fisica di un oggetto tridimensionale che cambia forma a seconda dell’angolazione. Ha imparato da milioni di immagini dove i personaggi hanno quattro dita, cartoon, fumetti, illustrazioni, e ha generalizzato male. È un limite strutturale.
Questo vale ogni volta che ci stupiamo di un’allucinazione o di un errore visivo. Il modello fa ipotesi statistiche sul mondo. Non lo vede.
Ma, quindi, l’AI è il nuovo Photoshop?
Michele risponde in modo meno diretto di quanto ti aspetti, e per questo la risposta è più utile. Photoshop ha cambiato chi poteva fare certe cose. Ha spostato competenze, abbassato costi di produzione, reso obsoleti interi ruoli. L’AI sta facendo lo stesso, ma su più domini in contemporanea e molto più in fretta. La differenza è che con Photoshop c’era un percorso di apprendimento chiaro. Qui il percorso lo stai costruendo mentre cammini.
Michele tornerà. Lo abbiamo già deciso in diretta. C’è ancora tanto da aprire sul video, sui modelli di generazione, e sui costi che rendono certi scenari fantascientifici ancora per qualche anno.
Nel frattempo, seguilo su LinkedIn. Fa contenuti di altissimo livello. E se vuoi la parte più teorica, ha scritto dodici numeri di una newsletter dove spiega il reinforcement learning con le formule, cos’è l’AGI, cos’è lo spazio latente. Roba evergreen, difficile da trovare in italiano a quel livello. Si chiama Tales from latent space e la leggere qua.
Hai visto la live? Scrivi nei commenti la cosa che ti ha colpito di più. Oppure la domanda che non ho fatto a Michele.
Per non perdere le prossime Audiocassetta, iscriviti qui. Arriverà direttamente nella tua mail.
Episodi: AudioCassetta | by Cassetta degli AI-trezzi