AI killed singer star

All'inizio non avevo pensato alla pubblicazione di questo videoclip. Poi, nonostante certi difetti, ho pensato che sia venuta fuori una cosa simpatica. Quindi, ecco "AI killed the singer star": il video, il testo e la sua storia.
(Tra l'altro, la storia di questo video permette di mettere in luce alcune caratteristiche relative alla scrittura dei prompt per IA visive che possono valere, anche se con certe differenze, per molte di loro.)
Video
Testo
Ho quarant'anni, una chitarra stonata, / un'ansia nuova che mi fa la nottata. / Un robot scrive rime più in fretta di me, / e io sudo freddo davanti al caffè.
"Non sono io, è l'algoritmo!" – grido alla folla, / ma la folla applaude l'avatar che balla.
L'IA mi ruba il microfono, / si prende pure il palco buono, / fa hit virali senza fatica, e io qui che canto come una reliquia. / Oh mamma mia, / mi tocca studiare la batteria!
Il vicino di casa, con due prompt e un sorriso,/ ha fatto un album e l'ha pure inciso. / Io vent'anni a cercare il mio sound, / lui "Invio" e già gira il mondo intorno.
"È colpa dell'AI!" ripeto al barista, / ma lui scorre playlist di un DJ futurista.
L'IA mi ruba il microfono, / fa le mie pose meglio di Bono, / ha mille stili in un click solo, / io resto fermo col mio assolo. / Oh mamma mia, / mi sa che mi iscrivo a pizzeria.
Forse è vero, non sono un genio, / la mia paura è solo un inganno. / Se l'arte è sangue, cuore e sudore, / un chip non basta a fregarci l'amore.
L'IA mi ruba il microfono, / ma io ci rido e canto in coro: / "Ok robot, fai pure il figo, / ma il mio sarcasmo resta mio amico!"
Oh mamma mia, / alla fine ho vinto… in ironia!
Storia
Prima di tutto, una breve descrizione delle IA protagoniste, ricavata da ChatGPT.
Sora → Strumento di OpenAI per la generazione di video (e immagini), capace di trasformare prompt testuali in scene visive animate ad alta qualità.
LTX Studio (LTX) → Piattaforma AI per la produzione video strutturata: consente di creare sceneggiature, storyboard, shot-list e sequenze animate mantenendo coerenza tra personaggi, ambienti e movimenti di camera.
Producer (ex Riffusion) → Modello AI per la generazione musicale: produce brani originali partendo da prompt testuali, con possibilità di scegliere stili, strumenti e atmosfere.
E adesso, la (breve) storia.
L'incoerenza di Sora
L'idea iniziale era quella di costruire un personaggio coerente per un breve video realizzato con Sora. IA che genera immagini molto belle ma che non ha alcuna funzione che permetta la coerenza di persone e luoghi tra un'immagine e l'altra. L'unico modo consiste nel generare con ChatGPT (o altra IA simile) dei prompt molto dettagliati da riportare in ogni immagine (visiva o video) di Sora.
Così ho chiesto a Producer questo:
Il testo di una canzone che parla di un artista di circa 40 anni di sesso maschile, terrorizzato dalla possibilità che l'IA gli tolga il lavoro, aprendo infinite possibilità a nuovi competitor, che solo grazie all'IA possono creare arte. Lo stile è divertente, ironico, e prende in giro in modo sarcastico la paranoia del protagonista, probabilmente poco sicuro del suo talento. In lingua italiana. Durata massima 3 minuti.
Producer ha generato qualche canzone, sempre con protagonista un pittore. Una, in particolare, mi era piaciuta. Ma era molto ritmata, in alcuni punti le parole risultavano poco distinguibili e, soprattutto, molte strofe mi sembravano troppo complesse da tradurre in prompt che a loro volta avrebbero dovuto tradursi in immagini. Per cui sono passato al processo opposto: ho inserito in ChatGPT la stessa richiesta che avevo rivolto a Producer. ChatGPT ha generato il testo. Ho riportato il testo in Producer, che ha generato la canzone. Poi ho chiesto a ChatGPT i prompt relativi alla sua canzone e la descrizione del personaggio (che in ChatGPT era diventato un cantante) in modo tale che risultasse coerente da una scena all'altra.

Niente da fare. Il punto, credo, è che per ottenere una coerenza perlomeno accettabile, sia necessario un prompt così dettagliato da rendere il lavoro troppo lungo e complesso: basti pensare a tutto quanto ci sarebbe da scrivere per rappresentare il solo volto. Inoltre, bisognerebbe fare lo stesso nel caso siano previsti altri personaggi. E per i luoghi…
LTX e il caso del prompt 4
Con LTX è possibile costruire personaggi e luoghi mantenendo una buona se non ottima coerenza. La criticità è rappresentata da come interpreta i prompt. A volte, basta un cambiamento minimo per avere un'inquadratura completamente diversa. Altre volte non genera l'immagine descritta dal prompt, ma una simile contenente evidenti errori rispetto alle indicazioni scritte.
Il prompt 4 rappresenta un esempio di come tutto ciò funzioni. Eccolo.
A neighbor in pajamas and slippers types two lines on a laptop, instantly generating songs and paintings on the screen. The main character peeks angrily from behind, holding a huge messy stack of handwritten lyrics.
Un vicino in pigiama e pantofole digita due righe su un computer portatile, generando all'istante canzoni e disegni sullo schermo. Il personaggio principale sbircia arrabbiato da dietro, tenendo in mano un'enorme pila disordinata di testi scritti a mano.
In LTX a "The main character" viene sostituito "@Marco Rossi", che è il nome assegnato al protagonista del video. In questo modo vengono richiamate e riprodotte le caratteristiche indicate nella sua costruzione e si mantiene la coerenza. Il punto era che il vicino in pigiama risultava irrappresentabile. Infatti, risultava avere lo stesso aspetto del protagonista.
Ecco il dialogo tra me e ChatGPT.
ChatGPT - LTX a volte va in difficoltà con prompt che
contengono troppe azioni simultanee o oggetti complessi (tipo
"stack of handwritten lyrics") → tende a semplificare o confondere i ruoli.
Per risolvere bisogna scomporre la scena e descriverla in modo più
chiaro, quasi come se fosse uno storyboard.
Ecco tre versioni alternative del tuo Prompt 4, sempre coerenti col videoclip:
[…]
Dopo che le tre versioni hanno fallito…
Luca - Niente. Credo sia perché nel cast c'è solo il protagonista. Potresti generare la descrizione del vicino di casa?
ChatGPT - Hai ragione 👍
Se nel cast di LTX c'è solo il protagonista, il sistema non riesce a
generare un "vicino di casa" senza una scheda attoriale dedicata. Serve quindi
creare anche lui come Actor Card separato.
Ecco una descrizione pronta che puoi inserire:
[…]

Risultato stavolta ok.
Conclusioni
Affrontare i temi relativi al rapporto tra IA e arte, e ai temi collegati, sarebbe impossibile in un unico post, figuriamoci in queste "Conclusioni". Qui voglio solo mettere in luce il concetto che creare arte con l'IA implica un nuovo modo di fare arte, basato sulle parole. E che, per creare qualcosa di buono, occorre spesso molto lavoro. E che occorre saper usare le parole nel modo più efficace possibile.
