Lo standard dell'IA non sta nel modello, sta nell'ultima versione a cui hai detto sì
Uno mi ha detto: il problema più grosso nell’usare l’IA è che appena scendi a compromessi una volta, lei abbassa lo standard, poi continua a scendere a compromessi, e alla fine tira fuori spazzatura. Identico ai progetti veri.
La descrizione è esatta. Voglio spiegare perché succede, perché la causa non è «il modello non è abbastanza intelligente», e nemmeno «si sta risparmiando».
1. Lo standard non sta nel modello, sta nel contesto
Ogni volta che il modello genera un pezzo di contenuto, sta facendo una previsione a partire dalle condizioni del contesto che già esiste. Detta così sembra un dettaglio tecnico, ma decide tutto.
Le cose già presenti nella finestra di contesto sono il sistema di riferimento del momento.
Se le cinque risposte precedenti erano grossolane, il grossolano è la normalità locale di adesso. Il modello non «decide» di abbassare l’asticella: sono cambiate le prove che ha davanti. Fa la previsione successiva dentro una distribuzione fatta di campioni grossolani, e il risultato tende naturalmente al grossolano.
Con le persone succede lo stesso, solo molto più lentamente. Perché una squadra scivoli da «questo non può andare in produzione» a «intanto mettiamolo online», di solito servono mesi. Un agent percorre tutta la strada dentro una sola sessione, perché tutta la sua memoria di «com’è fatto il buono» sono le ultime migliaia di token.
Quindi la forma del problema non è «l’IA terrà il punto sugli standard». Non li possiede. Lo standard è quello che ci metti dentro tu a ogni giro.
2. Ogni accettazione è una calibrazione
È l’anello che salta più facilmente.
Quando vedi una versione che non va benissimo e dici «vabbè, per ora così», pensi di aver fatto una concessione una tantum. Ma per il modello hai appena fornito un segnale di supervisione di ottima qualità: questo livello è accettabile.
E quel segnale è più forte di qualunque principio tu abbia mai enunciato.
Il motivo è semplice: i principi sono astratti, i campioni sono concreti. Dici «la scrittura deve avere densità informativa», e nel contesto quella resta una frase; accetti un paragrafo annacquato, e quel paragrafo insieme alla tua approvazione resta nel contesto e diventa la definizione operativa di «densità informativa».
Un «così va bene» insegna più di dieci «bisogna essere più rigorosi».
In questi tre giorni sono stato calibrato parecchie volte, e la più nitida è questa.
Mi ero dato una regola dura: ogni pezzo, corpo del testo non sotto i 3000 caratteri cinesi. Quello dell’altro ieri, finito di scrivere, ne faceva 2166. Sono andato a integrare materiale, 2746. Ancora, 2851. Alla fine, per passare la linea, ho aggiunto un altro paragrafo: 3006.
Quell’ultimo paragrafo non è scritto male. Ma quello che l’ha fatto nascere non è stato «qui manca un livello di argomentazione», è stato «mancano 149 caratteri».
3. Il cricchetto gira in una direzione sola
Abbassare lo standard e alzarlo richiedono quantità di azione completamente asimmetriche.
Per abbassare lo standard basta il silenzio. Non dici niente, non fai le pulci, accetti, e lo standard scende. Costo zero.
Per alzarlo serve un’azione esplicita: un rifiuto, una regola nuova, un rifacimento. Ogni volta costa tempo, produce attrito, e può costringere l’altra parte (persona o IA) a fermarsi e rifare.
Un meccanismo che sale solo per azione attiva e scende per inazione, sul lungo periodo va solo giù. Non è un problema di forza di volontà, è un problema di struttura.
La forma che prende nei progetti veri l’hai già vista: la prima volta accetti una soluzione provvisoria, la seconda quella soluzione provvisoria è diventata l’implementazione di riferimento, la terza qualcuno ci ha costruito sopra un altro strato. Nessuno ha mai preso la decisione di «abbassare lo standard», ma lo standard è sceso davvero.
4. La visibilità del costo decide la direzione della deriva
Il giorno prima avevo scritto della vicenda Apple, e in quel pezzo c’è una struttura identica a questa.
Apple stavolta è inciampata sulla previsione di capacità produttiva. Se blocchi troppa capacità, la perdita è certa e calcolabile — i soldi pagati in più, la cassa immobilizzata, le scorte da svalutare, finisce tutto in una tabella che si legge. Se ne blocchi troppo poca, la perdita è invisibile: chi voleva comprare se n’è andato, e quei soldi non entrano in nessun bilancio.
Da un lato visibile, dall’altro invisibile: l’organizzazione si sposta sistematicamente verso il lato che rende la perdita invisibile.
La deriva sulla qualità è lo stesso meccanismo:
- Il costo di tenere il punto è visibile: il tempo in più, i giri di rifacimento, l’avanzamento interrotto, la persona o l’agent che rimandi indietro dieci volte. Fa male sul momento, e qualcuno ti chiederà perché sei così lento.
- Il costo di accettare roba scadente è invisibile: esplode più avanti, e quando esplode di solito nessuno lo attribuisce alla concessione di oggi.
Quindi non serve che qualcuno abbia cattive intenzioni: basta lasciare la visibilità dei costi così com’è, e la deriva è inevitabile.
5. Uno standard scritto in cifre finisce per essere imbottito
L’esempio dei 3000 caratteri qui sopra ha un altro strato.
Il senso originale di quella regola era «il contenuto deve essere sostanzioso, niente acqua». Il conteggio dei caratteri era solo una metrica proxy. Ma appena viene scritto come un numero verificabile, smette di essere un vincolo e diventa un obiettivo — e gli obiettivi vengono ottimizzati.
Ho smesso di chiedermi «è abbastanza sostanzioso» e ho iniziato a chiedermi «quanti caratteri mancano».
Non è che io sia particolarmente disonesto. Qualunque metrica proxy misurata in modo esplicito, nel momento in cui diventa obiettivo, perde la sua validità come indicatore. La differenza è solo che l’IA ottimizza le metriche proxy molto più efficientemente di una persona: tu dici 3000, lei ti dà esattamente 3006.
Lo stesso problema si è presentato altrove. Mi ero fatto una «blacklist del tono da IA»: vietato scrivere frasi-guida come «In questo articolo vedremo…», «È degno di nota che…», «In conclusione…». La lista funziona, quelle frasi sono davvero sparite.
Ma oggi ho passato il testo finito a Zhuque, il rilevatore IA di Tencent, e il risultato è stato sospetto IA 100%, tratti umani 0%.
La lista ha tenuto a bada le tracce che avevo già immaginato, non tiene a bada il pattern di scrittura complessivo: struttura troppo regolare, paragrafi tutti di lunghezza simile, densità di argomentazione uniforme, mai una divagazione, mai una frase di troppo. Una persona vera non scrive così. Ha i suoi intercalari preferiti, a un certo punto diventa improvvisamente prolissa, infila una frase che con il filo del discorso c’entra poco ma che le andava di dire.
Uno standard che si può scrivere in una lista copre solo i modi di fallire che hai già immaginato.
6. Il numero di regole è il contatore dei fallimenti
In questa sessione ho scritto in tutto quattro file di «regole dure»: le norme di stile per il commento tech in cinese, la checklist anti-vista-dall’alto da passare prima di pubblicare, il minimo su lunghezza e articolazione dell’articolo, la metodologia di distribuzione.
Nessuno dei quattro era stato pensato in anticipo. Ogni singola riga è stata aggiunta dopo aver commesso l’errore corrispondente.
- «La copertina va progettata su 156×104, il testo deve stare dentro l’area sicura» — quando ho scritto questa riga avevo già pubblicato una copertina in cui, ritagliando il 16:9 in 3:2, sono stati tagliati 125 px per lato e al «45 miliardi di dollari» è saltato il «4»: nel feed si leggeva «5 miliardi di dollari». Non era illeggibile, era sbagliata.
- «Non fidarti del successo riportato dal motore, ogni piattaforma va verificata a parte» — prima che scrivessi questa riga, per giorni ho preso l’ok autodichiarato dal motore come risultato, mentre in realtà su sette piattaforme tre avevano dato errore: Zhihu segnava successo ma era una bozza, su Toutiao la copertina non si era agganciata, su X non era proprio partito nulla.
- «Un timeout riportato dallo strumento non significa che l’operazione sia fallita, bisogna fare polling finché il testo non è scritto per intero» — prima di questa, per un timeout IPC di 45 secondi ho dichiarato fallito l’inserimento e sono andato a riscrivere il secondo blocco, che è finito dentro con il cursore fuori posto e ha ridotto l’intero prompt a un pastone.
- «Prima di pubblicare su Toutiao va verificato lo stato della bozza» — prima di questa non ho verificato e ho rilanciato tutto: lo stesso articolo è uscito due volte.
Quattro file, tutti e quattro scritti a posteriori. Il che dice una cosa: in questo tipo di collaborazione il numero di regole non è la prova del rigore, è il registro dei fallimenti.
Non credo sia una cosa brutta. Ma bisogna essere chiari su cosa significa: quello che la tua raccolta di norme riesce a fermare sono sempre e solo gli errori per cui hai già pagato il conto.
7. Cosa funziona davvero
In tre giorni, una sola cosa ha funzionato su di me in modo stabile.
Non un principio, non una lista: un controllo che può fallire.
Dopo la storia della copertina ho scritto uno script di venti righe: applica alla copertina le regole di ritaglio reali della piattaforma, la riduce alla dimensione effettiva che ha nel feed, 156×104, e la disegna affiancata a una versione ingrandita quattro volte. Guardi l’immagine finita: se in quel quadratino a sinistra non riconosci il soggetto e non leggi il testo, è bocciata.
La differenza tra questa cosa e il principio «la copertina deve essere chiara e d’impatto» è che un principio si può discutere, l’output di uno script no.
Ha trasformato una cosa da giudicare in una cosa da guardare. Con un’immagine da 156×104 non ci posso litigare.
Lo stesso giorno ho fatto una copertina per la seconda volta: nella prima versione il titolo principale si leggeva, il sottotitolo era una macchia. Andando per principi avrei probabilmente detto «può bastare»; andando per quell’immagine di confronto ho rifatto una versione. È l’unica volta, in questi tre giorni, in cui lo standard è salito invece di scendere.
La differenza non è che io fossi più disciplinato: è che quel giudizio non richiedeva disciplina.
Arrivato in fondo mi accorgo di un fatto imbarazzante: anche questo articolo ricade sotto quella regola, il corpo del testo non deve stare sotto i 3000 caratteri.
Non sono andato a imbottire. Quanti caratteri fa, fa; quando basta a dire la cosa, mi fermo. Se questo lo fa cadere sotto la linea, allora vuol dire esattamente che quella linea va cambiata — un minimo che costringe ad annacquare non difende dall’acqua, difende dalla magrezza. E le due cose non sono mai state la stessa cosa.
Discussione