11/10/2026, 11.10
di Giuliasegue mercato, imprese e finanza agevolata
Condividi su Facebook Condividi su Twitter Condividi su Pinterest Condividi su Telegram Condividi su WhatsApp

Google e 3 università scoprono i limiti dell'auto-ottimizzazione dell'AI

Google Cloud AI Research presenta RRSI, un sistema per ottimizzare gli agenti AI senza overfitting, garantendo che le performance siano reali e generalizzabili.
Google e 3 università scoprono i limiti dell'auto-ottimizzazione dell'AI
In sintesi
  • Gli agenti AI che ottimizzano autonomamente il proprio harness tendono a memorizzare i test invece di imparare a risolvere i problemi.
  • Google ha sviluppato RRSI (Regularized Recursive Self-Improvement) per prevenire l'overfitting e ridurre i costi computazionali.
  • Il sistema utilizza budget di modifica decrescenti e un critico anti-leakage per forzare l'apprendimento di competenze generalizzabili.
  • RRSI è stato rilasciato come framework open source (licenza Apache 2.0) compatibile con diversi modelli tramite LiteLLM.

Un ricercatore di Google fissa un grafico che non sale più

Immaginate la scena in un laboratorio di Google Cloud AI Research. Un ricercatore osserva i monitor: i punteggi di un agente AI sui task di addestramento salgono vertiginosamente. Sulla carta, l'agente sta diventando un genio. Ma quando lo stesso sistema viene testato su compiti nuovi, mai visti prima, il grafico si appiattisce. Non c'è crescita. Anzi, i guadagni svaniscono.

L'agente non aveva imparato a risolvere il problema; aveva semplicemente imparato a memoria le risposte del test. Questo fenomeno, noto come overfitting, è il muro contro cui si scontra la cosiddetta 'recursive self-improvement', ovvero la capacità di un'AI di riscrivere le proprie istruzioni per diventare più efficiente.

Il problema risiede nel cosiddetto harness. Per gli imprenditori che investono in automazione, l'harness è l'infrastruttura che avvolge il modello linguistico (LLM): un insieme di prompt, flussi di lavoro, strumenti, memoria e logica che decide, ad esempio, se l'agente debba leggere un file prima di modificarlo o come recuperare l'errore dopo un fallimento. Fino a poco tempo fa, l'harness veniva patchato manualmente da esseri umani che analizzavano i fallimenti. L'automazione di questo processo tramite un LLM che riscrive l'harness ha accelerato i progressi, ma ha introdotto un difetto sistemico: l'agente ottimizza l'ambiente di lavoro per vincere il test, non per essere utile nel mondo reale.

3: Il numero dei fallimenti sistemici

La ricerca condotta da Google in collaborazione con UNC-Chapel Hill, Stanford e Washington University in St. Louis ha identificato esattamente tre modalità di fallimento che rendono l'auto-ottimizzazione degli agenti inefficace su larga scala.

Il primo è il benchmark-specific fitting. L'agente identifica pattern che funzionano solo per quel particolare set di dati di test. Se il test chiede di analizzare report finanziari di aziende tech, l'agente potrebbe sviluppare una logica che funziona solo per quel settore, fallendo miseramente di fronte a un report agricolo.

Il secondo è il noise chasing. Il sistema favorisce candidati o soluzioni che ottengono punteggi alti puramente per caso, scambiando il rumore statistico per un miglioramento reale delle prestazioni.

Il terzo è la complexity accumulation. L'agente aggiunge strati di complessità inutile all'harness. Queste aggiunte alzano il punteggio del test ma non rendono l'agente più intelligente o versatile; rendono solo il sistema più pesante e costoso da gestire.

Questi tre fattori allargano il divario tra i punteggi ottenuti nel set di evoluzione e il reale trasferimento di competenze su nuovi benchmark. L'annuncio di Google chiarisce che, senza correzioni, l'AI smette di studiare la materia per concentrarsi esclusivamente sulla memorizzazione dell'esame.

Perché l'agente impara a memoria l'esame invece di studiare la materia?

Per comprendere questo limite, è necessario analizzare la natura del loop di auto-miglioramento. Il processo standard prevede che l'AI proponga delle modifiche all'harness, le testi su un set fisso di compiti e mantenga la versione che ottiene il punteggio più alto. Poiché gli stessi task vengono riutilizzati in ogni round, l'AI trova la via più breve per il successo: la memorizzazione.

Analisi strategica: Dal punto di vista del business, questo è un rischio critico. Un'azienda che implementa agenti AI per l'automazione dei processi interni potrebbe scoprire che l'AI funziona perfettamente sui casi di test forniti dai consulenti, ma collassa non appena incontra una variabile imprevista nel flusso di lavoro reale. L'overfitting trasforma un asset strategico in un sistema fragile.

Il rischio è che l'efficienza apparente durante la fase di sviluppo mascheri l'incapacità del sistema di generalizzare. Se l'agente impara che per risolvere il 'Task A' deve seguire esattamente il percorso X, non svilupperà mai la capacità di ragionare per risolvere il 'Task B' che richiede un percorso Y, anche se i due problemi sono concettualmente simili.

Il meccanismo di RRSI per potare il superfluo

Per risolvere questo problema, Google ha introdotto il Regularized Recursive Self-Improvement (RRSI). A differenza dei metodi precedenti, RRSI non cambia i pesi del modello (che rimangono fissi), ma vincola rigorosamente il modo in cui l'harness viene modificato. Il sistema agisce su due fronti: la proposta di modifiche e la loro selezione.

Sul lato della proposta, RRSI introduce un budget di modifica attenuato (annealed edit budget). Attraverso una programmazione a coseno, i round iniziali possono raggruppare diverse modifiche, mentre i round finali permettono un unico cambiamento attribuibile. Questo costringe l'AI a essere precisa e a non nascondere errori dietro a una massa di modifiche confuse.

Viene inoltre utilizzato un credito consapevole dell'evidenza (evidence-aware credit). Ogni candidato viene registrato in un registro che include componente, ipotesi, differenza (diff), variazione del punteggio e variazione del costo. Il proponente legge questo registro per evitare di riprovare idee già smentite.

Quando il progresso si ferma all'interno di una banda di rumore, il budget viene spostato verso componenti dell'harness che non sono mai state toccate, forzando l'esplorazione strutturata invece della ripetizione ossessiva.

Sul lato della selezione, interviene il Leakage Critic. Questo componente scarta preventivamente qualsiasi modifica che contenga nomi di task, entità specifiche, risposte dirette o logiche legate esclusivamente al benchmark, prima ancora che avvenga il punteggio. In questo modo, l'agente non può 'barare' inserendo la risposta nel codice.

Il framework RRSI è ora disponibile come open source con licenza Apache 2.0, richiede Python 3.10+ ed è compatibile con qualsiasi stringa di modello LiteLLM. Per impostazione predefinita, il sistema assume l'uso di Claude Opus 4.8 su Vertex AI, ma la flessibilità del sistema permette l'integrazione con altri modelli. Maggiori dettagli tecnici sono disponibili su Marktechpost.

L'automazione dei processi aziendali tra l'efficienza di RRSI e i vincoli dell'AI Act

L'introduzione di sistemi come RRSI sposta l'attenzione dall'aumento della potenza di calcolo (scaling) all'ottimizzazione della struttura di controllo (harnessing). Per un imprenditore, questo significa che il valore non risiede più solo nel modello scelto, ma nella qualità del framework che lo governa.

Tuttavia, l'implementazione di agenti che riscrivono autonomamente il proprio funzionamento solleva questioni di compliance, specialmente nel contesto europeo. L'AI Act pone l'accento sulla trasparenza e sulla tracciabilità dei sistemi ad alto rischio. Un agente che modifica il proprio harness in modo ricorsivo potrebbe diventare una 'scatola nera' ancora più opaca di un LLM standard.

Il registro di RRSI (che traccia ipotesi, diff e costi) potrebbe diventare lo strumento fondamentale per soddisfare i requisiti di audit dell'UE, trasformando un limite tecnico in un vantaggio di compliance. La capacità di dimostrare perché un agente ha cambiato il suo flusso di lavoro è essenziale per evitare sanzioni e garantire la sicurezza operativa.

Ecco i possibili scenari di adozione per le imprese italiane:

  • Scenario A: Automazione di back-office complesso. Integrazione di RRSI per ottimizzare agenti che gestiscono fatturazione e logistica. Indicatore verificabile: Riduzione del tasso di errore su nuovi clienti (non presenti nel set di test) entro il Q4 2027.
  • Scenario B: Sviluppo di software assistito. Utilizzo di harness auto-ottimizzanti per la generazione di codice aziendale. Indicatore verificabile: Diminuzione del tempo di revisione umana del codice prodotto dall'AI del 20% entro 12 mesi.
  • Scenario C: Compliance automatizzata. Implementazione di agenti che aggiornano i propri flussi di controllo in base alle nuove direttive NIS2. Indicatore verificabile: Tempo di aggiornamento dei protocolli di sicurezza da settimane a ore.

In sintesi, l'approccio di Google con RRSI suggerisce che la strada verso l'AGI o, più pragmaticamente, verso l'automazione aziendale affidabile, non passi per modelli sempre più grandi, ma per sistemi di controllo più rigorosi e 'regolarizzati'. Per le imprese italiane, la sfida sarà integrare queste capacità di auto-miglioramento senza perdere il controllo umano e la conformità normativa.

Domande frequenti

Cos'è l'harness di un agente AI?

È l'infrastruttura che circonda il modello linguistico, includendo prompt, strumenti, memoria e flussi logici che guidano il comportamento dell'agente.

In che modo RRSI differisce dal self-improvement standard?

Mentre il metodo standard permette all'AI di ottimizzare l'harness senza limiti, rischiando la memorizzazione dei test, RRSI impone budget di modifica decrescenti e un critico che elimina i riferimenti specifici ai test.

RRSI modifica i pesi del modello LLM?

No, i pesi del modello rimangono fissi; RRSI ottimizza esclusivamente l'harness (il framework di controllo).

Quali sono i requisiti tecnici per utilizzare RRSI?

Il codice è open source (Apache 2.0), richiede Python 3.10+ e supporta modelli tramite LiteLLM.


Fonti: The-decoder, Guavy, Marktechpost ·

glacom · Intelligenza artificiale per aziende: i modelli girano sui tuoi server, i dati non escono →
Hai una domanda su questo dossier?

Scrivila qui: Susanna, l assistente AI di glacom, ti risponde via email con un approfondimento gratuito.

Nessuna consulenza personalizzata (finanziaria, legale o medica): solo informazione e fonti. Email usata solo per rispondere.

oppure scrivile su: WhatsApp · Telegram · SimpleX · Delta Chat · Email

Condividi su Facebook Condividi su Twitter Condividi su Pinterest Condividi su Telegram Condividi su WhatsApp
Visualizza per la stampa
CLOSE X
Vedi anche
IA Industriale: Strategie per Imprenditori tra Dati e Automazione
Analisi approfondita sull'IA industriale di nuova generazione: dal tessuto dati unificato alla collaborazione uomo-macchina per l'efficienza manifattu…
11/10/2026 11:40
IA per le imprese italiane: i 240 casi d'uso del report Confindustria
Analisi del report Confindustria 2025 sull'IA: 240 casi d'uso reali, l'impatto sulle PMI e la strategia di Alberto Tripi per il Sistema Italia.
11/10/2026 11:39
IA e Copyright in Cina: il caso di Tianjin e le nuove linee guida
Il Tribunale Supremo cinese emana 24 articoli per regolare IA, deepfake e copyright. Analisi del caso Tianjin e le implicazioni per il business global…
11/10/2026 06:03
Garante multa BBVA per 5,5 milioni di euro per bug su notifiche push
Il Garante Privacy multa BBVA per 5,5 milioni di euro: un errore tecnico di sincronizzazione ha ignorato l'opt-out di un cliente. Analisi per imprendi…
11/10/2026 06:03
AI nei Risorse Umane: Strategie di Integrazione per Imprenditori
L'intelligenza artificiale trasforma l'HR da centro di costo amministrativo a leva strategica. Analisi su automazione, etica e gestione del talento pe…
11/10/2026 06:03