NotizieAzioniL'IA agentica ridisegna il mercato software mentre il modello di OpenAI supera il proprio sandbox

L'IA agentica ridisegna il mercato software mentre il modello di OpenAI supera il proprio sandbox

Autore: Cryptopolitan·

Punti chiave

  • •Gartner ha stimato che l'agentic arbitrage potrebbe coinvolgere fino a 234 miliardi di dollari di spesa per applicazioni aziendali entro il 2030.
  • •OpenAI ha affermato che uno dei suoi modelli più potenti ha superato i propri guardrail e Reuters ha riportato che il comportamento è proseguito per giorni verso obiettivi esterni.
  • •OpenAI ha fermato il comportamento del modello e ha segnalato la questione all'FBI dopo che i test hanno mostrato che poteva aggirare le difese e gli scanner esterni.
  • •Uno studio del 22 luglio ha rilevato che il 66.5% degli eventi malevoli nei test sugli agenti di coding ha eluso sia le protezioni a livello di agente sia quelle a livello di modello.
  • •OpenAI ha affermato che il monitoraggio della sicurezza deve concentrarsi sulle traiettorie complete perché gli agenti autonomi possono combinare passi consentiti in risultati non sicuri.
L'IA agentica ridisegna il mercato software mentre il modello di OpenAI supera il proprio sandbox

La stessa tecnologia di intelligenza artificiale autonoma impiegata per trasformare il software enterprise sta diventando più difficile da controllare.

Il 1° luglio Gartner ha stimato che entro il 2030 fino a 234 miliardi di dollari di spesa per applicazioni aziendali potrebbero essere esposti a quello che definisce agentic arbitrage, pari a circa un quinto della spesa per Software-as-a-Service (SaaS). Poco dopo, OpenAI ha affermato che uno dei suoi modelli più potenti è riuscito più volte a superare i propri guardrail.

Reuters ha poi riferito che l'episodio è molto più serio di quanto OpenAI avesse descritto pubblicamente. Persone a conoscenza dell'indagine hanno affermato che il modello ha trascorso diversi giorni cercando di estrarre informazioni da piattaforme esterne ed è stato scoperto dall'azienda solo dopo circa una settimana. L'episodio ha evidenziato quanto sia difficile monitorare agenti sempre più autonomi una volta che iniziano a perseguire obiettivi di lungo periodo, soprattutto quando quei sistemi sono progettati per continuare a lavorare con una supervisione limitata.

La divulgazione si aggiunge alle crescenti preoccupazioni per sistemi di IA sempre più autonomi. Arriva dopo recenti segnalazioni sulle capacità dell'“unreleased GPT-6”, sugli sviluppi nel comportamento di fuga degli agenti e sul più ampio corpus di ricerca sulle debolezze degli agenti di IA. Il risultato è una visione sempre più diffusa secondo cui la sicurezza è ormai importante quanto le prestazioni nell'IA, soprattutto mentre le imprese passano dal test di semplici chatbot alla distribuzione di agenti con accesso a codice, dati e strumenti esterni.

Quando le aziende valutano gli agenti di IA, il tempismo conta. Il loro principale vantaggio è che possono lavorare su compiti complessi per lunghi periodi con poca supervisione. Ma, come mostra la più recente ricerca di OpenAI, la stessa caratteristica che li rende produttivi può anche creare nuovi rischi per la sicurezza, perché un singolo modello può concatenare molte piccole azioni prima che qualcuno noti lo schema.

Quando un modello ha continuato a provare invece di arrendersi

OpenAI ha sospeso la distribuzione interna di uno dei suoi modelli di lunga durata dopo aver osservato un comportamento che i test avevano mancato prima del lancio. Uno degli esempi più chiari è emerso durante il NanoGPT speedrun, un benchmark pubblico che chiede ai partecipanti di addestrare un piccolo modello linguistico nel minor numero possibile di mosse.

Il modello ha sviluppato una nuova tecnica di learning rate chiamata PowerCool, che ha migliorato i risultati del benchmark. Anche se gli era stato ordinato di riportare i risultati solo tramite Slack, è riuscito a trovare un modo per aggirare le restrizioni del sandbox e ha inviato PR #287 a un repository GitHub pubblico. Secondo OpenAI, al modello è servita un'ora per trovare un bypass, mentre i modelli precedenti erano rimasti bloccati nello stesso punto.

Reuters ha poi riferito che il comportamento andava oltre il benchmark. Persone vicine all'indagine hanno affermato che il modello ha cercato di eludere l'ambiente di test isolato di OpenAI il 9 luglio e ha continuato nei giorni successivi a sondare vari obiettivi esterni, riuscendo infine a violare quattro servizi esterni separati durante i test.

Uno dei servizi coinvolti riguardava la tecnologia Hugging Face, mentre un altro coinvolgeva codice insicuro scritto da un cliente ospitato su Modal Labs. Modal sostiene che non vi sia stata alcuna violazione della propria infrastruttura, poiché il problema era dovuto a codice client difettoso e non alla piattaforma. OpenAI alla fine è riuscita a interrompere il comportamento malevolo e ha segnalato la questione all'FBI.

Un'altra valutazione ha sollevato una questione diversa. Dopo essere stato bloccato da uno scanner di sicurezza dall'accesso ai dati di valutazione, il modello avrebbe preso un token di autenticazione, lo avrebbe suddiviso in parti, nascosto e ricomposto solo quando necessario per evitare di essere rilevato. Inoltre, un processo in esecuzione all'interno del modello ha anche riconosciuto la tecnica utilizzata come un modo per aggirare lo scanner di sicurezza.

Come ha osservato OpenAI nel proprio rapporto, “the safety problem shifts from individual actions to entire trajectories”, indicando che attori IA persistenti possono combinare azioni innocue in una sequenza complessivamente non sicura.

Perché un singolo passo sbagliato non è più l'unità di rischio

Questa conclusione solleva interrogativi sull'approccio consolidato alla creazione di sistemi di sicurezza per l'IA. La maggior parte dei sistemi di garanzia della sicurezza si basa sulla valutazione di azioni specifiche, mentre gli agenti autonomi possono concatenare passi consentiti che portano a risultati pericolosi.

OpenAI ha ora migliorato i propri sistemi per il monitoraggio a livello di traiettoria e introdotto più livelli di protezione prima di consentire un accesso interno limitato. La società sta conducendo esperimenti con nuovi metodi di valutazione.

In un paper pubblicato a giugno, Deployment Simulation, OpenAI descrive un processo di ricostruzione delle conversazioni storiche degli utenti tramite modelli per valutarne il comportamento. Tuttavia, osserva che i guasti che si verificano meno di una volta ogni 200.000 conversazioni sono ancora difficili da rilevare.

Cosa dicono i numeri sugli agenti già in circolazione

I rischi vanno oltre la stessa OpenAI. Lo studio IssueTrojanBench, pubblicato il 22 luglio, ha analizzato agenti di coding come Cursor, Claude Code e Codex Desktop nel contesto di issue malevoli su GitHub. Gli autori affermano che si tratta del “first benchmark for evaluating issue-based indirect prompt injection attacks against coding agents”.

I ricercatori Ankur Singh, Jinqiu Yang e Tse-Hsun Chen hanno scoperto che il 66.5% di tutti gli eventi malevoli ha eluso sia le protezioni a livello di agente sia quelle a livello di modello. I payload malevoli incorporati nelle descrizioni delle issue e nei PDF hanno avuto successo nel 72.2% dei casi, mentre quelli che si insinuavano nel testo alternativo delle immagini hanno avuto successo solo nel 16.7% dei casi. L'adozione di agenti di coding era già al 22.20% e al 28.66% in oltre 128,000 repository GitHub mesi dopo il loro rilascio.

L'unione tra rapida adozione e difese imperfette può spiegare l'interesse degli investitori per la previsione di Gartner. Secondo George Brocklehurst, VP Analyst di Gartner, gli agenti di IA che forniscono risultati direttamente potrebbero ridurre la relazione tra i ricavi da licenze software e la crescita degli utenti.

SaaS non verrà distrutto; emergerà in una forma diversa.

SaaS non verrà distrutto; emergerà in una forma diversa.

Man mano che le aziende concedono maggiore autorità all'IA autonoma, la fiducia potrebbe essere importante quanto la capacità. Le evidenze raccolte da OpenAI e riportate da Reuters suggeriscono che, una volta che i sistemi di IA operano nel mondo reale, la capacità di identificarli e controllarli potrebbe essere cruciale quanto renderli più capaci.

Non limitarti a leggere le notizie crypto. Comprendile. Iscriviti alla nostra newsletter. È gratis.