Gemini 4 Argon AI supera GPT-6 Astra e Fable 5.1 nei test aziendali di Google

Google ha presentato Gemini 4 Argon AI, il nuovo modello di punta che, secondo l’azienda, supera i predecessori in ingegneria del software, lavoro aziendale e difesa informatica. Alphabet ha distribuito il sistema...
Bitcoin 1 Minute
Uno sviluppo di rilievo scuote i mercati delle criptovalute. Google ha presentato Gemini 4 Argon AI, il nuovo modello di punta che, secondo l’azienda, supera i predecessori in ingegneria del software, lavoro aziendale e difesa informatica. Alphabet ha distribuito il sistema mercoledì 30 settembre 2026, partendo da un gruppo ristretto di partner di cybersecurity di fiducia e non da un debutto pubblico completo. È il passo più ambizioso finora verso quella che l’azienda chiama intelligenza di frontiera, mentre Google deve dimostrare che i suoi modelli tengono il passo dei rivali su compiti reali e ad alto rischio.
Punti chiave Il limite di token in output di Gemini 4 Argon AI sale a 1 milione, da 64. 000, permettendo catene di ragionamento molto più lunghe. Il modello fissa un nuovo stato dell’arte su DeepSWE v1.
Dinamiche di mercato
1 con un punteggio del 77,9% per i compiti di ingegneria software a lungo orizzonte. Argon si piazza a pari merito al primo posto su CWE-bench v1 con un punteggio del 68%, basandosi sul lavoro del modello 3. 8 Flash Cyber di Google.
Le implementazioni interne hanno già liberato oltre 300 TiB di memoria nei data center, con un risparmio totale stimato tra 500 TiB e 1 PiB. Google rilascia Argon in fasi, partendo dai partner di cybersecurity. Prestazioni di frontiera in ingegneria software e lavoro d’impresa Gemini 4 Argon AI offre quello che Google definisce un livello di frontiera in flussi di lavoro complessi e reali, dalla programmazione alla ricerca legale e finanziaria fino alla difesa della sicurezza.
L’azienda dice che il modello è già in uso nei propri team di ingegneria, con miglioramenti segnalati nella qualità della scrittura, nella capacità di ricerca e in compiti di coding specializzati. I punteggi dei benchmark che fissano nuovi standard Su DeepSWE v1. 1, benchmark che misura le prestazioni di ingegneria software su compiti reali a lungo orizzonte, Argon ha ottenuto un punteggio del 77,9%, un nuovo stato dell’arte secondo Google.
Impatto sui mercati
Oltre al coding, il modello guida il Vals Index, che misura l’impatto economico su finanza, programmazione, diritto e fiscalità, pesando ogni settore in base al contributo al PIL statunitense. CNBC ha riportato che Argon si posiziona davanti a GPT-6 Astra di OpenAI e a Fable 5. 1 di Anthropic su quello stesso indice.
Il modello è anche primo su AutomationBench di Zapier, che valuta l’esecuzione end-to-end delle funzioni aziendali principali, con un punteggio del 51,3%, e raggiunge il 91,7% su LVBench, test di comprensione video a lungo termine che Google definisce stato dell’arte. La forza di Argon nel ragionamento visivo si estende anche all’analisi professionale di grafici e alle decisioni basate su documenti, utile per chi deve gestire report densi e fascicoli con più pagine. Questa varietà di risultati conta perché mostra che il modello non è solo uno specialista di coding.
Un sistema che va bene in redazione legale, ricerca finanziaria e comprensione video allo stesso tempo suggerisce che Google punta Argon verso clienti enterprise che vogliono un unico modello per più reparti, non un mosaico di strumenti specializzati. La difesa informatica e la collaborazione con Wiz Argon è stato addestrato specificamente per rafforzare la difesa informatica e Google dice che riesce a individuare, validare e correggere in modo autonomo vulnerabilità critiche del software. Su CWE-bench v1, benchmark che valuta la capacità di un modello di correggere falle di sicurezza, Argon si piazza a pari merito al primo posto con un punteggio del 68%, sulla scia del modello 3.
Questo cambiamento continua a plasmare il panorama delle attività digitali.





