L'azienda cinese DeepSeek ha presentato una versione aggiornata del suo modello DeepSeek-V4-Flash-0731, che dimostra che ulteriori miglioramenti delle prestazioni dell'intelligenza artificiale non sono necessariamente legati solo a modelli sempre più grandi. La novità, pur mantenendo l'architettura e le dimensioni invariate, è stata notevolmente potenziata grazie a un nuovo processo di ottimizzazione post-training e ha superato anche il modello più grande DeepSeek-V4-Pro in test indipendenti.
Il DeepSeek-V4-Flash-0731 si basa sulla versione preliminare del modello V4-Flash, rilasciata ad aprile. Secondo la documentazione dell'azienda, l'architettura e le dimensioni del modello sono rimaste invariate, ed è stato principalmente eseguito un nuovo processo di ottimizzazione post-training. Questo passaggio ha portato a un notevole aumento delle capacità, il che dimostra quanto siano importanti, oltre al numero di parametri, anche i metodi di ottimizzazione post-training.
Il modello utilizza l'architettura Mixture-of-Experts (MoE) e attiva solo una parte dei suoi parametri per ogni token. Il checkpoint ufficiale pubblicato da DeepSeek ha circa 304 miliardi di parametri, inclusa la componente per la decodifica speculativa. Il modello è disponibile anche come soluzione open-weight tramite la piattaforma Hugging Face.
Una delle caratteristiche più importanti è l'eccezionalmente lungo contesto supportato. DeepSeek dichiara il supporto fino a un milione di token in input e una lunghezza massima dell'output di 384.000 token. Il modello supporta sia la modalità di ragionamento che la modalità standard, l'utilizzo di strumenti e altre funzionalità necessarie, ad esempio, per creare agenti AI più autonomi.
Modello più piccolo supera il fratello maggiore
I risultati dell'azienda Artificial Analysis sono tra le parti più interessanti dell'aggiornamento. Il DeepSeek-V4-Flash-0731 ha ottenuto 50 punti nell'Artificial Analysis Intelligence Index in modalità di ragionamento massima. Questo risultato lo colloca tra i modelli attuali più performanti e, secondo gli esperti, supera significativamente la versione precedente V4-Flash.
Grazie ai test, il modello Flash aggiornato è riuscito a superare anche il DeepSeek-V4-Pro, che è un risultato significativo soprattutto in termini di efficienza. Lo sviluppo dell'IA si sta sempre più spostando dalla domanda "come creare il modello più grande" alla domanda "come ottenere la massima intelligenza con le risorse computazionali disponibili".
Inoltre, DeepSeek esercita pressione sulla concorrenza attraverso i prezzi. Artificial Analysis indica un costo API di circa 0,14 dollari per milione di token in input e 0,28 dollari per milione di token in output. In uno scenario combinato che include l'utilizzo della cache, il costo è significativamente inferiore rispetto a molti modelli concorrenti.
È proprio il rapporto tra prestazioni e prezzo che ha portato il DeepSeek-V4-Flash-0731 alla cosiddetta Pareto frontier di Artificial Analysis: ovvero, tra i modelli per i quali non è possibile trovare alternative più intelligenti ed economiche contemporaneamente, in base alle metriche monitorate.
Lungo contesto e generazione più rapida
Un'altra parte importante del modello è l'ottimizzazione dell'elaborazione di contesti lunghi. L'architettura della famiglia V4 utilizza meccanismi che riducono la quantità di calcoli e memoria necessari per elaborare input estesi. Questo è fondamentale, ad esempio, quando si lavora con documenti di grandi dimensioni, database, conversazioni lunghe o in attività autonome, dove il modello raccoglie gradualmente una grande quantità di informazioni.
La versione rilasciata include anche la tecnologia di decodifica speculativa. Un piccolo modulo ausiliario propone preventivamente alcuni dei token successivi e il modello principale può quindi verificarli contemporaneamente. Questo si traduce in una generazione più rapida senza la necessità di modificare sostanzialmente il modello stesso. Hugging Face registra un checkpoint di circa 304 miliardi di parametri per questa versione.
Artificial Analysis ha misurato che il modello genera oltre cento token di output al secondo, il che lo colloca tra i modelli di ragionamento più veloci in questa categoria di prestazioni.
La competizione si sposta dalla dimensione all'efficienza
DeepSeek-V4-Flash-0731 rappresenta una tendenza più ampia che sta guadagnando sempre più terreno nel settore dell'intelligenza artificiale generativa. Gli sviluppatori non competono più solo in termini di prestazioni assolute dei modelli più grandi, ma anche in termini di quanta intelligenza riescono a offrire per un dollaro e con quali requisiti hardware.
Questo è particolarmente importante per gli agenti AI. Questi ultimi, durante la risoluzione di compiti complessi, possono consumare milioni di token lavorando su documenti, programmazione, richieste dei clienti o database aziendali. Anche una differenza relativamente piccola nel costo di un milione di token può quindi comportare differenze significative nei costi operativi quando vengono implementati su larga scala.
Inoltre, DeepSeek offre un ulteriore vantaggio grazie alla disponibilità dei pesi del modello. Le aziende non sono quindi vincolate esclusivamente alle API cloud e possono distribuire il modello sulla propria infrastruttura, il che può essere interessante, ad esempio, nei casi in cui è importante mantenere i dati sensibili all'interno dell'organizzazione. DeepSeek ha pubblicato il modello come parte della sua collezione V4 su Hugging Face.
L'aggiornamento V4-Flash non è quindi interessante solo per un ulteriore miglioramento nelle classifiche di benchmark. Dimostra che un addestramento e un'ottimizzazione migliori possono avere un impatto maggiore rispetto alla semplice aggiunta del numero di parametri. E proprio la combinazione di elevate prestazioni, velocità, contesto esteso, pesi aperti e basso costo potrebbe essere più importante per lo sviluppo futuro del mercato dell'IA rispetto alla corsa al modello più grande in assoluto.
gnews.cz - tk