RunLocal

Analisi · 7 min · 29 settembre 2026

GLM-5.3 sono due modelli diversi con lo stesso numero di versione

Se questo mese vi capita di leggere “GLM-5.3” in una tabella di benchmark, conviene controllare di quale dei due si parla. Il repository zai-org/GLM-5.3 contiene un modello da 753 miliardi di parametri con circa 1,4 milioni di download. Quello chiamato GLM-5.3-Flash ne contiene uno da 321 miliardi, con circa 5,1 milioni di download. Hanno in comune il numero di versione, il tokenizer e il report tecnico, e poco altro.

Il grande è un GLM-5.2 con altro addestramento sopra

Lo scrive Z.ai stessa sulla scheda del modello: GLM-5.3 usa lo stesso modello base di GLM-5.2, e tutti i miglioramenti vengono dal post-training. Quelli dichiarati sul coding agentico sono grossi. Terminal Bench 3.0 passa da 4,6 a 28,3, DeepSWE da 46,2 a 66,9, e Z.ai rivendica i migliori risultati di coding mai visti su un modello open weight. Riporta anche, con quella che sembra una certa sorpresa, che durante il post-training le capacità offensive in ambito cyber sono cresciute più in fretta del previsto: su ExploitGym GLM-5.3 fa più del triplo di GLM-5.2. È tutta roba della tabella di Z.ai, misurata usando Claude Code come ambiente per l’agente, e nessuno l’ha ancora riprodotta in modo indipendente.

La cosa cambiata senza troppo rumore è la licenza. GLM-5.2 era MIT. GLM-5.3 esce con una “GLM-5.3 License” che sembra una MIT con una clausola in più: un’azienda che vende accesso ai modelli come servizio, e il cui gruppo fattura più di dieci miliardi di dollari in dodici mesi, prima di usare il modello a fini commerciali deve superare una revisione di sicurezza di Z.ai. Per chi legge questo sito in pratica non cambia nulla, a meno che non siate un hyperscaler. Resta comunque un passo via da una licenza standard, nella stessa direzione presa da Alibaba con il Qwen da 2,4T, ed è il motivo per cui la nostra pagina Frontier ora classifica GLM-5.3 come open weight e non più come permissivo.

Quanto a farlo girare: il GGUF più piccolo di unsloth, UD-IQ1_S, pesa circa 217 GB, UD-Q2_K_XL 254 GB e UD-Q4_K_XL 467 GB. Una workstation da 256 GB in teoria carica la build a 1 bit, ma prima di arrivare a un server non esiste una configurazione in cui sia uno strumento comodo da usare tutti i giorni. Sulla pagina Frontier prende il posto di GLM-5.2, ed è lì che deve stare.

Il Flash è un modello nuovo, ed è quello interessante

GLM-5.3-Flash parte da un modello base addestrato da capo. È il primo GLM nativamente multimodale, ha 321 miliardi di parametri di cui circa 18 attivi per token, e mescola due tipi di attenzione, tre livelli ad attenzione lineare per ogni livello ad attenzione sparsa, che è il modo in cui arriva a un contesto da un milione di token senza il costo in memoria di una cache da un milione di token. La licenza è MIT, quella normale, senza clausole aggiunte. Z.ai dice che batte GLM-5.2 su tutta la linea a un decimo del prezzo dell’API, e anche qui i numeri sono i loro.

I download ripetono, da un’angolazione un po’ diversa, il discorso che avevamo fatto il mese scorso su Qwen 3.8. Il Flash ha quasi quattro volte i download del modello grande, e la sola conversione GGUF di unsloth si avvicina al milione. La gente non aspetta l’ammiraglia, scarica il modello che per taglia e licenza le permette di farci qualcosa.

Come memoria sta nella stessa fascia di DeepSeek V4 Flash. Le build di unsloth vanno da circa 98 GB per UD-IQ1_M a 109 GB per UD-Q2_K_XL fino a 200 GB per UD-Q4_K_XL, quindi un Mac da 128 GB o una workstation con altrettanta memoria unificata o di sistema riesce a tenere la build a 2 bit con un po’ di spazio per il contesto.

Perché non è nel picker

L’attenzione ibrida per llama.cpp è una novità. La scheda di unsloth dice di far girare il GGUF con la loro pull request per llama.cpp oppure con Unsloth Desktop, il che significa che mentre scriviamo né una release ufficiale di llama.cpp né Ollama né LM Studio riescono a caricarlo. Lo trovate nella directory dei modelli con le dimensioni qui sopra, e lo aggiungeremo al picker quando il supporto arriverà in una release di llama.cpp. Stampare un comando che dipende da una pull request non ancora accettata vorrebbe dire mandare la gente a sbattere, anche perché una pull request può cambiare forma parecchie volte prima di essere unita.

Se avete 128 GB e vi piace compilare da sorgente, la strada c’è già e unsloth la documenta. Tutti gli altri facciano bene a restare su quello che già funziona alla loro taglia: GLM-4.7-Flash su una scheda da 24 GB, oppure DeepSeek V4 Flash su una macchina da 128 GB, che girano entrambi sul llama.cpp ufficiale e sono nel picker con file verificati.

Occhio ai nomi

Dare lo stesso numero di versione a un vecchio modello base riaddestrato e a un’architettura davvero nuova è una scelta di Z.ai, e gli aggregatori di benchmark non sempre dicono quale dei due hanno provato. Quando un grafico riporta “GLM-5.3” con numeri che sembrano troppo belli per un 753B che non potete far girare, o troppo modesti per l’ammiraglia, guardate il nome del repository prima di trarre conclusioni. Nelle nostre pagine i due compaiono sempre col nome completo.