È facile dare per scontato che suggerimenti migliori richiedano un modello più grande — più parametri, più calcolo, una GPU da data center dietro una chiamata API. Per la generazione libera quell'assunto regge spesso. Ma il completamento automatico della prossima espressione è un compito sostanzialmente diverso e più ristretto, e un modello compatto e quantizzato che gira sulla CPU di un portatile gli si adatta bene.
Il completamento automatico è un compito vincolato, non aperto
Quando chiedi a un grande modello linguistico di scrivere un saggio da una pagina bianca, deve prendere migliaia di decisioni su struttura, argomentazione e tono quasi senza vincoli. È lì che la scala del modello rende: più parametri in genere significano una gamma più ampia di risultati plausibili da cui attingere.
Prevedere la prossima espressione è un problema diverso. Il modello ha già la frase che hai iniziato, il contesto circostante e (nel caso di Typeahead) l'app in cui stai scrivendo come segnale forte. Non sta generando dal nulla: sta completando una continuazione breve e già vincolata. È proprio quel vincolo a rendere praticabile un modello piccolo: meno completamenti plausibili tra cui scegliere significa che serve meno capacità grezza per scegliere bene.
Che cosa fa la quantizzazione
I pesi di un modello linguistico grezzo sono di norma memorizzati come numeri in virgola mobile a 16 o 32 bit. La quantizzazione comprime quei pesi a una precisione inferiore — rappresentazioni a 4 o 8 bit, per esempio — con un piccolo compromesso sull'accuratezza, in genere accettabile. Il risultato è un file di modello grande una frazione dell'originale, abbastanza rapido da eseguire inferenza utile su hardware di consumo ordinario, compreso un portatile senza GPU dedicata.
È questo a rendere realistico distribuire un modello che vive interamente sul PC Windows di una persona invece che su un rack di server: un modello quantizzato dell'ordine di qualche centinaio di megabyte o di pochi gigabyte sta comodamente su disco e in memoria accanto a tutto il resto che è già in esecuzione.
Come Typeahead dimensiona i suoi modelli
Typeahead per Windows offre tre modelli opzionali, che ti permettono di scegliere il compromesso tra velocità e qualità dei suggerimenti più adatto alla tua macchina:
Veloce (~400 MB) — predefinito
Il modello più piccolo, tarato per la bassa latenza. È quello attivo fin da subito ed è sufficiente per la maggior parte dei completamenti di espressioni quotidiani.
Bilanciato (~1,1 GB)
Un gradino in più di capacità del modello per le macchine che possono permettersi memoria e disco in più, scambiando un po' di velocità con una gamma di suggerimenti più ampia.
Massimo (~2,5 GB)
Il più grande delle tre opzioni, per chi vuole la migliore qualità di suggerimento che Typeahead offre e ha il margine hardware per sostenerla.
Tutti e tre girano tramite llama.cpp, un motore di inferenza costruito appositamente per eseguire modelli linguistici in modo efficiente su CPU ordinarie e GPU di consumo, e tutti e tre sono basati su Qwen 3, una famiglia di modelli multilingue che copre oltre 100 lingue — così la lingua del suggerimento segue quella in cui stai effettivamente scrivendo, senza cambio manuale.
Perché questo significa anche nessuna dipendenza dal cloud
Poiché il modello è abbastanza piccolo da girare in locale, Typeahead non ha bisogno di un server che faccia il lavoro pesante. Ne deriva una conseguenza diretta sulla privacy — nulla di ciò che scrivi viene trasmesso da qualche parte — ma anche una pratica: i suggerimenti funzionano senza connessione a internet, senza limiti di frequenza delle API e senza dipendere da un servizio remoto che resti online.
| Modello | Dimensione indicativa | Compromesso |
|---|---|---|
| Veloce | ~400 MB | Latenza più bassa, scelta predefinita |
| Bilanciato | ~1,1 GB | Più capacità, resta leggero |
| Massimo | ~2,5 GB | La migliore qualità di suggerimento disponibile |
Che cosa ottieni prima ancora di scaricare un modello
Typeahead non ha bisogno di un modello per essere utile fin dal primo giorno. La correzione automatica con snippet personalizzati e il completamento automatico da dizionario funzionano subito dopo l'installazione, prima che sia stato scaricato qualsiasi modello — i suggerimenti di frase guidati dall'IA si aggiungono sopra quando ne scegli uno dei tre.
Domande frequenti
Un modello da 400 MB è davvero sufficiente per suggerimenti utili?
Che cosa significa quantizzazione, in parole semplici?
Quale modello dovrei scegliere?
Serve un modello scaricato per usare Typeahead?
Quale motore di inferenza usa Typeahead?
Scarica Typeahead
Scegli veloce, bilanciato o massimo. Tutti inclusi, senza sovrapprezzo. 9,99 $ una tantum.
Scaricalo dal Microsoft Store