È facile dare per scontato che suggerimenti migliori richiedano un modello più grande — più parametri, più calcolo, una GPU da data center dietro una chiamata API. Per la generazione libera quell'assunto regge spesso. Ma il completamento automatico della prossima espressione è un compito sostanzialmente diverso e più ristretto, e un modello compatto e quantizzato che gira sulla CPU di un portatile gli si adatta bene.

Il completamento automatico è un compito vincolato, non aperto

Quando chiedi a un grande modello linguistico di scrivere un saggio da una pagina bianca, deve prendere migliaia di decisioni su struttura, argomentazione e tono quasi senza vincoli. È lì che la scala del modello rende: più parametri in genere significano una gamma più ampia di risultati plausibili da cui attingere.

Prevedere la prossima espressione è un problema diverso. Il modello ha già la frase che hai iniziato, il contesto circostante e (nel caso di Typeahead) l'app in cui stai scrivendo come segnale forte. Non sta generando dal nulla: sta completando una continuazione breve e già vincolata. È proprio quel vincolo a rendere praticabile un modello piccolo: meno completamenti plausibili tra cui scegliere significa che serve meno capacità grezza per scegliere bene.

Un paragone: prevedere la prossima riga di una frase somiglia più al finire il pensiero di qualcun altro che a scrivere il proprio da zero. Il secondo è aperto; il primo ha uno spazio di risposte ragionevoli molto più piccolo.

Che cosa fa la quantizzazione

I pesi di un modello linguistico grezzo sono di norma memorizzati come numeri in virgola mobile a 16 o 32 bit. La quantizzazione comprime quei pesi a una precisione inferiore — rappresentazioni a 4 o 8 bit, per esempio — con un piccolo compromesso sull'accuratezza, in genere accettabile. Il risultato è un file di modello grande una frazione dell'originale, abbastanza rapido da eseguire inferenza utile su hardware di consumo ordinario, compreso un portatile senza GPU dedicata.

È questo a rendere realistico distribuire un modello che vive interamente sul PC Windows di una persona invece che su un rack di server: un modello quantizzato dell'ordine di qualche centinaio di megabyte o di pochi gigabyte sta comodamente su disco e in memoria accanto a tutto il resto che è già in esecuzione.

Come Typeahead dimensiona i suoi modelli

Typeahead per Windows offre tre modelli opzionali, che ti permettono di scegliere il compromesso tra velocità e qualità dei suggerimenti più adatto alla tua macchina:

Veloce (~400 MB) — predefinito

Il modello più piccolo, tarato per la bassa latenza. È quello attivo fin da subito ed è sufficiente per la maggior parte dei completamenti di espressioni quotidiani.

Bilanciato (~1,1 GB)

Un gradino in più di capacità del modello per le macchine che possono permettersi memoria e disco in più, scambiando un po' di velocità con una gamma di suggerimenti più ampia.

Massimo (~2,5 GB)

Il più grande delle tre opzioni, per chi vuole la migliore qualità di suggerimento che Typeahead offre e ha il margine hardware per sostenerla.

Tutti e tre girano tramite llama.cpp, un motore di inferenza costruito appositamente per eseguire modelli linguistici in modo efficiente su CPU ordinarie e GPU di consumo, e tutti e tre sono basati su Qwen 3, una famiglia di modelli multilingue che copre oltre 100 lingue — così la lingua del suggerimento segue quella in cui stai effettivamente scrivendo, senza cambio manuale.

Perché questo significa anche nessuna dipendenza dal cloud

Poiché il modello è abbastanza piccolo da girare in locale, Typeahead non ha bisogno di un server che faccia il lavoro pesante. Ne deriva una conseguenza diretta sulla privacy — nulla di ciò che scrivi viene trasmesso da qualche parte — ma anche una pratica: i suggerimenti funzionano senza connessione a internet, senza limiti di frequenza delle API e senza dipendere da un servizio remoto che resti online.

Modello Dimensione indicativa Compromesso
Veloce ~400 MB Latenza più bassa, scelta predefinita
Bilanciato ~1,1 GB Più capacità, resta leggero
Massimo ~2,5 GB La migliore qualità di suggerimento disponibile

Che cosa ottieni prima ancora di scaricare un modello

Typeahead non ha bisogno di un modello per essere utile fin dal primo giorno. La correzione automatica con snippet personalizzati e il completamento automatico da dizionario funzionano subito dopo l'installazione, prima che sia stato scaricato qualsiasi modello — i suggerimenti di frase guidati dall'IA si aggiungono sopra quando ne scegli uno dei tre.

Domande frequenti

Un modello da 400 MB è davvero sufficiente per suggerimenti utili?
Per prevedere la prossima espressione — completare una frase che hai già iniziato — sì. È un compito più ristretto della scrittura libera, ed è esattamente per questo che il modello veloce è il predefinito di Typeahead.
Che cosa significa quantizzazione, in parole semplici?
È una tecnica che comprime i numeri interni di un modello a una precisione inferiore, riducendo la dimensione del file e accelerando l'inferenza, con un piccolo compromesso sull'accuratezza in genere accettabile per questo tipo di compito.
Quale modello dovrei scegliere?
Comincia dal predefinito veloce (~400 MB). Se la tua macchina ha memoria e disco da spendere e vuoi una qualità di suggerimento più ampia, prova il bilanciato o il massimo — puoi cambiare in qualsiasi momento.
Serve un modello scaricato per usare Typeahead?
No. La correzione automatica con snippet personalizzati e il completamento automatico da dizionario funzionano prima di scaricare qualsiasi modello. La funzione di completamento delle frasi con IA diventa disponibile quando scegli un modello.
Quale motore di inferenza usa Typeahead?
llama.cpp, con la famiglia di modelli Qwen 3, scelti apposta per un'inferenza efficiente su CPU e GPU di consumo ordinarie senza bisogno di hardware specializzato.

Scarica Typeahead

Scegli veloce, bilanciato o massimo. Tutti inclusi, senza sovrapprezzo. 9,99 $ una tantum.

 Scaricalo dal Microsoft Store