Un grand modèle de langage cloud peut peser plusieurs centaines de gigaoctets de paramètres, répartis sur des grappes de GPU. Un modèle conçu pour tourner sur un ordinateur portable tient, lui, dans quelques centaines de mégaoctets à quelques gigaoctets. L'écart de taille semble énorme — et il l'est. Mais la question qui compte n'est pas « lequel est le plus gros ? », c'est « lequel est adapté à la tâche demandée ? ».

Deux tâches très différentes portent le même nom

« Génération de texte par IA » recouvre en réalité des tâches de difficulté très inégale. Rédiger un article de fond à partir d'un simple sujet, résumer un document juridique de cinquante pages, ou tenir une conversation ouverte sur n'importe quel sujet : ce sont des tâches à très large périmètre, qui bénéficient d'un modèle disposant d'une connaissance du monde aussi vaste que possible.

Prédire les quelques mots suivants d'une phrase que vous avez déjà commencée est une tâche d'une nature complètement différente. Le contexte est déjà là — le début de la phrase, le ton, le sujet — et le modèle n'a besoin que d'identifier la continuation la plus probable et la plus courte. C'est une tâche étroite et contrainte, pas une tâche de génération ouverte.

Une analogie utile : deviner la fin d'une phrase commencée demande beaucoup moins de connaissances générales que d'écrire un roman entier. Un modèle spécialisé dans le premier exercice n'a pas besoin de la capacité nécessaire au second.

Ce que fait la quantification

La quantification est la technique qui rend cette compacité possible. Un modèle est entraîné avec des poids numériques de haute précision (généralement 16 ou 32 bits par paramètre). La quantification réduit cette précision — souvent à 4 ou 8 bits par paramètre — ce qui diminue fortement la taille du fichier et la quantité de calcul nécessaire à chaque prédiction, avec une perte de qualité mesurée et généralement faible pour ce type de tâche.

Moins de bits par paramètre

Chaque poids du modèle occupe moins d'espace en mémoire, ce qui réduit directement la taille du fichier téléchargé sur le disque.

Calcul plus rapide sur CPU

Des opérations sur des nombres plus petits s'exécutent plus vite, ce qui permet une inférence en quelques dizaines de millisecondes sur un processeur ordinaire, sans GPU dédié.

Moins de mémoire vive utilisée

Un modèle quantifié de 400 Mo à 2,5 Go tient confortablement dans la RAM disponible d'un PC équipé de 8 Go, sans concurrencer les autres applications ouvertes.

Typeahead for Windows utilise cette approche avec Qwen 3, servi par le moteur d'inférence llama.cpp, largement utilisé dans l'écosystème des modèles ouverts justement pour sa capacité à exécuter des modèles quantifiés efficacement sur du matériel grand public.

Trois tailles, trois compromis

Typeahead propose trois modèles optionnels, pour laisser le choix entre vitesse et qualité de suggestion selon la machine :

Modèle Taille approximative Compromis
Rapide (par défaut) ~400 Mo Latence la plus faible, suggestions courtes et sûres
Équilibré ~1,1 Go Bon compromis entre vitesse et pertinence
Maximal ~2,5 Go Meilleure qualité de suggestion, léger surcoût de calcul

Même le modèle « maximal » reste très en deçà de la taille d'un grand modèle cloud — parce qu'il n'a jamais besoin de couvrir la même étendue de connaissances. Il doit seulement bien prédire la suite immédiate d'un texte déjà en cours.

Pourquoi la taille du modèle importe pour la confidentialité

Un modèle qui tient dans quelques centaines de mégaoctets à quelques gigaoctets peut être téléchargé une fois et exécuté indéfiniment en local, sans jamais solliciter de serveur distant pour générer une suggestion. C'est justement cette compacité qui rend un fonctionnement entièrement hors ligne possible : un modèle massif nécessiterait une infrastructure que la plupart des PC personnels ne peuvent pas héberger, ce qui forcerait un fournisseur à passer par le cloud.

Le choix d'un petit modèle n'est donc pas seulement une contrainte technique — c'est ce qui permet à Typeahead de fonctionner sans compte, sans connexion requise pour générer des suggestions, et sans jamais transmettre le texte tapé à l'extérieur de l'appareil.

Les limites honnêtes d'un petit modèle

Un modèle compact n'est pas magique. Il ne rédigera pas un document complet à partir d'une simple instruction, et sa connaissance générale du monde est plus limitée que celle d'un modèle massif. Pour la tâche précise de finir une phrase en cours de frappe — la seule que Typeahead cherche à accomplir — cette limite compte peu, car la tâche elle-même ne demande pas cette étendue de connaissances.

Questions fréquentes

Un modèle de 400 Mo peut-il vraiment prédire du texte correctement ?
Oui, pour la tâche de prédiction de la suite d'une phrase déjà commencée. Cette tâche est bien plus étroite que la génération de texte libre, ce qui permet à un modèle compact de bien performer malgré sa petite taille.
Qu'est-ce que la quantification exactement ?
C'est une technique qui réduit la précision numérique des paramètres d'un modèle (par exemple de 16 bits à 4 bits par valeur), diminuant fortement la taille du fichier et le temps de calcul, avec une perte de qualité généralement faible pour des tâches ciblées comme l'autocomplétion.
Pourquoi Typeahead propose-t-il trois tailles de modèle ?
Pour laisser le choix entre vitesse et qualité de suggestion selon le matériel disponible. Le modèle rapide (~400 Mo) est activé par défaut ; les modèles équilibré (~1,1 Go) et maximal (~2,5 Go) offrent des suggestions plus élaborées au prix d'un peu plus de calcul.
Faut-il un GPU pour faire tourner ces modèles ?
Non. Grâce à la quantification et au moteur d'inférence llama.cpp, ces modèles s'exécutent efficacement sur un CPU standard, sans matériel graphique dédié.
Quelle configuration minimale est nécessaire ?
Windows 10 ou ultérieur, ou Windows 11, avec au moins 8 Go de RAM et entre 0,4 et 2,5 Go d'espace disque selon le modèle choisi.

Obtenir Typeahead

Un modèle compact, exécuté entièrement sur votre PC. 9,99 $ à l'achat unique, essai gratuit de 7 jours.

 Télécharger sur le Microsoft Store