Un grand modèle de langage cloud peut peser plusieurs centaines de gigaoctets de paramètres, répartis sur des grappes de GPU. Un modèle conçu pour tourner sur un ordinateur portable tient, lui, dans quelques centaines de mégaoctets à quelques gigaoctets. L'écart de taille semble énorme — et il l'est. Mais la question qui compte n'est pas « lequel est le plus gros ? », c'est « lequel est adapté à la tâche demandée ? ».
Deux tâches très différentes portent le même nom
« Génération de texte par IA » recouvre en réalité des tâches de difficulté très inégale. Rédiger un article de fond à partir d'un simple sujet, résumer un document juridique de cinquante pages, ou tenir une conversation ouverte sur n'importe quel sujet : ce sont des tâches à très large périmètre, qui bénéficient d'un modèle disposant d'une connaissance du monde aussi vaste que possible.
Prédire les quelques mots suivants d'une phrase que vous avez déjà commencée est une tâche d'une nature complètement différente. Le contexte est déjà là — le début de la phrase, le ton, le sujet — et le modèle n'a besoin que d'identifier la continuation la plus probable et la plus courte. C'est une tâche étroite et contrainte, pas une tâche de génération ouverte.
Ce que fait la quantification
La quantification est la technique qui rend cette compacité possible. Un modèle est entraîné avec des poids numériques de haute précision (généralement 16 ou 32 bits par paramètre). La quantification réduit cette précision — souvent à 4 ou 8 bits par paramètre — ce qui diminue fortement la taille du fichier et la quantité de calcul nécessaire à chaque prédiction, avec une perte de qualité mesurée et généralement faible pour ce type de tâche.
Moins de bits par paramètre
Chaque poids du modèle occupe moins d'espace en mémoire, ce qui réduit directement la taille du fichier téléchargé sur le disque.
Calcul plus rapide sur CPU
Des opérations sur des nombres plus petits s'exécutent plus vite, ce qui permet une inférence en quelques dizaines de millisecondes sur un processeur ordinaire, sans GPU dédié.
Moins de mémoire vive utilisée
Un modèle quantifié de 400 Mo à 2,5 Go tient confortablement dans la RAM disponible d'un PC équipé de 8 Go, sans concurrencer les autres applications ouvertes.
Typeahead for Windows utilise cette approche avec Qwen 3, servi par le moteur d'inférence llama.cpp, largement utilisé dans l'écosystème des modèles ouverts justement pour sa capacité à exécuter des modèles quantifiés efficacement sur du matériel grand public.
Trois tailles, trois compromis
Typeahead propose trois modèles optionnels, pour laisser le choix entre vitesse et qualité de suggestion selon la machine :
| Modèle | Taille approximative | Compromis |
|---|---|---|
| Rapide (par défaut) | ~400 Mo | Latence la plus faible, suggestions courtes et sûres |
| Équilibré | ~1,1 Go | Bon compromis entre vitesse et pertinence |
| Maximal | ~2,5 Go | Meilleure qualité de suggestion, léger surcoût de calcul |
Même le modèle « maximal » reste très en deçà de la taille d'un grand modèle cloud — parce qu'il n'a jamais besoin de couvrir la même étendue de connaissances. Il doit seulement bien prédire la suite immédiate d'un texte déjà en cours.
Pourquoi la taille du modèle importe pour la confidentialité
Un modèle qui tient dans quelques centaines de mégaoctets à quelques gigaoctets peut être téléchargé une fois et exécuté indéfiniment en local, sans jamais solliciter de serveur distant pour générer une suggestion. C'est justement cette compacité qui rend un fonctionnement entièrement hors ligne possible : un modèle massif nécessiterait une infrastructure que la plupart des PC personnels ne peuvent pas héberger, ce qui forcerait un fournisseur à passer par le cloud.
Le choix d'un petit modèle n'est donc pas seulement une contrainte technique — c'est ce qui permet à Typeahead de fonctionner sans compte, sans connexion requise pour générer des suggestions, et sans jamais transmettre le texte tapé à l'extérieur de l'appareil.
Les limites honnêtes d'un petit modèle
Un modèle compact n'est pas magique. Il ne rédigera pas un document complet à partir d'une simple instruction, et sa connaissance générale du monde est plus limitée que celle d'un modèle massif. Pour la tâche précise de finir une phrase en cours de frappe — la seule que Typeahead cherche à accomplir — cette limite compte peu, car la tâche elle-même ne demande pas cette étendue de connaissances.
Questions fréquentes
Un modèle de 400 Mo peut-il vraiment prédire du texte correctement ?
Qu'est-ce que la quantification exactement ?
Pourquoi Typeahead propose-t-il trois tailles de modèle ?
Faut-il un GPU pour faire tourner ces modèles ?
Quelle configuration minimale est nécessaire ?
Obtenir Typeahead
Un modèle compact, exécuté entièrement sur votre PC. 9,99 $ à l'achat unique, essai gratuit de 7 jours.
Télécharger sur le Microsoft Store