La taille d'un dragon est limitee par son envergure ; la taille de ton modele est limitee par la memoire. Cette lecon te donne le calcul de memoire exact pour l'entrainement, puis compare nos deux machines du cours — le Mac Studio M3 Ultra avec 96 Go de memoire unifiee et le PC i9 avec une RTX 4090 (24 Go de VRAM) — pour que tu saches precisement quels modeles chacune peut entrainer, et laquelle gagne sur quoi.
Le calcul de memoire qui decide de tout
La memoire d'entrainement est dominee par quatre choses : les poids du modele, les gradients, l'etat de l'optimiseur et les activations. La quantite necessaire depend entierement de la methode d'entrainement :
Concept
Regles empiriques par milliard de parametres :Fine-tune complet (16-bit + AdamW) : ~16–20 Go par 1B params — poids (2) + gradients (2) + optimiseur (8–12) + activations.
LoRA (base gelee en 16-bit) : ~2–2,5 Go par 1B params — la base reste juste en memoire ; seuls de minuscules adaptateurs s'entrainent.
QLoRA (base gelee en 4-bit) : ~0,6–0,8 Go par 1B params — la base est compressee en 4 bits, les adaptateurs s'entrainent toujours en 16-bit.
Fais les calculs et le tableau devient limpide :
| Taille du modele | Fine-tune complet | LoRA (16-bit) | QLoRA (4-bit) |
|---|---|---|---|
| 1B | ~18 Go | ~3 Go | ~1,5 Go |
| 4B | ~70 Go | ~10 Go | ~4 Go |
| 8B | ~140 Go | ~18 Go | ~7 Go |
| 14B | ~250 Go | ~32 Go | ~12 Go |
| 32B | ~550 Go | ~70 Go | ~24 Go |
| 70B | ~1,2 To | ~150 Go | ~48 Go |
Maintenant, superposons les plafonds memoire de nos deux machines :
Machine 1 : Mac Studio M3 Ultra, 96 Go de memoire unifiee
Le tour de magie d'Apple, c'est la memoire unifiee : le CPU et le GPU partagent un seul pool geant. Il n'y a pas de "copie vers la VRAM" — le GPU voit les 96 Go en entier (macOS te laisse en pousser environ 75% vers le GPU par defaut, plus si tu ajustes). L'entrainement tourne sur MLX, le framework ML d'Apple, avec le package mlx-lm.
Forces :
- La capacite est reine. QLoRA sur un modele 32B est confortable. LoRA sur du 14B fonctionne. Meme un QLoRA 70B est possible — lent, mais possible. Sur une carte de 24 Go, tout ca est simplement hors de portee.
- Silencieux, consommation minuscule (~160 W en charge), tient sur un bureau.
- La meme machine fait tourner ensuite de gros modeles rapidement en inference — ~800 Go/s de bande passante memoire, excellent pour la generation de tokens.
Faiblesses :
- La puissance de calcul brute en entrainement. Le GPU du M3 Ultra est solide, mais l'ecosysteme CUDA a une decennie d'avance en optimisations d'entrainement. Attends-toi a des runs 2 a 4 fois plus lents qu'une 4090 pour les modeles qui rentrent dans les deux.
- Certaines astuces d'entrainement de pointe (kernels sophistiques, certains schemas de quantization) arrivent sur CUDA d'abord, sur MLX plus tard ou jamais.
Machine 2 : PC i9 + RTX 4090, 24 Go de VRAM
La 4090 est un monstre : ~1000 Go/s de bande passante memoire, des tensor cores dedies, et toute la stack CUDA — Unsloth, Hugging Face transformers + peft + trl, Flash Attention, bitsandbytes. L'i9 et la RAM systeme comptent surtout pour le pretraitement des donnees ; le GPU fait le vrai travail.
Forces :
- La vitesse est reine. Pour tout ce qui fait ≤ 8B, la 4090 devore l'entrainement. Un run LoRA qui prend une heure sur le Mac se termine en ~15–20 minutes.
- Les kernels d'Unsloth doublent environ la vitesse d'entrainement et divisent la memoire par deux vs Hugging Face vanilla — un 2× gratuit sur cette carte precise.
- Chaque tutoriel, chaque nouvelle technique, chaque optimisation sort d'abord sur CUDA.
Faiblesses :
- 24 Go, c'est un mur dur. Un LoRA 14B en 16-bit ne rentre pas ; un QLoRA 32B passe a peine avec un petit batch et un contexte court. Quand ca ne rentre pas, ca crashe, point — il n'y a pas de "lent mais ca marche" comme avec la memoire unifiee.
- Consommation et bruit : 450 W rien que pour le GPU en charge.
Alors, laquelle doit entrainer quoi ?
| Scenario | Gagnant | Pourquoi |
|---|---|---|
| LoRA/QLoRA sur 1B–8B (notre projet de cours) | RTX 4090 | 2–4× plus rapide, tout rentre de toute facon |
| QLoRA sur 14B–32B | M3 Ultra | Rentre avec de la marge ; la 4090 s'etouffe |
| Tout ce qui touche au 70B | M3 Ultra | Seule machine avec la memoire, patience requise |
| Servir le modele entraine ensuite | Egalite | 4090 plus rapide pour les petits modeles, le Mac gere les plus gros |
| Experimenter avec des techniques toutes neuves | RTX 4090 | Ecosysteme CUDA-first |