Skip to content
Connais les ailes de ton dragon : M3 Ultra 96 Go vs RTX 4090
← Retour au Cours Lecon 3 / 8

Connais les ailes de ton dragon : M3 Ultra 96 Go vs RTX 4090

La taille d'un dragon est limitee par son envergure ; la taille de ton modele est limitee par la memoire. Cette lecon te donne le calcul de memoire exact pour l'entrainement, puis compare nos deux machines du cours — le Mac Studio M3 Ultra avec 96 Go de memoire unifiee et le PC i9 avec une RTX 4090 (24 Go de VRAM) — pour que tu saches precisement quels modeles chacune peut entrainer, et laquelle gagne sur quoi.

Le calcul de memoire qui decide de tout

La memoire d'entrainement est dominee par quatre choses : les poids du modele, les gradients, l'etat de l'optimiseur et les activations. La quantite necessaire depend entierement de la methode d'entrainement :

Concept

Regles empiriques par milliard de parametres :
Fine-tune complet (16-bit + AdamW) : ~16–20 Go par 1B params — poids (2) + gradients (2) + optimiseur (8–12) + activations.
LoRA (base gelee en 16-bit) : ~2–2,5 Go par 1B params — la base reste juste en memoire ; seuls de minuscules adaptateurs s'entrainent.
QLoRA (base gelee en 4-bit) : ~0,6–0,8 Go par 1B params — la base est compressee en 4 bits, les adaptateurs s'entrainent toujours en 16-bit.

Fais les calculs et le tableau devient limpide :

Taille du modele Fine-tune complet LoRA (16-bit) QLoRA (4-bit)
1B ~18 Go ~3 Go ~1,5 Go
4B ~70 Go ~10 Go ~4 Go
8B ~140 Go ~18 Go ~7 Go
14B ~250 Go ~32 Go ~12 Go
32B ~550 Go ~70 Go ~24 Go
70B ~1,2 To ~150 Go ~48 Go

Maintenant, superposons les plafonds memoire de nos deux machines :

Memoire d'entrainement QLoRA par taille de modele (Go) 1B 1.5 4B 4 8B 7 14B 12 32B 24 70B 48 Plafond RTX 4090 — 24 Go Plafond M3 Ultra — 96 Go (~75 Go utilisables pour l'entrainement) Violet = rentre sur les deux · Ambre = limite sur la 4090 · Rouge = territoire Mac uniquement

Machine 1 : Mac Studio M3 Ultra, 96 Go de memoire unifiee

Le tour de magie d'Apple, c'est la memoire unifiee : le CPU et le GPU partagent un seul pool geant. Il n'y a pas de "copie vers la VRAM" — le GPU voit les 96 Go en entier (macOS te laisse en pousser environ 75% vers le GPU par defaut, plus si tu ajustes). L'entrainement tourne sur MLX, le framework ML d'Apple, avec le package mlx-lm.

Forces :

  • La capacite est reine. QLoRA sur un modele 32B est confortable. LoRA sur du 14B fonctionne. Meme un QLoRA 70B est possible — lent, mais possible. Sur une carte de 24 Go, tout ca est simplement hors de portee.
  • Silencieux, consommation minuscule (~160 W en charge), tient sur un bureau.
  • La meme machine fait tourner ensuite de gros modeles rapidement en inference — ~800 Go/s de bande passante memoire, excellent pour la generation de tokens.

Faiblesses :

  • La puissance de calcul brute en entrainement. Le GPU du M3 Ultra est solide, mais l'ecosysteme CUDA a une decennie d'avance en optimisations d'entrainement. Attends-toi a des runs 2 a 4 fois plus lents qu'une 4090 pour les modeles qui rentrent dans les deux.
  • Certaines astuces d'entrainement de pointe (kernels sophistiques, certains schemas de quantization) arrivent sur CUDA d'abord, sur MLX plus tard ou jamais.

Machine 2 : PC i9 + RTX 4090, 24 Go de VRAM

La 4090 est un monstre : ~1000 Go/s de bande passante memoire, des tensor cores dedies, et toute la stack CUDA — Unsloth, Hugging Face transformers + peft + trl, Flash Attention, bitsandbytes. L'i9 et la RAM systeme comptent surtout pour le pretraitement des donnees ; le GPU fait le vrai travail.

Forces :

  • La vitesse est reine. Pour tout ce qui fait ≤ 8B, la 4090 devore l'entrainement. Un run LoRA qui prend une heure sur le Mac se termine en ~15–20 minutes.
  • Les kernels d'Unsloth doublent environ la vitesse d'entrainement et divisent la memoire par deux vs Hugging Face vanilla — un 2× gratuit sur cette carte precise.
  • Chaque tutoriel, chaque nouvelle technique, chaque optimisation sort d'abord sur CUDA.

Faiblesses :

  • 24 Go, c'est un mur dur. Un LoRA 14B en 16-bit ne rentre pas ; un QLoRA 32B passe a peine avec un petit batch et un contexte court. Quand ca ne rentre pas, ca crashe, point — il n'y a pas de "lent mais ca marche" comme avec la memoire unifiee.
  • Consommation et bruit : 450 W rien que pour le GPU en charge.

Alors, laquelle doit entrainer quoi ?

Scenario Gagnant Pourquoi
LoRA/QLoRA sur 1B–8B (notre projet de cours) RTX 4090 2–4× plus rapide, tout rentre de toute facon
QLoRA sur 14B–32B M3 Ultra Rentre avec de la marge ; la 4090 s'etouffe
Tout ce qui touche au 70B M3 Ultra Seule machine avec la memoire, patience requise
Servir le modele entraine ensuite Egalite 4090 plus rapide pour les petits modeles, le Mac gere les plus gros
Experimenter avec des techniques toutes neuves RTX 4090 Ecosysteme CUDA-first

Note honnete

Internet adore declarer une machine "gagnante". La verite est ennuyeuse et utile : la 4090 est une voiture de course, le M3 Ultra est un camion. Notre projet de cours — un modele 4B avec QLoRA — rentre sur les deux avec de la marge, et c'est exactement pour ca qu'on l'a choisi.

Astuce Pro

Quelle que soit ta machine, garde de la marge. Si le calcul dit 22 Go et que tu en as 24, un seul exemple d'entrainement long peut faire exploser les activations et tuer le run a l'etape 900 sur 1000. Une longueur de sequence max plus courte et le gradient checkpointing sont les deux boutons qui te sauvent — la lecon 5 montre ou ils se trouvent.

Essaie

Calcule ton propre plafond. Prends ta memoire GPU/unifiee, multiplie par 0,8 par securite, et regarde le tableau : quel est le plus gros modele que toi tu peux passer en QLoRA ? Note-le a cote de ta fiche d'objectif. Ce chiffre choisira ton modele de base a la lecon 5.

Checkpoint

Tu peux estimer de tete la memoire d'entrainement pour n'importe quel modele (complet ≈ 18×, LoRA ≈ 2,5×, QLoRA ≈ 0,7× Go par milliard de params), et tu connais le plafond realiste de ta machine. Prochaine etape : la partie que tout le monde saute et regrette ensuite — le dataset.