Marimea unui dragon este limitata de anvergura aripilor; marimea modelului tau este limitata de memorie. Aceasta lectie iti da matematica exacta a memoriei pentru antrenare, apoi compara cele doua masini ale cursului — Mac Studio M3 Ultra cu 96 GB memorie unificata si PC-ul cu i9 si RTX 4090 (24 GB VRAM) — ca sa stii precis ce modele poate antrena fiecare si care castiga la ce capitol.
Matematica memoriei care decide totul
Memoria de antrenare este dominata de patru lucruri: ponderile modelului, gradientii, starea optimizatorului si activarile. Cat de mult ai nevoie depinde in intregime de metoda de antrenare:
Concept
Reguli empirice per miliard de parametri:Fine-tune complet (16-bit + AdamW): ~16–20 GB per 1B parametri — ponderi (2) + gradienti (2) + optimizator (8–12) + activari.
LoRA (baza inghetata pe 16-bit): ~2–2.5 GB per 1B parametri — baza doar sta in memorie; se antreneaza doar adapterele minuscule.
QLoRA (baza inghetata pe 4-bit): ~0.6–0.8 GB per 1B parametri — baza e comprimata la 4 biti, adapterele se antreneaza tot pe 16-bit.
Fa calculele si imaginea devine instantanee:
| Marime model | Fine-tune complet | LoRA (16-bit) | QLoRA (4-bit) |
|---|---|---|---|
| 1B | ~18 GB | ~3 GB | ~1.5 GB |
| 4B | ~70 GB | ~10 GB | ~4 GB |
| 8B | ~140 GB | ~18 GB | ~7 GB |
| 14B | ~250 GB | ~32 GB | ~12 GB |
| 32B | ~550 GB | ~70 GB | ~24 GB |
| 70B | ~1.2 TB | ~150 GB | ~48 GB |
Acum suprapune plafoanele de memorie ale celor doua masini:
Masina 1: Mac Studio M3 Ultra, 96 GB memorie unificata
Trucul Apple este memoria unificata: CPU si GPU impart un singur bazin urias. Nu exista "copiere in VRAM" — GPU-ul vede toti cei 96 GB (macOS iti lasa implicit sa impingi cam 75% din ea catre GPU, mai mult daca ajustezi). Antrenarea ruleaza pe MLX, framework-ul ML al Apple, folosind pachetul mlx-lm.
Puncte forte:
- Capacitatea e regina. QLoRA pe un model 32B e confortabil. LoRA pe 14B merge. Chiar si un QLoRA pe 70B e posibil — lent, dar posibil. Pe o placa de 24 GB, acestea sunt pur si simplu inaccesibile.
- Silentios, consum minuscul (~160 W sub sarcina), sta pe un birou.
- Aceeasi masina apoi ruleaza rapid modele mari la inferenta — ~800 GB/s latime de banda a memoriei este excelenta pentru generarea de tokeni.
Puncte slabe:
- Puterea bruta de antrenare. GPU-ul din M3 Ultra e puternic, dar ecosistemul CUDA e cu un deceniu inainte la optimizari de antrenare. Asteapta-te la antrenari de 2–4× mai lente decat pe un 4090 pentru modelele care incap pe ambele.
- Unele trucuri de antrenare de ultima ora (kernel-uri sofisticate, unele scheme de cuantizare) ajung intai pe CUDA, pe MLX mai tarziu sau niciodata.
Masina 2: PC cu i9 + RTX 4090, 24 GB VRAM
4090 este un monstru: ~1000 GB/s latime de banda a memoriei, tensor cores dedicate si intregul stack CUDA — Unsloth, Hugging Face transformers + peft + trl, Flash Attention, bitsandbytes. i9-ul si RAM-ul de sistem conteaza mai ales pentru preprocesarea datelor; GPU-ul face treaba adevarata.
Puncte forte:
- Viteza e regina. Pentru orice ≤ 8B, 4090 devoreaza antrenarea. Un run LoRA care dureaza o ora pe Mac se termina in ~15–20 de minute.
- Kernel-urile Unsloth cam dubleaza viteza de antrenare si injumatatesc memoria fata de Hugging Face standard — un 2× gratuit exact pe aceasta placa.
- Fiecare tutorial, fiecare tehnica noua, fiecare optimizare apare intai pe CUDA.
Puncte slabe:
- 24 GB este un zid dur. LoRA pe 14B in 16-bit nu incape; QLoRA pe 32B abia se strecoara cu un batch mic si context scurt. Cand nu incape, pur si simplu crapa — nu exista "lent dar merge" ca pe memoria unificata.
- Consum si zgomot: 450 W doar pe GPU sub sarcina.
Deci care ar trebui sa antreneze ce?
| Scenariu | Castigator | De ce |
|---|---|---|
| LoRA/QLoRA pe 1B–8B (proiectul cursului) | RTX 4090 | De 2–4× mai rapid, oricum incape tot |
| QLoRA pe 14B–32B | M3 Ultra | Incape cu spatiu de respiratie; 4090 se sufoca |
| Orice atinge 70B | M3 Ultra | Singura masina cu memoria necesara, rabdare obligatorie |
| Servirea modelului antrenat dupa aceea | Egalitate | 4090 mai rapid pentru modele mici, Mac-ul duce pe cele mai mari |
| Experimente cu tehnici nou-noute | RTX 4090 | Ecosistem CUDA-first |