Skip to content
Fable 5.1 vs Fable 5: același preț, altă factură
← ← Înapoi la Idei AI

Fable 5.1 vs Fable 5: același preț, altă factură

Anthropic a lansat Claude Fable 5.1 și primul lucru pe care îl vezi în pagina de prețuri e că nu s-a schimbat nimic: 10 dolari pe milionul de tokeni de intrare, 50 pe milionul de ieșire, exact ca la Fable 5. Al doilea lucru, pe care nu-l vezi decât dacă citești ghidul de migrare până la capăt, e că totul s-a schimbat în felul în care ajungi la factura aia. Ce cumperi la 5.1 nu e „un model mai bun la același preț", ci un model care se comportă altfel la fiecare nivel de efort, care citește cache-ul de patru ori mai ieftin și care îți impune un fel anume de a construi harness-ul din jurul lui.

Am scris articolul ăsta pentru cei care trebuie să decidă în următoarele săptămâni dacă migrează. Am pus și Opus 5 în comparație, pentru că fără el discuția e incompletă: Opus 5 costă jumătate, merge sub zero data retention și, la efort mare, rezolvă o parte mare din ce rezolvă și Fable. Toate cifrele de mai jos vin din documentația oficială de API din august 2026, nu din benchmark-uri de marketing. Unde nu am cifre, spun că nu am.

Cele trei modele, într-un tabel

Fable 5.1 Fable 5 Opus 5
Context / output maxim 1M / 128K 1M / 128K 1M / 128K
Intrare / ieșire ($ per MTok) 10 / 50 10 / 50 5 / 25
Citire din cache ($ per MTok) 0,25 1,00 0,50
Scriere în cache, 5 min ($ per MTok) 12,50 12,50 6,25
Batch ($ per MTok) 5 / 25 5 / 25 2,50 / 12,50
Thinking mereu pornit mereu pornit pornit implicit, se poate opri până la high
Niveluri de efort low → max low → max low → max
Fast mode nu nu da, la 10 / 50
Zero data retention nu nu da
Priority Tier nu da nu
Clasificatori de siguranță cyber, bio, reasoning extraction aceiași doar cyber

Un rând care merită citit de două ori: Opus 5 în fast mode costă exact cât Fable 5.1. Pentru aceiași bani ai fie cel mai capabil model, fie un model cu o treaptă mai jos, dar cu output de până la 2,5 ori mai rapid. Sunt două produse diferite la același preț, iar alegerea depinde de ce te doare: latența sau calitatea pe task-urile grele.

Reasoning: ce s-a schimbat de fapt

Pe ambele modele Fable, thinking-ul e mereu pornit. Nu poți trimite thinking: disabled fără să primești 400, iar vechiul budget_tokens a dispărut complet. Singurul buton pe care îl ai e output_config.effort, cu cinci trepte: low, medium, high, xhigh, max. Opus 5 e mai permisiv, acceptă oprirea thinking-ului, dar numai până la efort high, și documentația îți spune destul de direct să nu o faci, pentru că modelul începe să scrie apeluri de tool-uri în text în loc de blocuri structurate.

Partea importantă pentru bugete e că nivelurile de efort nu înseamnă aceeași cantitate de gândire de la un model la altul. Ghidul de migrare spune explicit că trebuie să refaci sweep-ul de efort la 5.1 chiar dacă l-ai făcut pe Fable 5. Și dă două repere pe care le-am reprezentat mai jos: la medium, Fable 5.1 ajunge aproximativ la rezultatele lui Fable 5 la un cost mai mic; iar la low, Fable 5.1 depășește adesea nivelul xhigh sau chiar max al modelelor din generația anterioară.

Aceleași nume de efort, altă cantitate de gândire efort → mai mult thinking, mai mulți tokeni de ieșire Fable 5 low medium high xhigh max Fable 5.1 low medium high xhigh max Opus 5 low medium high xhigh max medium pe 5.1 ≈ high pe Fable 5, la cost mai mic low pe 5.1 ≈ xhigh sau max pe generația anterioară Repere orientative din ghidul oficial de migrare. Nu sunt scoruri de benchmark; refă sweep-ul de efort pe propriile evaluări.

Consecința practică: dacă rulezi Fable 5 la high (setarea implicită), primul experiment la 5.1 e să cobori la medium și să vezi dacă evaluările tale mai trec. Dacă trec, ai obținut aceeași calitate cu mai puțini tokeni de ieșire, care sunt partea scumpă. Câștigul real de capabilitate față de Fable 5 apare, spune documentația, mai ales la high și peste, deci nivelul de sus rămâne pentru task-urile la care ai măsurat că merită.

Ceva ce nu s-a schimbat și e bine de știut: tokenizer-ul e același pe Fable 5, Fable 5.1 și pe familia Opus de la 4.7 încoace, deci numărul de tokeni pentru același prompt e comparabil. Diferența de cost între modele vine din preț și din cât gândesc, nu din felul în care taie textul.

Unde e 5.1 mai bun decât 5

Anthropic listează șase zone, cu mențiunea că diferența e cea mai mare la nivelurile de efort ridicate:

  1. Coding agentic pe sesiuni lungi: funcționalități pe mai multe fișiere, refactorizări și migrări mari, debugging și code review în sesiuni de ore.
  2. Documente, foi de calcul și prezentări construite de la zero, cu formule vii, nu doar text.
  3. Research multistep, adică căutare web în care urmărește ce a găsit, nu doar un singur query.
  4. Vision pe grafice dense, tabele în PDF-uri și imagini degradate. Cea mai bună formă e cu tool-uri de crop și zoom la dispoziție, nu cu mai mult thinking.
  5. Retrieval în context lung, adânc în fereastra de 1M.
  6. Computer use: operarea unui browser sau a aplicațiilor desktop, cu revenire din pași eșuați.

Performanța multilingvă e la paritate cu Fable 5. Nu am de la Anthropic cifre de benchmark pentru comparația 5.1 versus 5, așa că nu le inventez. Ce am sunt cele trei schimbări de comportament observate în harness-uri, fără nicio modificare de cod: 5.1 grupează mai puțin apelurile de tool-uri implicite, narează mai puțin între apeluri și, la efort low, răspunde mai des din memorie decât să verifice. Toate trei se corectează dintr-un prompt, iar documentația oferă textul exact.

Costul real: cache-ul la un sfert

Aici e povestea de bani, și e ascunsă într-un singur rând din tabelul de prețuri. Citirea din cache pe Fable 5.1 costă 0,25 dolari pe milion, față de 1,00 pe Fable 5 și 0,50 pe Opus 5. Pare un detaliu, până te uiți la ce face de fapt o sesiune agentică: recitește același prefix la fiecare tură. Un system prompt cu tool-uri, apoi tot istoricul conversației, de patruzeci de ori într-o singură sesiune. Într-un asemenea scenariu, citirile din cache sunt de departe cel mai mare volum de tokeni, chiar dacă nu cel mai mare cost.

Am calculat un scenariu tipic ca să vezi proporțiile. Un agent cu un prefix de 20.000 de tokeni (system prompt plus definițiile tool-urilor), 40 de ture, la fiecare tură cam 3.500 de tokeni noi de intrare din rezultatele tool-urilor și 3.000 de tokeni de ieșire, inclusiv thinking. Totul cu cache activ, cu breakpoint mutat la fiecare tură.

Anatomia costului unei sesiuni agentice de 40 de ture $0 $4 $8 $12 ≈ $8,90 Fable 5.1 $0,88 ≈ $11,50 Fable 5 $3,53 ≈ $5,80 Opus 5 $1,77 ieșire, inclusiv thinking (120K tokeni) citire din cache (3,53M tokeni) scriere în cache (160K tokeni)

Două lucruri ies din diagramă. Primul: la același număr de tokeni, Fable 5.1 e cu aproximativ un sfert mai ieftin decât Fable 5 pe o sesiune agentică, exclusiv din prețul citirii din cache. Dacă adaugi și că la medium faci aceeași treabă cu mai puțin thinking, economia reală e mai mare. Al doilea: Opus 5 rămâne cel mai ieftin cu o marjă clară, cam 35% sub 5.1 în scenariul ăsta, iar diferența vine aproape integral din tokenii de ieșire, care costă jumătate.

Există și o parte mai puțin plăcută a cache-ului ieftin. Când o citire costă 0,25 și o scriere 12,50, un cache miss e de 50 de ori mai scump decât un hit. Pe Fable 5 raportul era de 12,5. Cu alte cuvinte, pe 5.1 contează mult mai mult să ții cache-ul cald: o schimbare de system prompt între cereri, un timestamp în prompt sau o pauză peste cele cinci minute de TTL te costă mai mult relativ decât înainte. Documentația recomandă pentru pauze între 5 și 60 de minute un re-send cu max_tokens: 0, care e de obicei mai ieftin decât TTL-ul de o oră.

Trei schimbări care rup codul la migrare

Prețul e același, dar API-ul nu e un drop-in. Trei lucruri care mergeau pe Fable 5 întorc 400 pe 5.1.

Forțarea unui tool nu mai există. tool_choice cu any sau cu un nume de tool e respins. Dacă foloseai forțarea ca să obții JSON garantat, înlocuiește-o cu structured outputs. Dacă o foloseai ca să te asiguri că modelul apelează tool-ul, folosești auto plus o instrucțiune explicită și strict: true pe schema tool-ului.

Blocurile de thinking sunt legate de modelul care le-a produs. Dacă trimiți istoricul unei conversații de pe Fable 5.1 către Opus 5 (de exemplu ca fallback la un refuz), Opus 5 ignoră blocurile de thinking, fără să le factureze. În sens invers, Fable 5.1 le citește pe ale modelelor mai vechi. Practic nu mai poți muta o sesiune liber între modele fără să pierzi contextul de raționament.

Istoricul e append-only. Asta e cea care doare cel mai mult și se numește în documentație „preserved thinking". Dacă editezi o tură anterioară a conversației (ștergi un mesaj, rescrii system prompt-ul, tai istoricul), toate blocurile de thinking de după punctul editat devin invalide. Conturile create de la 31 august 2026 primesc direct 400 pe istoric editat, iar modelele următoare vor aplica regula pentru toată lumea. Multe harness-uri scrise pentru Opus 4.8 sau mai vechi trunchiază ture vechi sau injectează și apoi șterg mesaje de reminder. Toate trebuie rescrise.

Preserved thinking: de ce harness-ul trebuie să fie append-only A. HARNESS CARE EDITEAZĂ ISTORICUL user assistantthinking + tool_use tool_resulteditat / șters assistantthinking invalidat tool_result assistantinvalidat Rezultat: cache resetat de la punctul editat, thinking pierdut, 400 pe conturile noi. B. HARNESS APPEND-ONLY user assistantthinking + tool_use tool_result systemclear_at: next_user assistantthinking valid systemeffort: low Rezultat: prefixul nu se schimbă, cache-ul rămâne cald, mesajele expirate nu costă tokeni de intrare. Regula simplă: nimic din ce ai trimis o dată nu se mai modifică; tot ce vrei să schimbi adaugi la coadă.

Cinci noutăți de API, toate în serviciul cache-ului

Nu e o coincidență că patru din cele cinci adăugiri de la 5.1 rezolvă exact problema de mai sus: cum schimbi ceva în mijlocul unei conversații fără să editezi istoricul.

  • Efort per mesaj. Un mesaj de sistem gol cu output_config.effort schimbă nivelul de efort de la punctul ăla încolo, fără reset de cache. Ridici la xhigh pentru pasul greu, cobori la low pentru pașii de rutină, în aceeași conversație. Merge și pe Opus 5, nu și pe Fable 5.
  • Mesaje de sistem cu termen de expirare. clear_at: "next_user_message" face ca un reminder să fie vizibil o singură tură, apoi să rămână în istoric, dar să nu se mai randeze și să nu mai coste. Așa injectezi „verifică inbox-ul înainte să rulezi cod" fără să ștergi nimic după.
  • Progress updates între tool calls. Cu display: "updates", modelul întoarce notele scurte de progres pe care le scrie între apeluri, în timp ce raționamentul propriu-zis rămâne ascuns. Fără asta, o tură agentică de 10 minute arată ca o pauză de 10 minute în UI.
  • Citirea din cache la 0,25. Discutată mai sus.
  • Proveniență a conținutului. Tot textul generat de 5.1 poartă un watermark statistic, fără caractere ascunse și fără tokeni în plus. Imaginile și fișierele media produse în sandbox-ul de code execution primesc Content Credentials C2PA semnate. E prima dată când un model Anthropic vine cu asta implicit și nu se poate dezactiva.

Mai e un detaliu de context: Claude Mythos 5.1 e același model ca Fable 5.1, cu aceleași prețuri și API, oferit doar participanților din Project Glasswing. Am scris în aprilie despre ce e Mythos și cât e marketing; diferența față de atunci e că Mythos 5.1 rulează acum propriile clasificatori de siguranță, în funcție de programul de acces al organizației.

Retenția datelor: punctul de decizie pentru enterprise

Un rând din tabel schimbă discuția pentru o categorie întreagă de clienți. Fable 5 și 5.1 sunt „Covered Models": Anthropic cere ca organizația sau workspace-ul care le apelează să aibă retenția de date de 30 de zile activă. Dacă ai zero data retention în contract, cererea primește 400 cu un mesaj explicit, iar singura cale ocolitoare e o autorizare expresă negociată cu echipa de cont.

Pentru majoritatea firmelor nu se schimbă nimic, pentru că retenția de 30 de zile e setarea implicită. Pentru bănci, sănătate, avocatură sau sectorul public, unde ZDR e adesea o condiție din evaluarea de impact GDPR, alegerea între Opus 5 și Fable 5.1 nu mai e una de cost și capabilitate. Devine o discuție cu DPO-ul: Opus 5 merge sub ZDR fără nicio schimbare, Fable 5.1 înseamnă fie un workspace separat cu retenție, fie o autorizare, fie renunțarea la model.

Când alegi ce

Poziționarea oficială e clară și merită luată în serios pentru că nu e cea la care te-ai aștepta de la un vendor: începe cu Opus 5, treci la Fable 5.1 doar pentru reasoning intens și task-uri agentice pe termen lung, sau când evaluările pe Opus 5 la efort ridicat nu ating pragul.

Opus 5, Fable 5 sau Fable 5.1: arborele de decizie Ai zero data retention în contract? da nu Evaluările pe Opus 5 la high / xhigh ating ținta ta de calitate? da Opus 5 jumătate de preț, ZDR, fast mode nu Depinzi de Priority Tier? da Fable 5 rămâne servit, cache la 1,00 nu Fable 5.1 începe la high, coboară unde evaluările țin

Cu Fable 5 rămâne un singur motiv să stai: Priority Tier, care nu există pe 5.1. În rest, 5.1 face aceeași treabă la aceiași bani per token, cu cache-ul de patru ori mai ieftin. Pentru cine vine de pe Opus 5, saltul e dublarea prețului per token, la care se adaugă pierderea ZDR și un set mai larg de clasificatori. Merită doar dacă ai măsurat că Opus 5 la xhigh nu ajunge unde ai nevoie, sau dacă ai un caz de folosință din cele șase zone de mai sus în care diferența e vizibilă.

Ce am observat noi în practică, pe munca de zi cu zi cu Claude Code, e că cel mai mare câștig nu vine din alegerea modelului, ci din alegerea efortului. Un Fable 5.1 la medium pe task-uri de rutină și la xhigh pe cele grele, în aceeași sesiune, bate atât un Fable 5 rulat uniform la high, cât și un Opus 5 care are nevoie de două încercări pe task-urile grele. Iar efortul per mesaj e exact ce face setup-ul ăsta posibil fără să plătești resetul de cache.

Dacă rulezi deja agenți pe Fable 5 sau Opus și vrei să știi cât te-ar costa migrarea, inclusiv rescrierea harness-ului pentru append-only, hai să vorbim.