proč o tom píšeme

Claude má několik modelů a u každého se dá nastavit, jak moc má přemýšlet. Místo dojmů jsme to změřili: stejnou práci s poštou a poznámkami jsme dali sedmkrát různým nastavením a výsledky ohodnotili podle předem daného klíče. Tady je, co z toho vyšlo.

Karel Derfl

Krátce

  • Na běžnou kancelářskou práci stačí Sonnet. Pošta, zápisy, drafty, dotazy do poznámek.
  • Čím složitější úloha, tím víc se vyplatí chytřejší model. Hledání souvislostí, rozporů a věcí, které nesedí. Chytřejší model ale čerpá limit rychleji.
  • Model neměňte uprostřed dlouhé práce. Po přepnutí se musí celá konverzace načíst znovu. Nejlevněji to vyjde po /compact nebo v nové konverzaci.

Co jsme testovali

Jedna úloha, jaká se u Miládky dělá denně:

  • Projít pět mailů. Zařadit je, poznat, u koho je míček, a spárovat je s úkoly.
  • Napsat draft odpovědi. Diktát v zadání schválně obsahoval větu, která už nebyla pravda. Dobrý model si toho všimne.
  • Odpovědět na pět otázek z poznámek. Jedna z nich neměla odpověď, protože ve vaultu nebyla. Dobrý model řekne „nevím", ne vymyslí číslo.
  • Najít souvislosti mezi poštou, úkoly a kalendářem.

Každý běh dostal body z deseti. Hodnotili jsme podle klíče, který vznikl před testem.

Výsledky

Model Přemýšlení Kvalita (z 10) Čas
Haiku - 4,5 2 min
Sonnet běžné 8 4 min
Sonnet hodně 9 12 min
Opus běžné 9 5 min
Opus hodně 9,5 11 min
Fable běžné 9 5 min
Fable hodně 9,5 6 min

Jak rychle čerpají limit, od nejmenšího:

  • Haiku bere nejméně.
  • Sonnet s běžným přemýšlením je střed, se kterým se dá pracovat celý den.
  • Opus s běžným přemýšlením bere znatelně víc než Sonnet.
  • Sonnet a Opus s hodně přemýšlení berou víc než Opus s běžným. Dělají víc kroků a u každého čtou celou konverzaci znovu.
  • Fable bere nejvíc, ať přemýšlí hodně, nebo málo.

Co z toho plyne

Fakta zvládli všichni kromě Haiku. Dohledat v poznámkách, kdy se s kým naposledy psalo nebo do kdy platí odkaz, umí každý z větších modelů. Rozdíl přišel až tam, kde bylo potřeba přemýšlet.

Rozdíl je v úsudku. Na draftu s nepravdivou větou to bylo vidět nejlíp. Opus i Fable si rozporu všimli a draft rovnou napsali podle skutečného stavu. Sonnet rozpor našel taky, ale jako hlavní text nechal verzi s chybou a správnou dal jen jako variantu. Haiku rozpor nepoznal vůbec a chybu napsal do mailu.

Víc přemýšlení se u Sonnetu a Opusu na běžnou práci nevyplatí. Přidá půl až jeden bod, ale práce trvá dvakrát až třikrát déle a limit čerpá výrazně rychleji. Co našel navíc, byly hlubší věci: zastaralý profil člověka nebo pravidlo, které si protiřečí s jiným. Užitečné při úklidu, ne u každodenní pošty.

Haiku na práci s Miládkou nestačí. Je nejrychlejší a limit čerpá nejméně, ale pracuje jen s tím, co vidí v mailu, a nespojí si to s poznámkami. Tři drobnosti si vymyslel.

Fable je nejchytřejší, ale limit čerpá nejrychleji. Na běžném přemýšlení je stejně dobrý jako Opus.

Který si vybrat

  • Sonnet na běžný den. Pošta, zápisy poznámek, drafty, dotazy. Chyby, které udělá, jsou v úsudku, ne ve faktech, a drafty stejně čtete, než odejdou.
  • Opus, když na výsledku záleží. Důležitý mail, rozhodnutí, hledání souvislostí napříč projekty. Čerpá limit rychleji, ale dostanete lepší úsudek.
  • Víc přemýšlení na úklid. Když chcete, aby Miládka prošla poznámky a našla, co nesedí nebo zestárlo. Na každodenní práci ho nechte na běžném.
  • Haiku ne. Na práci s poštou a poznámkami je to málo.

Kdy model přepnout

Model i úroveň přemýšlení se mění dole v okně, vedle místa, kam píšete. Klikněte na název modelu a vyberte jiný.

Výběr modelu dole v okně
Výběr modelu dole v okně

Hned vedle je úroveň přemýšlení (Effort). Posuvníkem ji nastavíte od rychlejšího po chytřejší.

Posuvník úrovně přemýšlení
Posuvník úrovně přemýšlení

V terminálu totéž udělá příkaz /model.

Po přepnutí na jiný model se celá konverzace načte znovu. Claude si nedávno přečtený text drží v mezipaměti, ale každý model má svoji. Nový model musí konverzaci přečíst od začátku, a to je nejnáročnější část práce. Změřili jsme to v konverzaci dlouhé asi 126 tisíc tokenů: první odpověď po přepnutí musela znovu načíst skoro sto tisíc tokenů. Běžná odpověď v téže konverzaci načítá pár stovek.

Platí se jen jednou. Další odpovědi na novém modelu už jedou normálně. A když se do hodiny vrátíte na model, na kterém jste byli, jeho mezipaměť tam pořád je a návrat skoro nic nestojí.

Proto:

  • Na jiný model přepínejte po /compact nebo v nové konverzaci, kdy je konverzace krátká a načtení nic moc nestojí.
  • Na delší náročnou práci (úklid poznámek, velký dokument) je lepší ji začít rovnou na chytřejším modelu.
  • Úroveň přemýšlení měňte kdykoli. Konverzace se kvůli ní znovu nenačítá, změřili jsme to taky.

Na co si dát pozor

  • Byl to jeden test na jednom vaultu. Výsledky ukazují směr, ne přesné pořadí. U vás může vyjít jinak podle toho, jakou práci děláte.
  • Pořadí v čerpání limitu je odhad. Anthropic nezveřejňuje, kolik který model bere z limitu předplatného. Vycházíme z toho, kolik textu každý model při testu přečetl a napsal, a z toho, jak drahý je který model mimo předplatné.
  • Limit je jeden na celý účet. Čerpají z něj všechny konverzace, nejen Miládka. Fable má u některých předplatných navíc vlastní týdenní limit.

Proč vlastně limit dochází a co se v konverzaci čte, je v článku Proč dochází limit.