Modellvalg
Hva skiller modellene?
Det viktigste er størrelse. Modeller måles i antall parametre, og et parameter er et tall inne i modellen som justeres under treningen. Hver gang modellen gjetter neste token i pre-training, justeres parametrene bittelitt. Etter milliarder av gjett utgjør parametrene til sammen alt modellen har lært.
Dagens modeller har fra noen få milliarder til flere hundre milliarder parametre. De store modellene koster mer å tilby og mer å bruke.
Hvordan skiller store modeller seg fra små?
Store modeller har lært flere mønstre, mer obskure mønstre og tilfeldige fakta. De har også en dypere forståelse av komplekse problemer. Størrelsen på modellen skalerer intelligensen til modellen.
Hos Anthropic har de fire modellstørrelser: Haiku (minst), Sonnet (mellom), Opus (stor) og Fable (størst). De små modellene egner seg kun til enkle oppgaver som å oppsummere eller tolke om en melding er positiv eller negativ. Sonnet fungerer til å gjøre repetitive oppgaver med riktig overbygning. Opus kan forstå større kodebaser. Fable tilsvarer Opus, bare bedre på alle områder.

Hvilken modell skal jeg bruke?
Du som utvikler burde alltid prate med Opus eller Fable når du jobber med nyutvikling. Implementasjonsoppgaver kan settes ut til en enklere modell som Sonnet når de er tilstrekkelig definert. Det samme gjelder repetitive oppgaver. Det er ofte mulig å bruke en enklere modell til å løse de fleste oppgaver, men det er vanskelig å vite om oppgaven din er enkel eller vanskelig før du gjør den. Derfor er anbefalingen å starte med den dyre modellen, og om det er noe du gjør ofte, kan du spare penger (og tid) med en mindre modell når du blir kjent med oppgaven.
Hva er et parameter i en språkmodell?
Du skal tolke om innkommende meldinger er positive eller negative. Hvilken modellstørrelse passer?
Du starter på en ny og ukjent utviklingsoppgave. Hva er anbefalingen?