Modaliteter (hva kan modellen forstå)
Hva er modaliteter?
En modalitet er en type data modellen kan ta imot og forstå. Vanligvis er dette tekst, bilder, lyd eller video. Tekst er hovedmodaliteten til språkmodellene. Det meste du jobber med som utvikler er allerede tekst: kode, feilmeldinger, logger, diff-er og konfigurasjon. Det er modellens hjemmebane, og det er derfor den er så god på nettopp utviklingsarbeid.
Modellen vet ikke mer enn det du viser den. Den ser ikke skjermen din, nettleseren din eller applikasjonen som kjører. Hvis du beskriver et visuelt problem med ord, ser modellen bare beskrivelsen din, ikke problemet.
Hvilke modaliteter er aktuelle?
For deg som utvikler er tekst og bilder de to viktigste. Moderne modeller tar imot bilder, og noen tar også imot lyd. Med bilder kan du gi modellen et skjermbilde av en visuell feil, det gjør det mye lettere for modellen å forstå problemet. Ofte er det både raskere og mer presist å vise enn å forklare.
Husk at modellen ikke ser verden på samme måte som deg. Den kan være god på å gjenkjenne tekst, men dårlig på å se sammenhenger eller forstå figurer. Det beste er ofte å bruke en kombinasjon av modaliteter for å få frem det du ønsker.

Gjør det lett for modellen å se hva den gjør
Jobber du med visuelle endringer, for eksempel frontend, bør bilder være en del av arbeidsflyten din. Be modellen gjøre en endring, få den til å ta et skjermbilde og vurdere resultatet. Da vurderer modellen det som faktisk vises, ikke det den tror den har laget.
Dette er slik vi styrer språkmodellene i praksis, slik du lærte på forrige side: hver modalitet du legger til gir modellen mer å jobbe med, og øker sannsynligheten for ønsket resultat.
Hva er en modalitet?
Du jobber med en frontend-endring og resultatet ser feil ut. Hva er den mest presise måten å gi modellen tilbakemelding på?
Hva bør du huske når du gir modellen et bilde?