Il modello non legge lettere e nemmeno parole intere: le spezza in token, pezzi ricorrenti di testo. Scrivi qui sotto e guarda come vengono divise le tue parole.
Se vede pezzi e non lettere, tre cose concrete vanno storte.
Un codice prodotto, una P.IVA, un IBAN. Il modello li vede a pezzi: in una riformulazione può cambiarti una cifra senza accorgersene.
"Scrivimi un testo di max 280 caratteri." Il modello non li conta: va a occhio e sfora. La verifica resta a te.
I token sono l'unità con cui il modello paga e ricorda. Oltre la sua capacità, dimentica l'inizio del documento.
Tokenizzatore reale: o200k_base (GPT-4o). Tutto gira nel tuo browser, nessun testo viene inviato. Finestra di contesto e costo sono valori indicativi (~128.000 token di memoria, ~€1 per milione di token in ingresso).