
Wpis użytkownika tokensave w Technologia
tokensaveDebiutant
8piorunówZmierzyłem, ile tokenów „zjada” polski w modelach AI. Ten sam prompt o identycznym znaczeniu:
krótki (2 zdania): 34 tokeny po angielsku vs 64 po polsku (+88%*)
długi (~100 słów): 110 vs 166 (+51%*)
U Mistrala bardzo podobnie (+71% / +50%), więc „europejski” model nie pomaga. Winne są końcówki fleksyjne: „potwierdzenie” to dla tokenizera pot|wier|d|zenie, „zaproponuj” to zap|ro|pon|uj, a angielskie „invoice” czy „polite” to jeden token.
W praktyce w API płacimy za ten sam tekst nawet prawie 2× więcej, a w ChatGPT Plus / Claude Pro limit kończy się szybciej.
Trik: piszcie dłuższe instrukcje po angielsku i dodajcie na końcu „Reply in Polish”. Odpowiedź dalej przychodzi po polsku, a wejście jest krótsze o 31–41%.
Szczegóły i wykres: tokensave.app/pl/blog/ile-kosztuje-prompt-po-polsku
Komentarze (4)
Czyli muszę odpali ejaj Google translatora, by ejaj odpowiedziało szybciej i taniej? :smiley:
@tokensave chodzi o tzw. Rozumienie względne.
Wziąć darmowy model i napisać instrukcję po polsku, żeby przetłumaczyć na angielski i wynik wkleić do właściwego - taką mam koncepcję xD
@tokensave no niby tak, ale skoro i tak napisałem długi prompt po angielsku to po co mi odpowiedź po polsku?