טוקן (token)
טוקן: למה מסמך קצר יכול להיות ארוך מדי בשביל AI?
העליתם מסמך לכלי AI והוא הודיע שהקובץ ארוך מדי. הסתכלתם על מספר העמודים והוא דווקא נראה סביר. כדי להבין את הפער, צריך להכיר את יחידת המדידה שבה מודלים עובדים: טוקן.
מהו טוקן?
טוקן, Token באנגלית, הוא יחידת קלט או פלט שבה מודל מעבד תוכן. בטקסט, טוקן יכול לייצג מילה שלמה, חלק ממילה, סימן פיסוק או רצף אחר של תווים. לכן אין כלל קבוע שלפיו טוקן אחד שווה מילה אחת. OpenAI מסבירה שגם אותו טקסט יכול להתחלק אחרת בהתאם למודל, לשיטת הקידוד ולשפה.
למה סופרים טוקנים?
ראשית, למודל יש מגבלה על כמות המידע שהוא יכול לעבד בבקשה אחת, חלון הקשר. הבקשה שלכם, ההודעות הקודמות, קטעי מסמכים והוראות נוספות עשויים כולם לתפוס מקום. גם ליצירת התשובה יש גבול. מסמך קצר במספר עמודים אבל עשיר בטבלאות, סימנים או טקסט חוזר יכול לדרוש יותר יחידות עיבוד מכפי שנדמה במבט ראשון.
שנית, בשירותי API רבים השימוש נמדד לפי טוקנים שנכנסו ויצאו. לעיתים יש הבחנה גם בין קלט רגיל, קלט שנשמר במטמון וטוקנים שנדרשו לעיבוד פנימי. זהו פרט חשוב למי שמפתח או משלם לפי שימוש, אך גם משתמש רגיל מרוויח מההבנה שאורך הבקשה והתשובה משפיע על מגבלות המערכת. ההסבר הרשמי של OpenAI מפריד בין סוגי הטוקנים ומדגיש שספירת מילים אינה ספירת טוקנים.
דוגמה מחיי היום-יום
אתם מבקשים לסכם עשר תכתובות ארוכות על אירוע קהילתי. בכל תכתובת יש חתימות חוזרות, ציטוט של הודעות קודמות וטבלאות שעות. כל החומר הזה מצטרף לקלט, גם אם חלקו אינו נחוץ לסיכום. אם המערכת מתקרבת למגבלת ההקשר, ייתכן שתצטרכו להסיר כפילויות, לסכם כל תכתובת בנפרד או לעבוד בשלבים. לא כדאי להניח שמספר העמודים לבדו מנבא אם הכול ייכנס.
איך משתמשים בידע הזה?
כשהכלי מתקשה עם חומר ארוך, התחילו בשאלה איזה מידע באמת דרוש לתוצאה. הסירו חזרות ונספחים שאינם רלוונטיים, חלקו את המשימה לחלקים ובדקו כל סיכום לפני שמאחדים אותם. אם אתם עובדים בממשק למפתחים, השתמשו בכלי הספירה הרשמי של המודל הרלוונטי במקום בכלל אצבע שנכתב לשפה או למודל אחרים.
הטעות הנפוצה היא לחשוב שטוקנים הם רק דרך לגבות תשלום. הם גם דרך להבין מה נכנס לבקשה, כמה מקום נשאר לתשובה ומתי נדרש תכנון טוב יותר של החומר. מה שכדאי לזכור: מודדים את העבודה של המודל ביחידות עיבוד, ולא במספר המילים שנראה לנו על המסך.
תגובות
טוען תגובות…