מודאליות (modality)
מודאליות: למה אותו כלי מקבל טקסט אבל לא תמיד קול או תמונה?
אתם רוצים לשאול שאלה על צילום של חשבונית. כלי שמקבל טקסט בלבד לא יוכל לקרוא את הצילום ישירות; תצטרכו להמיר אותו לטקסט או לבחור כלי שתומך בתמונות.
מהי מודאליות?
מודאליות, modality באנגלית, היא קטגוריה של נתונים, למשל טקסט, תמונה, קול, וידאו או מספרים. מילון המונחים של Google מגדיר את המונח כך. כלי AI יכול לתמוך במודאליות אחת או בכמה מהן, בקלט, בפלט או בשניהם.
איך זה משפיע על העבודה?
יש להבחין בין מה שהכלי מקבל לבין מה שהוא מחזיר. כלי יכול לקבל תמונה ולענות בטקסט, לקבל טקסט וליצור תמונה, או לקבל קול ולהחזיר תמלול. תמיכה בתמונה אינה אומרת בהכרח שהוא גם יוצר תמונות; תמיכה בשמע אינה אומרת שהוא יכול לדבר בקול.
אתם מעלים צילום של תפריט ושואלים: "איזו מנה אינה מכילה אגוזים?". אם הכלי יודע לנתח תמונות, הוא עשוי לקרוא את הכתוב. אבל צילום מטושטש או מידע חסר על רכיבים עלולים להוביל לתשובה לא בטוחה. במקרה כזה צריך לבדוק מול המסעדה.
איך בוחרים כלי מתאים?
שאלו שלוש שאלות: איזה מידע יש לי, מה אני רוצה לקבל, ועד כמה חשוב לבדוק את התוצאה? לאחר מכן בדקו אם הכלי תומך בסוגי הקלט והפלט הדרושים. בעבודה עם מידע אישי בתמונה או בהקלטה, בדקו גם את הגדרות הפרטיות לפני העלאה.
"מודל רב-אופני" הוא מודל שעובד עם יותר ממודאליות אחת. המודאליות עצמה היא פשוט סוג המידע שאיתו עובדים.
תגובות
טוען תגובות…