חברת OpenAI תסמן חלק מהטקסטים שיופקו באירופה

קיבלתם טקסט שנראה כאילו נכתב בידי אדם, ואתם רוצים לדעת אם נוצר בעזרת AI. זו דוגמה לשאלה שעשויה לעלות בבית הספר, בעבודה או מול ספק תוכן. בקרוב עשוי להיות בחלק מהטקסטים האלה סימן בלתי נראה שמחשב יודע לחפש. אבל גם אם הגלאי ימצא אותו, התשובה תהיה מצומצמת בהרבה מהשאלה ששאלתם.
ב-5 באוקטובר הודיעה OpenAI על תוכנית לסמן טקסט שנוצר בחלק ממוצריה. לקוחות ממשק התכנות שלה, API, יכולים כבר עכשיו לבחור בסימון עבור מודלים מסוימים; ברירת המחדל שם היא ללא סימון. בשבועות הקרובים החברה מתכננת להוסיף את הסימון לפלט טקסט מתאים של ChatGPT ו-Codex באיחוד האירופי. הגלאי עצמו אינו פתוח לציבור בשלב זה: הגישה הראשונית מיועדת לחוקרים ולארגונים מקצועיים שיאושרו.
המהלך קשור לכללי השקיפות של חוק הבינה המלאכותית באיחוד האירופי. סעיף 50 מחייב ספקי מערכות שמייצרות תוכן, ובהן טקסט, לדאוג לסימון שניתן לקריאה במכונה ולזיהוי של תוכן שנוצר או שונה באמצעות AI, בכפוף להיקף ולחריגים שבחוק. הכללים האלה חלים מאוגוסט 2026, אך לפי הנציבות האירופית קיימת תקופת מעבר מוגבלת עד דצמבר למערכות מסוימות שכבר היו בשוק. ההודעה של OpenAI היא הצעד שהחברה בחרה להציג כעת במסגרת הזאת.
מה בעצם מסומן?
סימן המים של OpenAI, שנקרא textGrain, אינו תווית שמופיעה ליד הפסקה. לפי החברה, הוא משנה באופן סטטיסטי את בחירת המילים בזמן יצירת הטקסט. גלאי מתאים מחפש אחר כך את הדפוס הזה. במילים פשוטות, הוא מחפש עקבה של דרך הכתיבה של מערכת מסוימת, ולא תעודת זהות של מחבר.
יש לכך יתרון מעשי: העקבה יכולה להישאר גם כשהטקסט מועתק למקום אחר, ללא קובץ מקורי או מידע נלווה. אבל היא אינה עמידה בפני כל שינוי. בבדיקות שפרסמה OpenAI על קטעים באנגלית באורך 400 טוקנים, יחידות טקסט שהמודל מעבד, החלפה של 10% מהמילים במילים נרדפות הורידה את שיעור הזיהוי מכ-92% לכ-66%; החלפה של 25% מהמילים הורידה אותו לכ-17%. אלה תוצאות בתנאי בדיקה מסוימים של החברה, ולא הבטחה לגבי כל שפה, סוג טקסט או עריכה.
ההבחנה בין סוגי תוכן חשובה כאן. בתמונה או בקובץ שמע אפשר לשמור מידע על המקור בקובץ עצמו, לצד סימנים שמוטמעים בתוכן. טקסט עובר לעיתים קרובות דרך העתקה, ניסוח מחדש ותרגום, וכל אחת מהפעולות האלה יכולה לשנות את העקבה. OpenAI כבר הרחיבה ביולי את כלי אימות המקור שלה לאודיו נתמך, אבל בטקסט היא בוחרת בינתיים לפתוח את הגלאי בהדרגה לקבוצה מוגבלת. זהו סימן לכך שגם החברה רואה צורך ללמוד כיצד תוצאות הבדיקה יתפרשו מחוץ למעבדה.
גם אורך הטקסט משנה. בבדיקה אחרת, כשהיעד היה שיעור זיהוי שגוי של 1%, הגלאי זיהה את הסימון בכ-80% מקטעים בני 200 טוקנים בתחום מסוים, לעומת כ-95% בקטעים בני 400 טוקנים. החברה מדגישה שטקסט קצר או מוגבל בניסוח, למשל תשובה מתמטית, קשה יותר לזיהוי. לכן תוצאה שלילית אינה יכולה להוכיח שאדם כתב את הטקסט.
זיהוי מקור אינו פסק דין על הטקסט
מורה מקבל עבודה של תלמיד, עורך בוחן ידיעה או לקוח בודק תוכן שקיבל מספק. בכל אחד מהמקרים, גלאי שמצא סימן מים עשוי להעיד שמערכת של OpenAI יצרה או עיבדה חלק מהטקסט. הוא לא יודע כמה מחשבה, עריכה או בדיקה אנושית נוספו אחר כך. הוא גם לא יודע אם העובדות נכונות, אם השימוש היה מותר, או מי נושא באחריות לפרסום.
גם היעדר סימן אינו מספק תשובה הפוכה. ייתכן שהטקסט נערך או תורגם, נוצר במודל שאינו נתמך, או נכתב לפני שהסימון הופעל. ייתכן גם שנוצר בכלי של חברה אחרת. OpenAI אומרת במפורש שאלה מגבלות של השיטה. משום כך החלטות על אמינות, יושרה או בעלות אינן יכולות להישען על תוצאת הגלאי לבדה.
מקורות
תגובות
טוען תגובות…