2026-08-26 · 4 דק' קריאה

טוקניזציה של מידע: להסתיר את הזהות, לשמור על המשמעות

למה עקביות הטוקנים היא הכלל החשוב ביותר?

כי המשמעות של מסמך טמונה בקשרים שבו: מי פנה למי, מי חתם, מי חייב כסף למי. אם ג'ון מילר הופך ל-PERSON_001 בפסקה אחת ול-PERSON_007 בפסקה אחרת — הקשרים נקרעים, והמסמך הופך לחסר ערך לניתוח. עקביות ההחלפה היא מה שמבדיל בין טוקניזציה שימושית לבין ערימת טקסט מבולבלת.

  • עקביות בתוך המסמך — כל 30 המופעים של אותו שם מקבלים את אותו טוקן, כולל וריאציות כתיב ('ג'ון', 'מר מילר').
  • שמירת התפקידים — ברור ש-PERSON_001 הוא התובע ו-PERSON_002 הנתבע לכל אורך המסמך.
  • שמירת סוג הערך — הטוקן מסגיר את הסוג (אדם, חברה, חשבון) אבל לא את התוכן; כך כלי AI מבין את המבנה.
  • עקביות בין מסמכים — כשמנתחים תיק שלם, כדאי שאותו אדם יקבל את אותו טוקן בכל המסמכים.

מה ההבדל בין טוקניזציה, השחרה והצפנה?

שיטהמה קורה לערךמה נשאר מהמסמך
השחרהנמחק או מכוסהחורים שחורים — ההקשר אובד
הצפנההופך לרצף בלתי קריא, הפיך עם מפתחמסמך שלם אך בלתי קריא בלי המפתח
טוקניזציה עקביתמוחלף בטוקן קריא ויציבמסמך קריא ושמיש — בלי הזהויות

השחרה מתאימה כשרוצים שהקורא לא ידע שהיה שם משהו לקרוא; הצפנה מגינה על מסמך בתעבורה ובאחסון; טוקניזציה היא היחידה שמאפשרת לעבוד על המסמך — לקרוא, לנתח, לסכם — בלי להיחשף לזהויות.

איך עובד תהליך טוקניזציה של מסמך?

  1. זיהוי — סריקת המסמך לאיתור ערכים רגישים: שמות, מספרי זהות, טלפונים, כתובות, חשבונות, שמות חברות.
  2. נרמול — קיבוץ וריאציות של אותו ערך ('ג'ון מילר', 'מילר', 'ג'ון') לישות אחת.
  3. הקצאת טוקנים — כל ישות מקבלת טוקן יציב לפי סוגה: PERSON_001, COMPANY_002, ID_001.
  4. החלפה בכל המופעים — כולל בכותרות, בטבלאות ובהערות.
  5. שמירת מפת ההחלפה מקומית (או מחיקתה) — אם צריך לתרגם את התוצאה חזרה, המפה נשארת אצלכם בלבד.

למה טוקניזציה היא הדרך הנכונה לעבוד עם AI?

כי כלי AI מנתח היטב רק מסמך שההקשר שלו שלם. מסמך מטוקנן מאפשר לשאול 'מה הסיכונים בחוזה הזה?' או 'סכם את טענות הצדדים' ולקבל תשובה מלאה — כשהכלי כלל אינו יודע על מי מדובר. זה הבסיס לאנונימיזציה נכונה של מסמכים, וכך עורכי דין, למשל, יכולים להשתמש ב-AI בלי להפר חיסיון. את התשובה שהתקבלה אפשר לתרגם חזרה עם מפת ההחלפה — שנשארה אצלכם.

שאלות נפוצות

מה ההבדל בין טוקניזציה לפסאודונימיזציה?

טוקניזציה היא הטכניקה — החלפת ערך בטוקן. אם שומרים מפת החלפה שמאפשרת שחזור, התוצאה היא פסאודונימיזציה (ועדיין מידע אישי לפי GDPR); אם המפה לא נשמרת או נשארת רק אצלכם, מי שמקבל את המסמך מקבל מידע אנונימי.

למה לא פשוט למחוק את השמות?

כי מחיקה הורסת את ההקשר: אי אפשר לדעת מי עשה מה, והניתוח נפגע. טוקן עקבי משאיר את שרשרת האירועים שלמה בלי לחשוף זהות.

האם הטוקנים חייבים להיות בפורמט מסוים?

לא, אבל טוקן שמסגיר את סוג הערך ומספרו הסידורי — PERSON_001, ACCOUNT_002 — עוזר גם לקורא אנושי וגם לכלי AI להבין את מבנה המסמך בלי לדעת את התוכן.

האם מסמך מטוקנן מותר להזנה לכלי AI?

כשההחלפה מלאה ועקבית, מפת ההחלפה לא צורפה וגם מזהים עקיפים טופלו — המסמך אינו מכיל מידע אישי, והזנתו אינה כפופה למגבלות על עיבוד מידע אישי.

מה עושים עם מפת ההחלפה?

שומרים אותה מקומית רק אם צריך לתרגם את תוצרי ה-AI חזרה לשמות האמיתיים. היא לעולם לא עוזבת את המחשב שלכם — ברגע שהיא נוסעת עם המסמך, האנונימיות בטלה.