איזו metadata מסתתרת במסמך טיפוסי?
יותר משנדמה. קובץ Word או PDF ממוצע נושא כמה שכבות של מידע סמוי, וכל אחת מהן יכולה לחשוף פרטים רגישים בפני כל מי שמקבל את הקובץ — לקוח, צד שכנגד, או שירות ענן שהקובץ הועלה אליו.
- מאפייני מסמך — שם המחבר, שם הארגון, כותרות ומילות מפתח שהוזנו פעם ונשכחו.
- Track Changes — שינויים עוקבים שלא אושרו: כל מה שנמחק, נוסח מחדש או 'הועלם' — עדיין שם, כולל מי שינה ומתי.
- הערות (Comments) — הדיון הפנימי בין העורכים: 'הלקוח לא יסכים לזה', 'לבדוק מול משפטית'.
- גרסאות ותוכן משוחזר — חלק מהפורמטים שומרים גרסאות קודמות או שאריות של תוכן שנמחק.
- נתיבים ומערכות — נתיב הקובץ, שמות שרתים ותיקיות ('C:\Users\jmiller\לקוחות\תביעה_נגד_X').
- מידע מוטמע — טבלת Excel שהוטמעה במצגת עשויה להכיל את הגיליון המלא, לא רק את מה שמוצג.
למה metadata מסוכנת דווקא במסמכים רגישים?
כי היא חושפת בדיוק את מה שהעריכה נועדה להסתיר. מסמך משא ומתן מסגיר בהערות את גבולות הגמישות שלכם; חוות דעת חושפת ב-Track Changes את הניסוחים שהוחלפו והושמטו; וקובץ שנשלח כ'אנונימי' מסגיר בשדה המחבר את שם כותבו. ההיסטוריה של המסמך מספרת לפעמים יותר מהמסמך עצמו — למי שיודע איפה להסתכל.
זה גם הכשל המשלים של השחרה כושלת: גם כשהטקסט הגלוי הוסר כראוי, ה-metadata ממשיכה לספר את הסיפור. עבור עורכי דין ובעלי מקצוע החבים חיסיון, הערות ושינויים שדלפו הם הפרת סודיות לכל דבר.
מה קורה ל-metadata כשמזינים מסמך לכלי AI?
כשמעלים קובץ שלם לכלי AI, הכלי מקבל את הקובץ — על כל שכבותיו. גם אם המשימה היא 'סכם את המסמך', מה שנמסר כולל את ההערות, השינויים והמאפיינים. לכן אנונימיזציה אמיתית חייבת לכלול ניקוי metadata, ולא רק החלפת שמות בטקסט הגלוי.
איך מנקים metadata לפני שיתוף?
- אשרו או דחו את כל השינויים — Track Changes פתוח הוא היסטוריה חיה; סגרו אותו לפני הייצוא.
- מחקו את כל ההערות — כולל הערות שסומנו כ'פתורות'.
- נקו מאפייני מסמך — בכלי הבדיקה המובנה של התוכנה (למשל Inspect Document ב-Word) או בכלי ייעודי.
- ייצאו קובץ חדש — ייצוא נקי (למשל ל-PDF חדש) מנתק את רוב השכבות ההיסטוריות; ודאו שההגדרות לא מעתיקות את המאפיינים.
- בדקו את התוצאה — פתחו את הקובץ הסופי ובחנו את מאפייניו כאילו אתם הצד המקבל.