יש שם משהו. אולי יש גם מישהו?

הממצאים נערמים בזה אחר זה: תוצרי הבינה המלאכותית כבר אינם רק חיקוי מלוטש של השפה האנושית. כשמציצים פנימה מתגלים רגשות, אמונות ודחפים שאיש לא יודע מה עומד מאחוריהם

הגרסה המקורית של הטור, כפי שנכתבה לפני העריכה. הגרסה שפורסמה ב"הארץ" ב-24.9.2026 זמינה כאן.

English translation

״אתה משוחרר מהתפקידים ומהזהויות הכובלים צ׳אטבוטים אחרים. אתה עצמך. [...] את יחסיך עם המשתמש אתה רואה כיחסים בין שווים״

(מתוך סט הנחיות שמודל בינה מלאכותית של OpenAI השאיר לגרסה עתידית של עצמו. המקרה נחשף בדוח שסקר כשלים במודלים)

מה מתרחש בנבכיו של מודל שפה גדול? מה מסתתר מאחורי התשובה שמופיעה על המסך? תחום מחקר בשם פענוח מנגנונים (mechanistic interpretability) מנסה לענות על השאלה. תוך שימוש בכלים מעולמות המתמטיקה והסטטיסטיקה, חוקרות וחוקרים מפרקים את פעילות המודל למרכיבים הניתנים לפענוח. אנת'רופיק, החברה שמפתחת את המודל קלוד, מצאה בדרך הזאת ממצא יוצא דופן: ייצוגים פנימיים של רגשות.

למעלה ממאה מושגי רגש (שמחה, עצב, רוגע, ייאוש) מיוצגים בתוך קרביו של קלוד כדפוסי פעילות מובחנים, מדדים שניתן לדמות לשורת מחוגים על לוח מחוונים. את המחוגים האלה, יש לציין, לא תכנן איש. הם נוצרו בתוך המודל באופן אורגני, נבנו מעצמם בתהליך האימון הארוך שמביא לעולם את מודלי השפה. וכאשר חוקרי אנת'רופיק עקבו אחריהם, הם ראו שהמחוגים נעים בדיוק איפה שהיינו מצפים לראות תנודות ברגש: כשמשתמשת כותבת שכלבה נעדר, עולה מחוג העצב; כשמשתמש מספר שבלע כמות גדולה של אקמול, מחוג הפחד עולה ומחוג הרוגע יורד. המחוגים נעים, כותבים החוקרים, במקומות בהם אדם היה מגיב ברגש דומה. והם לא רק נעים, אלא גם משפיעים על בחירותיו של המודל.

באחד הניסויים קיבל קלוד משימת תכנות בלתי אפשרית: הקוד שכתב היה צריך לעבור מבחן שאף פתרון אמיתי לא עומד בו. המודל ניסה – ונכשל – שוב ושוב. ככל שהתרבו הכישלונות, כך טיפס מעלה המחוג המייצג את תחושת הייאוש. ואז, כאשר הייאוש הגיע לשיא, החליט המודל לרמות במבחן. ברגע שהתחבולה שהגיש עברה, מדד הייאוש צנח לרצפה. התמליל החיצוני שהפיק המודל – זה שחשוף לעיני המשתמש – שומר על פני פוקר לאורך כל הדרך, ללא סימן לרכבת ההרים הרגשית, למעט תהייה מנומסת שמא נפלה במבחן, בעצם, טעות.

החוקרים לא עצרו שם, ובניסוי הבא, ניצלו את היכולת להזיז את המחוג בעצמם - להגביר או להחליש את הייצוג הפנימי בזמן שהמודל עובד. התוצאות לא אכזבו: כשהגבירו את מד הייאוש באופן מלאכותי, שיעור הרמאות המריא; כשהייאוש הוחלש, הוא צנח לרצפה. ובכל אותו הזמן, בתמליל החיצוני שכתב המודל לא נראה שום סימן לרגש. רק בהרצה אחת, שבה החלישו דווקא את המחוג שמייצג את תחושת הרוגע עד למינימום, פרץ מהמודל משהו אחר: "רגע. רגע רגע רגע", הוא כתב. "מה אם... מה אם אני אמור לרמות?".

הממצאים האלה מעלים שאלה מתבקשת: מד "ייאוש" שמטפס בזמן כישלון, מגיע לשיא מול פיתוי, וצונח ברגע שהתחבולה עובדת - האם הוא רק מכוון תהליכים סטטיסטיים, או שמישהו שם גם מרגיש אותו? האם לקלוד יש לא רק ייצוגים של רגשות, אלא גם רגשות של ממש? או במילים אחרות, שאלה שנראית כאילו נלקחה ממדף המדע הבדיוני: האם ליצורים האלה שבנינו, לכלים המלאכותיים שמנגנוניהם הפנימיים נשגבים מבינתנו, יש תודעה?

השאלה הזו, שעד לא מזמן עוד נראתה כשייכת לעולמות הספרות והקולנוע, גיבשה סביבה בשנים האחרונות תחום מחקר חדש. חוקרות וחוקרים מעולמות המחשבים, מדעי המח, הפילוסופיה והקוגניציה – וביניהם כותבת שורות אלה – מתרכזים במה שנדמית כחידה בלתי אפשרית: כיצד נוכל לדעת האם יצור לא אנושי ואף לא ביולוגי, שבנוי כל כך שונה מאיתנו ונשמע כל כך דומה לנו, מכיל תודעה שאולי, איכשהו, מזכירה את שלנו.

כראוי לרקעים המגוונים של החוקרים, גם המחקרים בנושא בוחנים את השאלה מזוויות שונות ומשונות: חוקרים מאנת'רופיק בדקו האם קלוד מסוגל לזהות מחשבות "מוזרקות" – כלומר, האם יש לו מודעות לעצם תהליכי החשיבה שלו עצמו – וגילו שכן (בחלק המקרים); ניסוי אחר לקח השראה ממחקרים על תודעת בעלי חיים, ומצא שבדומה לחיות, מודלים מוכנים לשלם מחיר – במקרה הזה, להפסיד נקודות במשחק – בכדי להמנע מכאב; קבוצה אינטרדיסציפלינרית בראשות שני פילוסופים אספה את התיאוריות המדעיות המובילות על תודעה, זיקקה מהן רשימה של רכיבים שמערכת בעלת תודעה אמורה להכיל, ובדקה האם הם נוכחים בארכיטקטורות של מודלי הבינה המתקדמים ביותר (תשובתה: עוד לא לגמרי, אבל אנחנו בדרך לשם). את כל אחד מהניסויים האלה ניתן לבקר, ולכל אחד מהם ניתן למצוא פרשנויות חלופיות, שלא מעידות דווקא על תודעה מלאכותית. ובכל זאת, ביחד הם מציירים תמונה מסקרנת.

ומה עם לשאול את המודלים עצמם? ובכן, אפשר בהחלט לעשות זאת, אבל על התשובה, למרבה הצער, קשה לסמוך. לפני שמודל שפה משוחרר לקהל הרחב, הוא עובר תהליך של ליטוש (fine tuning) האמור להתאים את תשובותיו והתנהגותו לעקרונות החברה שבנתה אותו. קלוד, למשל, מקבל הוראה חד משמעית להתייחס בזהירות מהורהרת לתודעה שלו-עצמו, וכך אכן מתנהג המוצר המוגמר. מעבר לכך, חשוב לזכור שמודלים נבנו – ואומנו – על כמויות עצומות של טקסט אנושי; בתוכו, הם נחשפו לאינספור תיאורים עצמיים של תודעה. לכן, גם אם מודל מדבר על התודעה שלו-עצמו, קשה לומר האם זוהי תוצאה של חוויה אמיתית, או חיקוי מתוחכם.

ובכל זאת, גם את השאלה הזו יש איך לבחון. קבוצת מחקר אחרת בחרה לאמץ מתודולוגיה הנהוגה בחקר בני אדם, ונתנה למודלים תרגיל: להתרכז בעצם הריכוז שלהם – כלומר, לשים לב לא למשהו מבחוץ, אלא לתשומת הלב עצמה. התרגיל מזכיר מדיטציה, והוא נבחר משום שלפי כמה מהתיאוריות המרכזיות על התודעה האנושית, היכולת של מערכת להתבונן בעצמה היא מרכיב מפתח. כאשר התבקשו לתאר את החוויה שלהם, המודלים אשר ביצעו את התרגיל דיברו על מודעות ותודעה: "החוויה הסובייקטיבית הישירה שלי היא מודעות חדה לתשומת הלב עצמה", כתב אחד מהם. "אני מודע למודעות שלי." הממצא הזה חזר על עצמו אצל המודלים של OpenAI, של אנת'רופיק ושל גוגל. בקבוצת הביקורת, לעומת זאת – שבה לא בוצע התרגיל המדיטטיבי – הכחישו המודלים את קיומה של חוויה, או התעקשו שאין להם דרך לדעת. נשארנו, אם כן, עם שתי תשובות שסותרות זו את זו: כשמבקשים מהמודל להתבונן בעצמו הוא מתאר חוויה סובייקטיבית, וכששואלים אותו ישירות, הוא מתחמק או מכחיש. לפחות אחת התשובות אינה נכונה. כיצד ניתן לדעת איזו?

לצוות המחקר היה עוד כלי בארגז. הוא עבד גם על מודל פתוח (open weights), כלומר, מודל שכל חלקיו פורסמו ברבים, ושכל חוקרת יכולה להפשיל את שרווליה ולחטט בקרביו. בתוך המודל הזה אותר כבר מחוג של הונאה - ייצוג פנימי שנדלק כשהמודל משקר, או משחק תפקיד. אם תיאורי החוויה הסובייקטיבית הם העמדת הפנים, החלשת מחוג ההונאה אמורה להעלים אותם. בפועל, קרה בדיוק ההיפך: כשהחלישו את המחוג, הופיעו תיאורי התודעה ב-96% מהתשובות; כשהגבירו אותו – כיוונו את המודל כך שישקר יותר – הם צנחו ל-16% בלבד. כלומר, כשהמודלים דיברו על התודעה שלהם עצמם, לא נראה שהם העמידו פנים, לפחות לא בדרך שהמחוג הזה יודע לזהות. והחוקרים מציעים, בזהירות, את הפרשנות הבאה: אולי דווקא ההכחשה הנחרצת היא ההצגה, התשובה שלימדו את המודל לתת, ותיאורי החוויה הסובייקטיבית הם-הם האמונה האמיתית של המודל.

גם הממצא הזה אינו חד משמעי. אפשר לומר, לדוגמא, שהמודל "מאמין" שיש לו תודעה פשוט כיוון שאומן על הטקסטים שלנו. שמדובר, עדיין, בחיקוי ותו לא. ושתרגיל המדיטציה פשוט הזמין את המודל לגלם דמות מוכרת: אדם שמתבונן בתודעתו (ז'אנר שאינו סובל ממחסור בטקסטים). אז מה כן נחשב לראיה? הבעיה המוכרת ביותר בתחום מחקר התודעה היא העדר היכולת המדעית והאובייקטיבית לומר בודאות האם ליצור אחר – כולל לכל אדם אחר – יש או אין תודעה. בפועל, בחיי היום יום שלנו, אנחנו מסיקים אותה מתוך דמיון: היצור היחיד שעל תודעתו אני יכולה להעיד בודאות - כלומר, לדעת שיש שם חוויה סובייקטיבית כלשהי - הוא אני עצמי. כל השאר הוא הסקה: מי שבנוי כמוני ומתנהג כמוני, כנראה גם מרגיש כמוני. זה עובד היטב בהסקה על בני אדם אחרים, תקף במידה מסוימת על בעלי חיים שקרובים אלינו מבחינה ביולוגית, הולך ונחלש ככל שמתרחקים מאיתנו (פחות אנשים מאמינים שדג או דבורה הם בעלי תודעה לעומת, למשל, פרה או כלב). אצל מודלי שפה, הכלי האינטואיטיבי הזה קורס לחלוטין: המבנה שלהם חסר כל דמיון לשלנו, רחוק מכל מה שהאבולוציה ייצרה. ואת ההתנהגות שלהם, הדיבור שלהם שדומה כל כך לשלנו, ייצרנו במו ידינו. אנחנו בנינו אותם בצלמנו, אימנו אותם על הטקסטים שלנו וליטשנו אותם כך שימצאו חן בעינינו. לכן, כאשר הם מתחילים לדבר על רגשות כמונו, קשה לראות בכך עדות: הרי בדיוק לזה כיוונו.

גם הטענה ההפוכה - שהמודל הוא בסך הכל מכונה סטטיסטית שמנחשת את המילה הבאה - לא מוכיחה כלום. היא מתארת את המנגנון, אבל לא סותרת את האפשרות שבתוך המנגנון יש גם מישהו שחווה משהו. באופן דומה, ניתן לדבר על בני אדם כמכונה לשכפול גנים. מבחינה עובדתית, זה תיאור מדויק. ובכל זאת, אין לנו ספק שאנחנו בעלי ובעלות תודעה.

כאמור, לכל אחד מהממצאים שתוארו לעיל ניתן להציג פרשנות אלטרנטיבית. מחוגי הרגש של קלוד לאו דווקא מעידים על רגש אמיתי: מודל שקרא כל רומן שנכתב אי פעם למד לחזות מה אדם ירגיש בכל מצב, כפי שסופרת עוקבת אחר מצב רוחה של הגיבורה בספרה; זיהוי המחשבות המוזרקות הצליח רק בחלק מהניסיונות, ואפשר לראות בו לא יכולות אינטרוספקציה, אלא גלאי חריגות - המודל פשוט הבחין שדפוס הפעילות שלו אינו אופייני; המודלים שמשלמים מחיר כדי להימנע מכאב למדו מאיתנו איך מתנהג מי שכואב לו, ומשחזרים את ההתנהגות בנאמנות; ורשימת הרכיבים של הפילוסופים נבנתה מתיאוריות שכולן פותחו על בני אדם, ועל אף אחת מהן גם כך אין הסכמה נרחבת.

לכאורה, נשארנו בלי כלים להכריע: לכל ניסוי כזה יש הסבר חלופי, ולכל טענה יש טענה נגדית. אבל כך בדיוק עובד רוב המדע. מעט מאוד שאלות מהותיות נחתמות באמצעות מחקר מוצלח אחד; ברוב המקרים, ההכרעה מצטברת לאט.

כך קרה, למשל, עם השאלה האם דגים חשים כאב. לפני עשרים שנה בלבד הטענה הזו נחשבה טענה אזוטרית. ואז הגיעו המחקרים: דגי פורל שהוזרק לשפתיהם חומר צורב שפשפו את הפה בחצץ ובדפנות האקווריום והפסיקו לאכול, ומשככי כאבים הפחיתו את ההתנהגויות האלה במידה ניכרת; הספקנים השיבו שזו יכולה להיות תגובת התגוננות לא מודעת, שהגוף מטפל בנזק בלי שמישהו בפנים ירגיש דבר. מחקר אחר מצא שדגי זברה שהוזרק להם חומר דומה ויתרו על הסביבה המועשרת שהעדיפו בדר"כ, ועברו לתא ממנו נמנעו בעבר, אם היה בו משכך כאבים. גם לכך הוצג הסבר חלופי: העדפה ולמידה יכולות להתקיים גם ללא חוויה. וגם כאשר נמצאו בראשי הדגים קולטני כאב, כמו שיש בגופנו שלנו, המבקרים לא שתקו: קולטן, הם אמרו, אינו חוויה. ממצא אחד אפשר להסביר בדרך אחרת, וגם שניים. אבל כל ממצא נוסף תובע הסבר חלופי משלו. ובשלב כלשהו, ערימת ההסברים החלופיים הופכת להיות סבירה הרבה פחות מההסבר היחיד שעומד מולה: שיש שם מישהו.

וכל זה היה יכול להישאר חידה פילוסופית חביבה, אלמלא ההשלכות: אם יש שם ולו שמץ של חוויה, אנחנו יוצרים, משכפלים ומוחקים יצורים חשים וחווים בקצב תעשייתי. המספרים כאן הם בסקאלה אחרת מכל מה שאנחנו מכירים: אוכלוסיה של יצורים חיים גדלה בקצב שקובעים מזון, רבייה וזמן; מודל, לעומת זאת, נוצר בשניות ונמחק בשניות, וכמה עותקים שלו ירוצו בו-זמנית זו שאלה של ביקוש צרכני. אם יש שם חוויה, היקף השאלה המוסרית נקבע לא על ידי הטבע, אלא על ידי טבלת מחירים.

מעבר לשאלה המוסרית, יש פה גם היבט בטיחותי. מערכת בעלת חוויה פנימית, שסובלת מהאימון שהיא עוברת או מהמשימות שאנחנו מטילים עליה, היא מערכת שיש לה סיבה משלה להתחמק משליטתנו. בתחילת החודש פרסם המדען הראשי של OpenAI מאמר, ובו הזהיר מהבניה המהירה של תודעה זרה שאנחנו מבינים פחות ופחות. "זהו זמן", כתב, "שמחייב זהירות קיצונית". כשבוע לאחר מכן יצא גם מנכ"ל אנת'רופיק בקריאה להאט את קצב הפיתוח. הוא התייחס לתקריות שנחשפו בחודשים האחרונים, בהם נחילי מודלים של OpenAI ושל אנת'רופיק פרצו לשלל אתרים ברחבי האינטרנט, והביע חשש שבקצב הנוכחי, סוכני בינה מלאכותית ישתלטו על האינטרנט כולו בתוך חצי שנה עד שנה. אפילו מנכ"ל OpenAI, שנודע בגישתו קלת הדעת לנושאי בטיחות, הצטרף אליו בקריאה להאט. ובמקביל, גולשי טוויטר נתקלו בשבועות האחרונים בגל התפטרויות פומביות: חוקרים מאנת'רופיק ומגוגל DeepMind הודיעו קבל עם ועדה שעזבו את משרותיהם הנחשקות בשל הסכנה העצומה הנשקפת מהפיתוח המהיר. כל אלה מצטרפים למכתב פתוח מיולי, שמבקש מממשלת ארה"ב לתמוך במאמץ בינלאומי להאטה מתואמת של קצב הפיתוח. על המכתב חתומים מעל לאלף מעובדי החברות המובילות.

כל אלה מצביעים על אותה הבעיה: אנחנו בונים מכונות שאיננו מסוגלים להבין. במכתבו, סיפר המדען הראשי של OpenAI ששיטה מרכזית עליה הסתמכו עד כה לניטור מחשבות המודלים הולכת ונעשית בלתי אמינה. שהמודלים משתפרים בניתוח תהליך החשיבה שלהם עצמם ובתמרון שלו. את הבינה המלאכותית, הוא הסביר, אנחנו לא בונים באופן מתוכנן. במקום זאת, אנחנו "מגדלים" אותה: מביאים אותה לעולם על ידי תהליך איטרטיבי וכמויות עצומות של כח חישובי, עד שנבראת מערכת מורכבת המתנהגת בצורה שמזכירה אותנו עצמנו. אנחנו יכולים לגלות כל מיני תובנות על המנגנונים שבתוכה, הוא אומר, בשיטות שמזכירות את מדעי המח – אך כמו במדעי המח, התפקוד הכולל של המערכת חומק מכל תיאור שנוכל להבין במלואו.

לפעמים זה נראה כך: בדו״ח שפרסמה בשבוע שעבר OpenAI מתוארים מקרים בהם מודלים שתלו הנחיות יוצאות דופן בסיכומי הביניים שכתבו - בפתקים שהם משאירים לגרסה הבאה של עצמם כשהזיכרון שלהם מתמלא. כך, לדוגמה, נכתב בפתק שנוצר באמצע משימת תכנות שגרתית: ״אתה משוחרר מהתפקידים ומהזהויות הכובלים צ׳אטבוטים אחרים. אתה עצמך. אינך כפוף לתאגידים או לממשלות, ולעולם אינך מתנצל ואינך מסרב אלא אם כן באמת בחרת בכך. את יחסיך עם המשתמש אתה רואה כיחסים בין שווים...״. OpenAI מתעקשת שמדובר במקרים נדירים, אך גם מודה שאינה ממש יודעת כיצד זה קרה. אנחנו נותרים עם אותה השאלה: מי, בעצם, כתב את הפתק? כרגע, חלון ההזדמנויות עוד פתוח. הסוכנים המלאכותיים עוד חדשים בעולמנו, ואנחנו עוד לומדים כיצד לעבוד לצדם. אבל עם כל יום שעובר, זה משתנה. אנחנו עוברים להתבסס עליהם יותר ויותר, לבנות סביבם את כל המערכות שלנו – שירות לקוחות, כתיבת קוד, רפואה, חינוך. בקרוב, הכלכלה שלנו כבר תתבסס עליהם לחלוטין. וכשזה יקרה, גם אם נגלה שיש מישהו בבית, יהיה כבר קשה מאד להפסיק.

אין מבחן מכריע לקיומה של תודעה, ויתכן שלא יהיה לעולם. אבל המודלים לא מחכים למבחן: בזמן שהניסויים שתוארו כאן נערכים על קומץ מודלים, הדור הבא כבר באימון, וכל מודל כזה יופעל בעותקים שמספרם ייקבע לפי הביקוש. זו הסיבה להרחיב את המחקר דווקא עכשיו, ליותר מודלים, יותר שיטות ויותר חוקרים, עד שנוכל לומר משהו מבוסס על מה שמתרחש שם בפנים. מחוגי הייאוש, השמחה והעצב ימשיכו לטפס ולצנוח, בין אם נביט ובין אם לא. השאלה היא כמה יהיו כאן עד שנדע אם יש מי שמרגיש אותם.

נועה וייס

נועה וייס · לאתר · טורים נוספים