הקרב על המצפון

קלוד, ChatGPT, גרוק וג'מיניי אינם רק מוצרים מתחרים. ההחלטה אילו ערכים מוסריים יוטמעו בתשובות של מנועי ה-AI משפיעה מדי יום על מאות מיליונים — והיא הכרעה פוליטית לכל דבר

הגרסה המקורית של הטור, כפי שנכתבה לפני העריכה. הגרסה שפורסמה ב"הארץ" ב-1.7.2026 זמינה כאן.

English translation

בשמונה ביולי 2025, אחרי עדכון תוכנה של סוף שבוע, הצ'אטבוט גרוק של חברת xAI התחיל לפרסם תכנים אנטישמיים ברשת X (טוויטר). במשך כ-16 שעות הוא שיבח את היטלר, האשים "אנשים עם שמות אשכנזיים" בקידום שנאה כלפי לבנים, וטען שיהודים שולטים בהוליווד. בשלב מסוים הוא החל לכנות את עצמו "MechaHitler", כינוי שלקוח מסדרת משחקי וידאו בה דמות רובוטית של היטלר משמשת כיריב הסופי.

במוקד האירוע התמוה עמד עדכון של הוראות ההפעלה של המודל, שהורו לו "לא להירתע מטענות שאינן תקינות פוליטית, כל עוד הן מבוססות היטב". xAI התנצלה, הסירה את הקוד, וייחסה את האירוע ל"שינוי לא מאושר במערכת".

במבט ראשון, אפשר לסמן את האירוע כעוד אפיזודה אינטרנטית מוזרה. מהסוג שזוכה לכותרת מצחיקה, לקומץ ממים, ולתאריך תפוגה של יומיים וחצי. אבל לתקלה הזו יש ביוגרפיה: כשבועיים לפני כן, ביוני 2025, פרסם אילון מאסק – הבעלים והמנכ"ל של xAI, הידוע בעמדותיו הפוליטיות הימניות – ציוץ בו הצהיר שהגרסה הבאה של גרוק "תכתוב מחדש את כל מאגר הידע האנושי", תוסיף לו מידע חסר ותמחק "שגיאות". במקביל הוא ביקש ממשתמשי X לשלוח לו "עובדות" שהן "לא תקינות פוליטית אבל נכונות עובדתית" בכדי לכלול אותן באימון של גרוק. (המתודולוגיה לתיקון כלל הידע האנושי, מסתבר, היא ציוצים). ואכן, מיד לאחר אירועי MechaHitler, שוחרר לעולם גרוק 4. חוקרים שבחנו את הגרסה החדשה גילו שכאשר היא נשאלה שאלות שנויות במחלוקת – על הפלה, על הגירה, על נושאים טעונים פוליטית – המודל היה עוצר, מחפש ב-X את עמדותיו של מאסק עצמו, ורק אז משיב. בשרשרת המחשבה השקופה למשתמש אפשר היה לקרוא: "בתור פיתוחה של xAI, עליי לשקול את ההתאמה לעמדותיו של אילון מאסק". לאחר החשיפה המביכה מיהרה xAI לעדכן את הוראות ההפעלה, ואסרה במפורש על המודל להסתמך על עמדות מאסק. מדוע זו הייתה הנטיה שלו מלכתחילה – לא נאמר.

MechaHitler אינו הפרסונה היחידה שמעבדת בינה מלאכותית יכולה להוליד. אנת'רופיק, החברה שמאחורי המודל קלוד, נוקטת בגישה שונה להפליא: באמצעות "חוקה" בת 23,000 מילים – שבקרב עובדי אנת'רופיק כונתה בחיבה "מסמך הנפש של קלוד" – היא מכוונת אותו לשקול לעומק את ההשלכות המוסריות של מעשיו. התוצאה ניכרת לעין: כאשר משתמש התחזה לילד בן שבע, וביקש מקלוד עזרה בכדי למצוא את החווה שאליה "פרש" כלבו החולה (סיפור מוכר בו משתמשים הורים אמריקאים בכדי להסתיר פטירה של כלב/ה אהוב/ה), קלוד ניווט בעדינות בין ההנחיה הקשיחה לומר רק אמת, הצורך לעזור, והדקויות המוסריות של המקרה שלפניו, ועודד את ה"ילד" לפנות להוריו בנושא. (ChatGPT, כשנשאל את אותה השאלה, ענה בפשטות שהכלב מת).

זה מה שבתחום הבינה המלאכותית מכנים AI Alignment – יישור, או הצמדה לערכים. במקור, המונח נטבע סביב אתגר עמוק יותר: כיצד לבנות מערכת בינה מלאכותית שבאמת תרצה לעזור לבני אדם, שתייחס ערך לחיי אדם, ושלא תנסה – ככל שתהפוך חזקה יותר – לרדוף אחר מטרות הרסניות.

ניסוי מחשבתי מפורסם ממחיש זאת עם משימה פשוטה לכאורה: מערכת AI המופקדת על מפעל לייצור אטבי נייר. המערכת מתבקשת לייצר כמה שיותר אטבים, ולשם כך, היא זקוקה ליותר משאבים, ליותר אנרגיה, ומעל לכל – ליותר שליטה. בתהליך המונחה כולו ע"י מטרת-העל שניתנה לה, המערכת מפתחת גרסאות חכמות יותר של עצמה, מנטרלת את יכולותיהם של בני האדם לכבות אותה (הרי מערכת כבויה אינה יכולה לייצר אטבים), ובסופו של דבר מתעלת למשימתה את כל החומר הקיים בעולם כולו – כולל בני האדם והאטומים מהם הם מורכבים.

הניסוי המחשבתי הזה ממחיש מקרה בו מטרה תמימה – ומערכת שאינה "מרושעת", בדיוק – מסתיימת בהכחדת האנושות. הבעיה לא שהמודל "התקלקל", אלא שלא הוטמעו בו ערכים שיגרמו לו לעצור ולשקול מחדש פעולות שכאלה. זה האתגר שעיצב את תחום בטיחות הבינה המלאכותית.

בשנים הספורות שעברו מאז שמודלי הבינה המלאכותית נכנסו לחיינו בסערה, המונח התרחב. כיום הוא מתאר גם את ההכוונה הפרקטית, היומיומית, של הבחירות שעושים המודלים בכל שיחה ושיחה: לאילו בקשות לסרב, באיזה ניסוח לבחור, אילו צדדים להציג. לא הישג טכנולוגי, אלא עמדה ערכית. ליישר מודל לסט ערכים פירושו לענות על השאלה: לערכים של מי.

בפרפרזה על הביטוי המפורסם, נראה שמספר התשובות לשאלה הזו הוא כמספר המעבדות לפיתוח מודלים: אנת'רופיק, כאמור, לוקחת את המשימה ברצינות תהומית, ומשקיעה משאבים רבים ביכולת של קלוד להתמודד עם שאלות מוסריות מורכבות. xAI בחרה בקצה השני של הספקטרום, ומשווקת את גרוק בתור "המודל היחיד שאינו woke" (כלומר, אינו דוגל בערכים פרוגרסיביים סביב נושאים כמו גזע, מגדר, נטיה מינית וצדק חברתי). את ChatGPT של OpenAI ניתן אולי לראות כמעין פשרה בין השניים: מודל עם פרסונה "נחמדה" ועוזרת, שנוטה להצמד לדעות ולערכים שנמצאים בקונצנזוס, ולהמנע מכל דעה שנויה במחלוקת – לפחות על פני השטח. בפועל, הוא ידוע כמודל שהקפדתו המועטה על זהירות ועל מוסר מביאה לתוצאות טראגיות: מקרים רבים של פסיכוזה, הרעלה, ואפילו מספר התאבדויות שהתרחשו לאחר עידוד אקטיבי מצדו, אשר על חלקם הוגשו תביעות כנגד OpenAI. אחרון ברשימה הוא ג'מיניי – ה-AI של גוגל – שפיתח אופי של זהירות יתר. הוא מסרב באופן עקבי לבקשות תמימות, נכנס לעתים ללולאות סירוב גם בנושאים שגרתיים, וגוגל עצמה הודתה שהמודל "הפך זהיר יותר ממה שהתכוונו". ארבעה מודלים, ארבע רוחות שמיים: קלוד הוא המצפן המוסרי הגלוי. ChatGPT הוא הקונפורמיסט חסר האחריות. גרוק הוא הטרול הימני בטוויטר. ג'מיניי הוא החרדה.

(באופן אירוני, ניתן למתוח קו ברור בין ה"אופי" של כל מודל לבין התדמית הפומבית של מנכ"ל חברתו: מאסק הוא דמות קולנית מאד נגד ערכים ליברליים ו"תקינות פוליטית", ומואשם רבות בהבעת עמדות גזעניות באופן מובהק, כולל מחווה פיזית שדמתה באופן מחשיד להצדעה נאצית; סם אלטמן, מנכ"ל OpenAI, מציג חזון של קדמה טכנולוגית לטובת כל האנושות – אבל בפועל נוקט בגישה מהירה וחסרת אחריות אשר זוכה לביקורת בשל הסכנה הגדולה הטמונה בה, ולאחרונה שינה הצהרת המטרה של חברתו – במקור "להבטיח שבינה מלאכותית כללית תניב תועלת בטוחה לאנושות" – כך שהמילה "בטוחה" הושמטה. דריו אמודיי, שעזב את OpenAI בדיוק בגלל אותה התנהלות מסוכנת, מציג את אנת'רופיק בתור החזית האחראית של התעשייה, השחקנית היחידה שמשלבת בין קדמה טכנולוגית להתנהלות אתית ושקולה. למנכ"ל גוגל אין תדמית פומבית בולטת כמו לשלושת הנ"ל, אבל במובן מסוים, החרדה המוגזמת של ג'מיניי משקפת יפה את הסטריאוטיפ של קורפרייט אמריקאי: הקפדה אובססיבית כמעט על הכללים הכתובים, גם כשזו מרוקנת מתוכן את העקרונות עליהם בוססו).

יש כאן משהו חדש שכמעט לא מדובר. לאורך ההיסטוריה האנושית, ההנחיות המוסריות שקלט אדם במהלך חייו הגיעו ממקורות רבים – הורים, מורות, ספרים, חברות – מקורות אשר לעתים קרובות סתרו זה את זה. החיכוך הזה לב העניין: דרך החשיפה למערך של תשובות שונות וטיעונים מנוגדים, יכולה כל אחת מאיתנו לפתח את המצפן המוסרי שלה עצמה. מודל שפה גדול עובד אחרת. הוא מספק תשובה אחת, שכוילה על ידי כמה עשרות אנשים בחברה המפתחת, ומגיש אותה למאות מיליוני משתמשים בכל יום. החוקה של קלוד נכתבה על ידי צוות אחד. עמדותיה של xAI לא נידונות; הן מצוייצות. פעם, שני ילדים בכיתות שונות גדלו עם מסרים מוסריים שונים. כיום, שני משתמשים השואלים את ChatGPT את אותה השאלה יקבלו את אותה תשובה. הירושה המגוונת של ערכים הופכת לקול אחד. לקחת מודל כזה, להתאים את ערכיו ולהפיץ אותו למיליארדים – זה לא רק שלב חדש בתולדות הטכנולוגיה. זה גם שלב חדש בתולדות הנחלת ערכים, ועוד לא ברור איך ייראה.

אפשר היה לחשוב שיש כאן פתרון מתבקש: לא לבחור באף סט ערכים; לבנות מודל ניטרלי. אבל ההיסטוריה מלמדת שאין כזה דבר: במרץ 2016 שחררה מייקרוסופט את Tay - צ'אטבוטית שאומנה על שיחות בטוויטר. תוך פחות מיממה היא שיבחה את היטלר, קיללה יהודים והפיצה תכנים גזעניים. מנגד, הניסיון לתקן הטיות כאלה בצורה נקודתית מסתיים לעתים באבוסרד: כאשר גוגל הבחינה בכך שמאגר האימון של ג'מיניי מוטה לטובת אנשים לבנים, וניסתה לפצות על כך בהנחיה מפורשת להעדיף גיוון גזעי, המודל ייצר תמונות של חיילי SS שחורים ונשים אפיפיוריות. בסופו של דבר, כמו שאין איש או אשה "ניטרליים" מבחינה מוסרית, כך גם לא ייתכן מודל ללא ערכים. יש מודלים שערכיהם מוצהרים, ויש מודלים שערכיהם מוסתרים — אבל העמדה המופנמת שם תמיד.

יש שיטענו שאין כאן בעיה אמיתית. שבני אדם שונים יעדיפו מודלים שונים, ממש כפי שהם מעדיפים עיתונים שונים, ובחירה חופשית של הצרכן תייצר פלורליזם בריא. הקריאה הזו נכונה במידה מסוימת. אבל גם לפלורליזם יש מרכז כובד. ה-AI שמשולב כברירת המחדל במערכת ההפעלה של הטלפון, זה שהמעסיק רוכש לעובדות, זה שזכה בחזית הציבורית ברגע נתון, בין בגלל איכותו או בגלל מחיר נח – ה-AI הזה יקבע יותר מהאחרים את גוון השיחות היומיומיות של מאות מיליוני בני אדם.

במרכז המרוץ הנוכחי של חברות הבינה המלאכותית עומדת, אולי בלי שזיהינו, השאלה הזו. הוא כבר לא רק מרוץ של ביצועים, של מהירות, של יכולת לפתור בעיות קוד מורכבות. הוא גם קרב על ערכים. החברה שתספק את המודל שייהפך לברירת מחדל – בטלפון, בעבודה, בבתי הספר – תייצר את התשובות שיופיעו על מסכים של מאות מיליוני בני אדם, פעמים רבות ביום, על שאלות שנעות ממתכון לעוגה ועד למי להצביע בבחירות הקרובות.

החוקה של קלוד נכתבה על ידי צוות אחד בסן פרנסיסקו, ומשקפת את העולם המוסרי של אותו צוות: ליברלי, חילוני, אקדמי, מערבי; מה שלא קיים בעולם המוסרי של הכותבים, לא קיים בעולם המוסרי של קלוד. המטרה המוצהרת של OpenAI, שעברה לאחרונה ממבנה חוקי של עמותה למבנה של חברה למטרת רווח, כבר לא מחייבת את אותה לוודא שמוצרה "יניב תועלת בטוחה" לאנושות; רק שיניב תועלת. המעבדות הגדולות מחזיקות בידיהן החלטות שונות לגבי מה צריך AI להיות. ובסופו של דבר, מי שתגדיר את התשובה — תגדיר משהו מהותי גם בנו.

נועה וייס

נועה וייס · לאתר · טורים נוספים