איך לגייס מהנדס בינה מלאכותית בלי להישרף
גייסו על פי שיקול דעת עקבי
הדמו עובד. קורות החיים מרשימים. כולם יוצאים מהראיון נרגשים.
ואז מישהו שואל מה קורה אם המערכת מנפיקה את אותו החזר כספי פעמיים.
שתיקה היא תשובה יקרה.
גיוס לתחום AI קשה כי החלק הגלוי של העבודה מסתיים מוקדם. חלון צ’אט שעונה בפסקאות שוטפות נראה גמור. שום דבר בו לא מגלה לך אם המערכת מכבדת הרשאות, שורדת טיימאאוט, או עולה יותר לכל טיקט מהאדם שהיא אמורה להחליף.
אתה לא צריך לנצח בוויכוח על attention heads. אתה צריך מספיק ראיות כדי להחליט מי יקבל את ההחלטות האלה בשמך.
גייס עבור השיקול הדעת שמאחורי הדמו. הפוך את השיקול הדעת הזה לבר-תצפית לפני שאתה מציע הצעה.
הנה התהליך שהייתי מריץ עבור מהנדס שמכניס AI למוצר: כתוב את התוצאה, פתח חתיכת עבודה אמיתית אחת, שלם עבור סשן עבודה קצר, ותן ציון למה שראית בפועל. תפקידי מחקר ותשתית דורשים תרגילים שונים. תתחיל מהמשרה עצמה.
כתוב את המשרה לפני שאתה קונה את קורות החיים
“אנחנו צריכים מהנדס AI” זה בערך שימושי כמו “אנחנו צריכים מישהו טוב עם כסף.” רואה חשבון? סמנכ”ל כספים? האדם שאומר למייסד להפסיק לקנות דומיינים?
תבחר את הבעיה שאתה מגייס מישהו לקחת עליה בעלות.
| העבודה שאתה צריך | ראיות שצריך לחפש |
|---|---|
| מחקר או פיתוח מודלים | ניסויים, baseline, בחירות נתונים, ודין וחשבון כנה על מה שלא עבד |
| הנדסת יישומי AI | workflow שימושי, אינטגרציות, הערכה, וטיפול בתקלות |
| תשתיות AI | deployment, קיבולת, ניטור, בקרת עלויות, והתאוששות תחת עומס |
| הערכה ואיכות | מקרי מבחן מייצגים, ניקוד בר-הגנה, ואבחון רגרסיות |
| הנדסת מוצר AI | מחקר משתמשים, עיצוב workflow, אימוץ, והוכחה שהתכונה שיפרה את העבודה |
אדם אחד יכול לכסות כמה שורות. לצפות לעומק שווה בכל חמשן זה איך תיאור משרה הופך לרשימת משאלות עם משכורת מצורפת.
כתוב את תוצאת 90 הימים הראשונים לפני שאתה פותח ראיונות. למשל:
קבע אם עוזר ניסוח תמיכה מקטין את זמן הטיפול מבלי להגדיל שגיאות מדיניות. ספק פיילוט מדוד, מסלול ביקורת אנושית, והמלצה להרחיב, לתקן, או להפסיק.
זה נותן למועמד משהו לחלוק עליו, וזה בדיוק העניין. מועמד חזק ישאל איך נמדד זמן הטיפול, מי הבעלים של המדיניות, ואם מישהו בדק כמה טובות התשובות האנושיות הנוכחיות. מועמד חלש יגיד שזה נשמע מרגש.
אם לאף אחד בצוות שלך אין יכולת לשפוט את הראיות הטכניות, הבא מתרגל חיצוני להערכה — ושאל אם הוא מקווה למכור לך את המימוש אחר כך. אחרת המועמד בסופו של דבר משמש כהפניה הטכנית של עצמו, שזה ניגוד עניינים עם פוזה טובה יותר.
בקש מהם לפתוח את מכסה המנוע
מעסיק מפורסם אומר לך איפה מישהו עבד. הדגמה אומרת לך שמשהו עבד פעם אחת, על מחשב נייד, במצב רוח טוב. אף אחד מהם לא אומר לך מה אותו אדם יכול להוביל בצוות שלך.
בקש פרויקט אחד שהם יכולים לדבר עליו עד הסוף:
“תעביר אותי על משהו ששלחת באופן אישי. מה היה תחת אחריותך, מה נשבר, ומה השתנה בעקבות הראיות?”
אז עקוב אחר החלטה אחת לאורך כל הקשת. מה הייתה הגישה הראשונה? מה הם מדדו? איזו חלופה הם דחו, ולמה? מה תרם חבר צוות? מה הם היו עושים אחרת היום?
בקש ארטיפקט: עקבות מעוקרים מהרצה נכשלת, דוח הערכה, מסמך עיצוב, בדיקה, סיור קוד קצר. עקבות הוא פשוט התיעוד של מה שהמערכת עשתה בדרך לתשובתה — כל קריאת כלי, כל ניסיון חוזר, כל בליעה שקטה. זה ההבדל בין קריאת החיבור לראיית העבודה.
מועמד שמסרב למסור נתוני לקוחות של מעסיק קודם עובר את המבחן, לא נכשל בו.
קח דוגמה משוחזרת במקום, או השתמש בתרגיל המשותף למטה. ‘הראה לי ראיות’ לעולם לא צריך להפוך ל’הביאו לנו סודות של מישהו אחר’.
לעובד בתחילת הקריירה, הראיות קטנות יותר וזה בסדר. התאם את ההיקף הצפוי ואת הפיקוח לתפקיד. אתה בודק הבנה ובעלות, לא גישה ללוגואים מפורסמים.
חמש שאלות ששוות את זמן הראיון
אלה הנחיות לחקירה, לא טריוויה. אם שינון התשובה מספיק כדי לעבור, השאלה לא עושה כלום.
1. “איך היית אומר אם הסוכן הזה השתפר?”
הקשב להצלחה המוגדרת בשפת העבודה: כרטיסים שנפתרו נכון, טיוטות שהסוכן שולח בפועל, הסלמות שלא היו צריכות להתרחש. לאחר מכן שאל אילו כשלונות ציון ממוצע יסתיר, ומול מה הם ישוו את הגרסה החדשה.
תשובה טובה הופכת את המדידה לניתנת לבדיקה. בקש מהם לשרטט שלושה מקרי בדיקה במקום ולמיין מי מחליט האם כל אחד עבר. אם מודל מדרג את התשובות, שאל איך הם בודקים את המודל המדרג. “ציון של 94% אינו מדידה אם אותה ריצה מקבלת 82% ביום שלישי.”
המדריך של Anthropic להערכות סוכנים מציג את ההבחנה ששייכת לראיון שלך: התיעוד של מה שהסוכן עשה אינו זהה לתוצאה. סוכן המדווח “הנפקתי את ההחזר” הוא משפט, לא החזר.
2. “הכלי פג תוקף לאחר שליחת החזר. מה עכשיו?”
“ניסיון חוזר” הוא הרפלקס הלא נכון. הכסף אולי כבר נעלם.
הקשב לבדיקת סטטוס העסקה לפני פעולה, מפתח אידמפוטנטיות כך שהניסיון השני נופל על הראשון, ומסלול הסלמה למצב שבו הסטטוס באמת לא ידוע. שאל מי רואה את הכשל ואיך העבודה ממשיכה לאחר מכן. אוצר המילים חשוב פחות משאלה אם העיצוב שלהם יכול לחייב לקוח פעמיים על טעות אחת.
3. “מה המערכת הזו יכולה לקרוא, לשנות ולהוציא?”
שאל מהן הגבולות: אילו רשומות המערכת יכולה לקרוא, אילו פעולות היא יכולה לבצע, היכן נדרש אישור אנושי, ומה מונע מלולאה לפעול כל הלילה על חשבונך.
לאחר מכן שאל היכן נאכף הגבול הזה. הוראה למודל “להיזהר” היא חומת אש העשויה טקסט מדיניות — הכוונה קיימת, האכיפה לא. בקש מהם לשרטט את הגבול ולהציע בדיקה שמנסה לחצות אותו.
כלול גם חשיפת מידע: מה יוצא אל ספק המודל, מה נכתב ללוגים, ומי יכול לקרוא את הלוגים האלה. “אנחנו מתעדים הכל” היא שיחה בנושא תאימות שמחכה לקרות.
4. “איזה חלק היית בונה בלי LLM?”
מהנדס או מהנדסת מוכשרים יכולים להוציא את הבינה המלאכותית מחלק מההצעה שלהם. חוקי זכאות, חשבון אריתמטי ובדיקות הרשאות דורשים יישומים משעממים שלעולם לא הוזהים. פרשנות למה שלקוח מתוסכל התכוון — לא.
שאל מה המודל קונה לך בתהליך הספציפי הזה, ואיזו ראיה תצדיק את שטח הכשל הנוסף. אם כל תיבה בתרשים זקוקה לסוכן אוטונומי, בקש תרשים קטן יותר.
5. “ספר לי על גישה שנטשת.”
הקשב לתצפית ששינתה את דעתם. משתמשים רצו חיפוש, לא צ’אט. המודל היקר יותר הוריד את עלות הטיפול הכוללת. התכונה לא הייתה שווה לשחרר והם אמרו זאת.
תוצאה שלילית כנה מנצחת סיפור הצלחה מצוחצח, כי סיפור הצלחה רק לעיתים רחוקות חושף כלל החלטה. שאל מה הפסיקו לעשות, וכמה זמן לקח להם להפסיק.
שלמו על מפגש עבודה קטן
השתמשו בתרגיל קצר בתשלום על נתונים סינתטיים. שלחו את ההנחיות ואת קריטריוני הניקוד מראש — אתם מגייסים לשיקול דעת, לא ליכולת להתמודד עם מארב. תנו לאנשים להשתמש בכלים שבהם ישתמשו בעבודה, כולל בינה מלאכותית, ואז בקשו מהם להסביר ולאמת את מה שיצא.
דוגמה למפגש בן 90 דקות עבור מהנדס/ת יישומים:
אתה יורש עוזר תמיכה שמנסח תשובות ומציע החזרים. הנה 12 פניות סינתטיות, מסמך מדיניות קצר וארבע הפקות מתועדות. תשובה אחת מצטטת מדיניות שביטלנו במרץ. בקשת החזר אחת נופלת בטיימאאוט. פנייה אחת מבקשת מידע של לקוח אחר. המליץ האם להרחיב את הפיילוט, והראה לי שיפור אחד קטן או בדיקה אחת. חמש עשרה דקות להבהרת המטרה, ארבעים וחמש לצלילה, שלושים להסבר ההמלצה. תנו להם סביבה מוכנה כך שהתרגיל אינו מבחן סמוי של
npm install. התאימו לצרכי נגישות, ושמרו על תנאים שווים בין המועמדים.
אתם צופים באילו שאלות הם שואלים, אילו ראיות הם פותחים, ואיזה סיכון הם תופסים ראשון. האם שמים לב ש-12 פניות אינן יכולות לבסס אמינות? האם יכולים לשחרר תיקון צר אחד מבלי לטעון שהמערכת בסדר עכשיו? האם יכולים לומר מה צריך לקרות בשבוע הבא?
המועמד שמוסיף בדיקה נופלת להחזר כפול אולי סיפר לכם יותר ממי ששיחרר ממשק צ’אט יפהפה.
השתמשו באותן שאלות ליבה ובאותם קריטריוני דירוג עבור כל אחד בתפקיד — זה המבנה הבסיסי מאחורי הנחיות הראיונות המובנים של משרד ניהול כוח האדם האמריקאי, והוא קיים כדי שהצוות שלכם ישווה מועמדים במקום אווירות. שמרו על התרגיל קרוב לעבודה האמיתית. הקו בין דגימת עבודה לייעוץ חינמי דק יותר ממה שרוב מנהלי הגיוס חושבים, והמועמדים רואים אותו מהצד השני של החדר.
לוח הניקוד לגיוס
העתיקו את זה למסמך הראיון. הסכימו על הרמה הנדרשת לכל מימד לפני שנפגשים עם מישהו, כי הרף זז ברגע שמתחברים למישהו. כל מראיין נותן ציון באופן עצמאי לפני התחקיר ומצרף תצפית קונקרטית לכל דירוג.
השתמשו ב1 = לא נתמך או פגום מהותית, 2 = בר-עבודה עם הכוונה משמעותית, 3 = תקין בהיקף התפקיד, 4 = שיקול דעת תקין בתוספת אימות שהודגם. השתמשו בN/O = לא נצפה כשהראיון לא הפיק ראיה. N/O הוא פער שיש למלא, לא אפס לממוצע.
| מימד | ראיה שמרוויחה 3 | ציון / ראיה שנצפתה |
|---|---|---|
| שיפוט טכני | בוחר תכנון מידתי ומסביר חלופה שנפסלה | ___ / ___ |
| שיפוט מוצר | מגדיר תוצאה למשתמש, קו בסיס, וסיבה להפסיק | ___ / ___ |
| הערכה | מציע מקרים מייצגים ובודק תוצאות, לא רק תשובות שוטפות | ___ / ___ |
| משמעת הפקה | מטפל בכשל חלקי, שחזור, ניטור, עלות וזמן השהיה | ___ / ___ |
| אבטחה | מזהה מידע רגיש ומסביר מגבלות גישה והוצאה ניתנות לאכיפה | ___ / ___ |
| תקשורת | מציין אי-ודאות בבירור ומסביר את ההשלכה למקבל ההחלטה | ___ / ___ |
| בעלות | מפריד את עבודתו מעבודת הצוות ועוקב אחר כשלים עד לפתרון | ___ / ___ |
זה כלי עזר להחלטה, לא מנבא מאומת של ביצועים תעסוקתיים. כיילו אותו לתפקיד שלכם, ובחנו אותו מול מה שקורה בפועל אחרי שאנשים מצטרפים — אחרת אתם מכווננים שופט שמעולם לא קיבל ציון.
למי שיחזיק לבד בהפקה, אני רוצה ראיה תקינה בכל מימד חיוני. ציון כולל חזק לא צריך לכסות חולשה שלא נפתרה בהרשאות או שחזור — אלה שני הדברים שיגבו מכם מאוחר יותר. למהנדס מתפתח, רשמו את התמיכה שהוא יזדקק לה ואת שמו של האדם שיספק אותה.
סיימו את התחקיר בשלושה משפטים: מה האדם הזה יכול להחזיק? איזו תמיכה הוא יזדקק לה? במה אנחנו עדיין לא בטוחים? פאנל שלא יכול לענות על אלה עומד לנהל שיחה בת ארבעים דקות על נוכחות ניהולית.
דגלים אדומים ראויים לעוד שאלה אחת
היזהרו כשמועמד לא מצליח להפריד את תרומתו מזו של הצוות, מתייחס לכל פרויקט קודם כהצלחה ללא דופי, או עונה על שאלות מדידה בתוארים. “דיוק גבוה” צריך מכנה.
עשן אחר: סוכנים מופיעים בתכנון לפני שהבעיה מובנת; לעלות התפעול אין תקרה; שחזור מכשל שייך לצוות אחר; האבטחה חיה כולה בפרומפט.
בדקו פעם אחת עם תרחיש קונקרטי לפני שאתם מסיקים מסקנה. מונח לא מוכר אינו מושג חסר, והרבה מהנדסים חזקים למדו את הרעיונות תחת שמות אחרים. תנו קרדיט כשמישהו תופס את הטעות שלו באמצע התשובה. סירוב להתעדכן מול ראיות סותרות הוא המהלך הפסול — הצורך ברגע שקט לחשוב לא.
כבר מודאגים מהגיוס? תבדקו קודם את העבודה
פרויקט AI מתקשה לא מוכיח שגייסתם את המהנדס הלא נכון. ייתכן שהמטלה הייתה בלתי אפשרית, הנתונים בלתי שמישים, או שההנהלה הבטיחה אוטונומיה מלאה בהרצאה מרכזית לפני שמישהו מדד איכות.
לפני שאתם מזמינים שכתוב, שמרו את הקוד, התצורה, תוצאות ההערכה, ויומנים רלוונטיים תחת בקרות גישה מתאימות. אחר כך קבעו באילו חשבונות, שירותים ומפתחות API החברה באמת שולטת — כאן צוותים מגלים שכל הצינור רץ על חשבון חיוב אישי של אדם אחד.
קבלו קריאה בלתי תלויה על מספר זרימות עבודה מייצגות. מה עובד? מה נכשל? אילו טענות ניתנות לשחזור? הגבילו את הפעולות המסוכנות בזמן שההתנהגות הלא ודאית נחקרת, ומיינו את העבודה לשמור, תיקון והחלפה.
בקשו תוכנית שחזור קצרה עם מבחני קבלה, בעלים מוגדרים, ותאריך החלטה. “אנחנו צריכים פריימוורק חדש” זו הצעה לבחון, לא אבחנה.
תנו לגיוס רשות לאכזב את מפת הדרכים
שום דבר מזה לא עובד אם החברה שלכם מענישה את שיקול הדעת שהיא בדיוק השקיעה שישה שבועות בבחירתו.
המהנדס שאומר “אישור אנושי נשאר על הצעד הזה” או “הפיילוט עדיין לא מצדיק הרחבה” זקוק למנהיג שיכול לשמוע את זה מול אנשים אחרים. גייסו על סמך ראיות ואז קבור את הממצאים הלא נוחים — ובניתם מכונה יקרה לייצר את התשובות שכבר רציתם.
אז לתפקיד הבינה המלאכותית הבא: כתבו את התוצאה, השתמשו בכרטיס הניקוד, וצפו במועמד חופר במשהו לא מושלם.
אתם רוצים את האדם שיכול להראות לכם למה המערכת מוכנה — ושיגיד לכם, בקול רם, ביום שבו היא לא.