תקציר מאמר שהתפרסם ב-Psychology of Sport and Exercise

תמצית המאמר


במצבים רבים אנחנו עומדים בפני בחירה בין שתי אפשרויות:

  • Exploitation – מיצוי: להמשיך ולמצות את האפשרות שכבר הוכיחה את עצמה.
    Exploration – חקר: לנסות אפשרות חדשה, שאיננו יודעים עדיין אם היא טובה יותר.
    הדילמה היא למעשה:
    האם להמשיך עם מה שמוכר לנו, אפילו אם הוא כבר לא מניב את התוצאות הרצויות או לנסות משהו חדש שאולי יהיה טוב יותר?
    מדוע הדילמה חשובה במיוחד בספורט?
    המחברים מדגישים שספורט הוא סביבה טבעית במיוחד למחקרים באיזון שבין מיצוי לחקר משום שהחלטות מתקבלות:
    בזמן אמת;
    בתנאים משתנים;
    כאשר המידע חלקי;
    כאשר התוצאות אינן ודאיות;
    כאשר קיימים מחירים לטעות;
    ולעיתים תחת לחץ זמן ולחץ תחרותי.
    לדוגמה, קבוצת כדורגל יכולה להמשיך באסטרטגיה מוכרת, או לנסות שינוי טקטי כדי להפתיע את היריבה. נהג מרוץ יכול להמשיך עם סוג הצמיגים הנוכחי או להחליף לצמיגים אחרים, כאשר תנאי המסלול משתנים.
    החלטות ספורטיביות רבות אינן פשוט "בחירה נכונה או לא נכונה", אלא החלטה מתי להפסיק למצות אפשרות קיימת ומתי להתחיל לחקור אפשרויות אחרות.
    ההבדל בין מיצוי לחקר
    מיצוי – הספורטאי משתמש בידע שכבר צבר וממשיך באותה הדרך
    לדוגמה: רץ מצא שבאימונים מסוימים הוא משתפר כאשר הוא רץ בקצב מסוים. הוא ממשיך להשתמש באותה שיטה.
    היתרון: סיכוי גבוה יחסית לקבל תוצאה מוכרת וטובה.
    החיסרון: ייתכן שהוא מפספס שיטה טובה יותר.
    חקר – הספורטאי מנסה אפשרות שעדיין אינו יודע מה תהיה התוצאה שלה.
    לדוגמה:
    שינוי תוכנית אימונים;
    שינוי טקטיקה;
    שינוי קצב;
    שינוי תזונה;
    שינוי טכניקה;
    ניסיון אסטרטגיה חדשה בתחרות.
    היתרון: האפשרות למצוא פתרון טוב יותר.
    החיסרון: הניסיון החדש עלול להיות גרוע יותר מהפתרון הקיים.
    זו אינה בחירה חד-פעמית
    אחת הנקודות החשובות במאמר היא שהיחס בין חקר למיצוי משתנה כל הזמן.
    הסביבה משתנה, ולכן גם האפשרות שהייתה הטובה ביותר לפני רגע אינה בהכרח הטובה ביותר עכשיו.
    אחת הדוגמאות שמביאים היא ממרוצי מכוניות. בחירת הצמיגים תלויה במזג האוויר, ברטיבות המסלול, בטמפרטורת המסלול, בשחיקת הצמיגים ובמיקום הנהג באותו רגע במרוץ. הערך של כל אפשרות יכול להשתנות במהלך המרוץ. לכן הנהג והצוות צריכים כל הזמן לשאול אם להמשיך עם הבחירה הנוכחית או לנסות אפשרות אחרת.
    הקשר לאימון ולקריירה של ספורטאי
    המסגרת מעניינת במיוחד כאשר ספורטאי נתקל בבעיה:
    האם להמשיך לנסות לשפר את השיטה הקיימת, או לשנות אותה?
    למשל:
    ספורטאי מצליח במשך שנים באמצעות שיטת אימון מסוימת.
    אפשרות אחת היא:
    להמשיך ולדבוק בשיטה הקיימת, כלומר – מיצוי.
    להמשיך לנסות להשתפר בהדרגה את אותה שיטה.
    אפשרות שנייה:
    חקר – לנסות תוכנית אימונים חדשה, מאמן חדש, טכניקה חדשה או אסטרטגיה אחרת.
    המאמר משתמש גם בדוגמה של האתלטית סידני מקלוכלן-לברון שבגיל 20 שינתה את סביבת האימון שלה ועברה לעבוד עם המאמן בוב קרסי. הדוגמה משמשת להמחשת האפשרות שספורטאי צריך לעיתים לצאת מהפתרון המוכר כדי למצוא פתרון טוב יותר אך כזה שיש בו גם לא מעט סיכונים. היו אתלטים שהתאמנו בהדרכת בוב קרסי שהעידו שכל האתלטים שהתאמנו אצלו נטלו "סמים". נטילת החומרים משפרי ההישג האלה אולי מייעלת את האימונים ומביאה לשיפור גדול בהישגים אך יש בה סיכון בריאותי וסיכון להיתפס בבדיקות לגילוי "סמים" ולהיות מורחקים מהספורט.
    וזה בדיוק המקום שבו המושג יכול להיות שימושי גם להבנת "תקיעות" בשיפור ביצועים: כאשר המשך השימוש באותה אסטרטגיה אינו מביא עוד תועלת, ייתכן שהגיע הזמן לחקור אפשרויות חדשות.

כיצד אפשר לחקור זאת במעבדה?
המחברים מציגים מספר פרדיגמות ניסוייות שכבר משמשות בתחומים אחרים.
אחת המרכזיות היא Multi-Armed Bandit
דמיינו מכונות מזל שונות, כאשר כל מכונה נותנת תגמול אחר, אך אינכם יודע מראש איזו מכונה טובה ביותר.
עליכם להחליט:
להשתמש שוב ושוב במכונה שכבר נתנה תוצאה טובה – מיצוי
לנסות מכונה אחרת כדי לבדוק אם היא טובה יותר – חקר
הבעיה היא שהבחירה באפשרות חדשה עולה במחיר של ויתור על האפשרות המוכרת.
אפשר להתאים את הפרדיגמה הזאת לספורט.
היתרון של מודלים חישוביים
במקום לומר רק:
"הספורטאי נוטה לקחת סיכונים"
אפשר להשתמש במודל חישובי כדי להעריך מדוע הוא בחר באפשרות מסוימת.
מודלים כאלה יכולים להפריד בין גורמים כגון:
רגישות לתגמול;
רגישות להפסד;
מידת חוסר הוודאות;
קצב הלמידה;
נטייה לחקור;
נטייה לנצל ידע קיים;
האופן שבו מידע קודם משפיע על החלטות חדשות.
כך ניתן לעבור מתיאור כללי של התנהגות לניתוח של המנגנונים שמייצרים את ההתנהגות.
מדוע ספורטאים הם אוכלוסייה מעניינת במיוחד?
המחברים מעלים שאלה רחבה יותר:
מה מבדיל ספורטאי עילית מאדם רגיל בקבלת החלטות?
לדוגמה, האם ספורטאי עילית:
מוכן יותר לקחת סיכונים?
רגיש יותר לתגמול?
לומד מהר יותר מתוצאות קודמות?
מזהה שינויים בסביבה מהר יותר?
יודע טוב יותר מתי להפסיק לנצל אסטרטגיה קיימת?
יודע טוב יותר מתי לבצע חקר?
או שהוא פשוט יעיל יותר במציאת פתרון בעל ערך גבוה?
המאמר אינו טוען שכבר יש תשובות לשאלות אלה. להפך: הוא מציג אותן כשאלות מחקר עתידיות.
מדוע דווקא ספורט יכול לתרום גם למדע הכללי?
המחברים אינם רואים בספורט רק יישום של תיאוריות פסיכולוגיות.
הם מציעים שספורט יכול לשמש "מעבדה" לחקר קבלת החלטות אנושית.
בספורט יש באופן טבעי:
לחץ;
תגמולים;
אי-ודאות;
שינויי סביבה;
זמן מוגבל;
תחרות;
סיכונים;
תוצאות מדידות.
לכן ניתן לבדוק באמצעות ספורט עד כמה מודלים של קבלת החלטות שנוצרו במעבדה מתאימים להתנהגות אנושית בתנאים אמיתיים ומורכבים
היישומים האפשריים
המחברים מציעים שמסגרת זו יכולה בעתיד לתרום ל:
אימון – זיהוי מתי ספורטאי צריך להמשיך בשיטה קיימת ומתי כדאי לנסות משהו חדש.
קבלת החלטות בתחרות – הבנת הבחירה בין אסטרטגיה מוכרת לבין אסטרטגיה חדשה.
קבלת החלטות תחת לחץ – בדיקה כיצד לחץ משנה את האיזון בין חקר למיצוי.
למידה:
הבנת האופן שבו תוצאות קודמות משפיעות על החלטות עתידיות.
התאמה לשינויים – הבנת היכולת של ספורטאי להגיב לסביבה שמשתנה במהירות.


רקע


בספורט ובפעילות גופנית, ספורטאים תחרותיים ואנשים העוסקים בפעילות גופנית בשעות הפנאי נדרשים ללא הרף לקבל החלטות. לדוגמה, דמיינו שהחלטתם להתחיל לרוץ כדי לרדת במשקל. בתחילה, תוכנית האימונים שלכם פעלה היטב, אך בשבועיים האחרונים הירידה במשקל נעצרה, והריצה מתחילה להרגיש מונוטונית. מה תעשו? האם תמשיכו בתוכנית הנוכחית, בתקווה שמדובר במצב זמני ושההתקדמות תתחדש? או שתעברו לתוכנית אחרת, אף שאינכם יודעים אם היא תהיה יעילה ואם היא תתאים לכם ולאורח החיים שלכם?
דוגמה זו ממחישה מצב שבו אפשרות מוכרת כבר אינה מספקת תועלת מספקת, ולכן האדם עשוי להתחיל לחקור אפשרויות אחרות, שעשויות להעניק תגמול רב יותר.
הקריירה של אתלטית הצמרת, סידני מקלוכלן-לברון (נולדה ב-1999) מספקת דוגמה מוחשית לאופן שבו בחירה לחקור אפשרות חדשה עשויה להוביל לתגמולים גבוהים יותר, אף שאין בה כל ערובה להצלחה ויש בה גם סיכונים.
מגיל צעיר היא נחשבה לילדת פלא, גברה באופן עקבי על יריבותיה וצברה ניצחונות רבים. עם זאת, למרות כישרונה הבלתי מוטל בספק והצלחתה, מקלוכלן-לברון החלה להתמודד עם קשיים במעבר שלה לקריירה המקצוענית כבוגרת. חוסר שביעות הרצון שלה מהישגיה גבר, כאשר שוב ושוב לא הצליחה לגבור על היריבה הגדולה ביותר שלה באותה תקופה, האתלטית שהחזיקה אז בשיא העולם בריצת 400 מ' משוכות, דלילה מוחמד (נולדה ב-1990). ב-4 באוקטובר 2019 ניצחה דלילה מוחמד באליפות העולם שנערכה בדוחא בירת קטאר. דלילה מוחמד בת ה-29 שיפרה בריצה זו את שיא העולם ב-400 מ' משוכות אותו היא קבעה בחודש יולי באותה השנה – 52.20 שנית. זמנה של דלילה מוחמד בדוחא היה 52.16 שניות. מקלוכלן-לברון בת ה-20 סיימה במקום השני – 52.23 שניות, הישג טוב משיא העולם בו החזיקה יוליה פשונקינה מאוגוסט 2003 עד יולי 2019 – 52.34 שניות.
אף שהייתה אחת הטובות בעולם בריצת 400 מ' משוכות, סידני מקלוכלן-לברון גילתה שהאסטרטגיות ושיטות האימון שבהן השתמשה כבר לא הניבו את התוצאות הרצויות. משהבינה זאת, היא החליטה לעבור למאמן חדש. בקיץ 2020 עברה מקלוכלן-לברון להתאמן אצל המאמן בוב קרסי. החלפת מאמן כרוכה בסיכונים משלה, שכן אין בה ערובה להצלחה. לפיכך, לבחירה זו יש גם מחיר.
ההחלטה לחקור אפשרויות אחרות התבררה כנקודת מפנה בקריירה שלה. במבחני ארה"ב לקראת המשחקים האולימפיים בטוקיו בשנת 2021 קבעה מקלוכלן-לברון שיא עולם חדש – 51.90 שניות ובמשחקים עצמם בטוקיו היא ניצחה ושיפרה פעם נוספת את שיא העולם והעמידה אותו על 51.46 שניות.
מאז, מקלוכלן-לברון ביססה את מעמדה כמי שכמעט לא ניתן לגבור עליה בריצת 400 מטר משוכות. היא שיפרה את שיא העולם 4 פעמים נוספות: 51.41 ש' ביוני 2022, 50.68 ש' באליפות העולם ביולי 2022, 50.65 ש' ביוני 2024 ו-50.37 ש' במשחקים האולימפיים בפריז באוגוסט 2024.
ברור כי כאשר ניצבה מקלוכלן-לברון בפני תשואה פוחתת מהגישה שבה נקטה עד אז, היא החליטה לחקור חלופות חדשות, אך בלתי ודאיות, החלטה שהביאה לתוצאות המקוות. חשוב לציין כי מספר אתלטים העידו כי האתלטים שהתאמנו תחת הדרכתו של המאמן בוב קרסי השתמשו בתכשירים לשיפור הישגים האסורים לפי חוקי הספורט ("סמים") כך שהמעבר של מקלוכלן-לברון להתאמן אצלו נראה כצעד שיכול לגרום לשיפור גדול בהישגים אך גם לסיכון בריאותי וגם אולי גם לסיכון להיתפס בבדיקות לגילוי הסמים ולהיות מושעית מתחרויות. בשנת 2025 קיבלה מקלוכלן-לברון החלטה להתמקד במקצוע אחר, ריצת 400 מטר ללא משוכות, אולי מהתחושה שאין לה כבר מה להוכיח בריצת 400 מטר משוכות וחיפוש אתגר חדש. באליפות העולם 2025 היא ניצחה בריצת 400 מטר תוך קביעת ההישג השני בכל הזמנים – 47.78 שניות, קרוב מאד לשיא העולם שנקבע עוד ב-1985 – 47.60 ש'. מעניין שגם יריבתה הגדולה של מקלוכלן-לברון, ההולנדית פמקה ברודרס-בול, בעלת ההישג השני בכל הזמנים ב-400 מ' משוכות – 50.95 ש', הישג שנקבע ב-2024, בחרה לנסות את כוחה במקצוע אחר. במקרה שלה מדובר בריצת 800 מ', מקצוע בו החלה להתחרות בשנת 2026 וקבעה באותה שנה הישג של 1:54.71 ד', הישג המדרג אותה כתשיעית בכל הזמנים, כלומר היו רק 8 נשים שקבעו הישג טוב יותר. בשני המקרים מדובר באתגר של יציאה לדרך חדשה והעדפה אותה על פני הצמדות למקצוע בו הן זכו להצלחה גדולה. במקרה של ברודרס-בול יש כאן אולי גם ניסיון להיות מספר 1 בעולם במקצוע כלשהו. מקלוכלן-לברון עשתה את המעבר ל-400 מ', אולי באופן זמני, כדי לראות אם תוכל להיות הטובה ביותר במקצוע נוסף, אולי גם יוקרתי יותר.

דלילה מוחמד מקדימה את סידני מקלוכלן-לברון באליפות העולם 2019
דלילה מוחמד מקדימה את סידני מקלוכלן-לברון באליפות העולם 2019

בתמונה: דלילה מוחמד (מספר 6) מקדימה את סידני מקלוכלן-לברון באליפות העולם באתלטיקה ב-2019


עם זאת, בספורט מקובל גם להתמודד עם חוסר ודאות בשאלה האם המשך השימוש באסטרטגיה מוכרת יהיה יעיל, ולעיתים אף נאלצים להתחיל ללא אסטרטגיה ברורה כלשהי, בשל מחסור במידע. במצב כזה, חקר ראשוני של האפשרויות נחוץ כדי לזהות את האפשרויות הזמינות ואת התגמולים הכרוכים בהן.
ניקח לדוגמה שחקן טניס המתמודד עם יריב חדש שהוא אינו יודע דבר עליו. בתחילת המשחק, השחקן אוסף מידע על נקודות החוזק והחולשה של היריב. במהלך החקר השחקן מבחין כי יריבו משחק בעיקר מהקו האחורי והוא מתקשה להתמודד מול עליות לרשת. מה עליו לעשות? האם להישאר ליד הרשת לאורך כל המשחק, ולנסות לנצח כשהאסטרטגיה היחידה שלו היא הסתמכות על הנחתות של כדורים ליד הרשת?
מכיוון שעליות רבות לרשת דורשות מאמץ גופני רב, גישה זו עלולה להפוך עם הזמן למאומצת ומעייפת מדי. נוסף על כך, היצמדות לאותה טקטיקה עלולה להפוך לצפויה, וקיים הסיכון שהיריב יסתגל לטקטיקה הזו ויצליח להתגבר עליה על ידי ביצוע חבטות העברה, בכל פעם שהוא יבחין בניסיון עליה לרשת.
גורמים חיצוניים ופנימיים אלה משפיעים על התגמולים הקשורים לאסטרטגיות השוות, ובכך הופכים את התוצאה לבלתי יציבה וקשה לחיזוי, ומאלצים את השחקנים להסתגל באופן מתמיד.
אלה רק כמה דוגמאות הממחישות כיצד החלטות רבות בספורט ובפעילות גופנית סובבות סביב הבחירה בין פעולה מוכרת שהתגמולים הכרוכים בה ידועים, לבין ניסיון של אפשרות פחות מוכרת, שעשויה להוביל לתוצאה טובה יותר. חוקרים מכנים דילמה מסוג זה בקבלת החלטות – האיזון בין חקר למיצוי – exploration–exploitation trade-off
איזון זה רלוונטי הן להחלטות מיקרו, הקשורות למצבים ספציפיים (למשל, בחירה או שינוי של אסטרטגיה במהלך משחק טניס), והן להחלטות מאקרו, כגון בחירת מסלול קריירה מסוים או בחירת ענף ספורט חדש כתחביב. את כל ההחלטות הללו ניתן למסגר במסגרת האיזון בין חקר למיצוי.
בה בעת, ההחלטות מדגישות גם את המורכבות והאופי הדינמי של איזון זה בהקשרים של ספורט ופעילות גופנית, שבהם התגמולים משתנים, הסביבה אינה ודאית, ולבחירות יש עלויות.
חוקרים בחנו את האיזון בין חקר למיצוי כמסגרת בסיסית לקבלת החלטות במגוון רחב של תחומי מחקר, ובהם מחקר בבעלי חיים, מדעי המוח הקוגניטיביים, מחקר בפסיכיאטריה, מדעי המחשב ובניהול ארגוני.
כדי לבחון כיצד בני אדם ובעלי חיים מתמודדים עם איזון זה, מחקרים משתמשים בפרדיגמות ממוחשבות סטנדרטיות וכלליות, שאינן תלויות בתחום תוכן מסוים. כאשר משלבים פרדיגמות אלה עם מודלים חישוביים, ניתן לכמת את הנטיות של הפרט לחקר או למיצוי, ולהגדיר באופן מתמטי התנהגות שמטרתה לקבל את הגמול הגדול ביותר האפשרי במגוון הקשרים של קבלת החלטות ובמבנים שונים של משימות. כך מתאפשר גם להעריך את איכות קבלת ההחלטות.
מחקרים שהשתמשו בפרדיגמות אלה סיפקו תובנות חשובות לגבי המנגנונים העומדים בבסיס קבלת החלטות של חקר ומיצוי, תפקידם של הבדלים בין-אישיים, וכן לגבי השפעתם של גורמים מצביים ושל דינמיקה לאורך זמן על האופן שבו אנשים מתמודדים עם איזון זה.
מחקר העוסק בקבלת החלטות בספורט ובפעילות גופנית הוא תחום מחקר פורה, והניב כמה תובנות חשובות. לדוגמה, מחקרים מראים כי אסטרטגיות משתנות באופן הסתגלותי בתגובה לתגמולים שהתקבלו, כגון היצמדות לאסטרטגיה כאשר מנצחים ומעבר לאסטרטגיה אחרת כאשר מפסידים. עם זאת, מעט מאוד מחקרים בחנו באופן פורמלי את האיזון בין חקירה למיצוי בהקשרים אלה. עדויות אנקדוטליות מצביעות על כך שניתן למסגר החלטות רבות בספורט במסגרת זו, אך הגישות הקיימות מתמקדות לעיתים קרובות בהחלטות מבודדות, במקום ללכוד אסטרטגיות קבלת החלטות בסיסיות התלויות בתגמול.
לעומת זאת, מחקרים בתחומים אחרים בוחנים באופן מפורש את האיזון בין חקירה למיצוי, תוך התייחסות להחלטות מורכבות, לעלויות ולתגמולים דינמיים, ולהסתגלות שלהם לשינויים בסביבה ובמצבו הפנימי של האדם או של בעל החיים. באמצעות שילוב נקודת מבט זו, מבקשים החוקרים להכניס מסגרת מבטיחה זו לקבלת החלטות אל תחום המחקר של הספורט והפעילות הגופנית.
גישה זו לא רק מאפשרת לבחון כיצד אנשים מנווטים באופן הסתגלותי בסביבות אלה, אלא גם לזהות מתי קבלת ההחלטות נעשית בלתי מיטבית, למשל, עקב חקירה רבה מדי או מעטה מדי, להבהיר מהם הגורמים המניעים סטיות כאלה, ולהצביע על דרכים אפשריות לצמצומן.
לפיכך, מציעים החוקרים כי השימוש בפרדיגמות חישוביות מבוססות לחקר האיזון בין החקירה למיצוי בספורט ובפעילות גופנית עשוי להיות בעל פוטנציאל רב לחשיפת מאפיינים מרכזיים של תהליכי קבלת החלטות. נוסף על כך, גישה זו עשויה לסייע בבחינה של תנאי הגבול של תיאוריות העוסקות בקבלת החלטות אנושית.
לממצאים אלה עשויות להיות השלכות רחבות, לרבות יישומים הקשורים לבחירת פעולות בספורט ולהתנהגות בפעילות גופנית. יתרה מזאת, תובנות אלה עשויות לשפר את הביצועים הספורטיביים, ובמקביל לקדם את המחקר הבסיסי בתחום מדע קבלת ההחלטות.
המאמר בנוי מארבעה חלקים. ראשית, מוצג מבוא מושגי לאיזון בין החקירה למיצוי בו מודגשת חשיבותה כמסגרת מרכזית להבנת קבלת החלטות הסתגלותית.
בהמשך, מתוארות פרדיגמות ממוחשבות שונות ומודלים חישוביים המשמשים לכימות הנטיות לחקירה ולמיצוי.
לאחר מכן, נבחנת המורכבות של קבלת החלטות בספורט באמצעות זיהוי הבדלים בין-אישיים, גורמי מפתח התלויים בהקשר ודרישות של ויסות עצמי. מובא דיון בהשפעתם האפשרית על האופן שבו אנשים מנווטים את האיזון בין חקירה למיצוי, וכן בתובנות שניתן להפיק מחקר הדינמיקה הזו עבור המחקר בתחום הספורט והפעילות הגופנית.
לבסוף, מובא דיון בתרומה האפשרית של המדע הבסיסי הנובעת מחקר מסגרת החקירה–מיצוי בתחום הספורט והפעילות הגופנית.
האיזון בין חקירה למיצוי מתאר מסגרת רחבה המאפיינת קבלת החלטות המבוססת על תגמולים בעת בחירה בין אפשרויות. באופן ספציפי, האיזון משקף את הצורך המתמיד לבחור בין אפשרות מוכרת, שהתגמולים הצפויים ממנה ידועים וגבוהים (למשל, שיטת אימון מוכרת או שימוש באותה טקטיקה), לבין חיפוש אחר אפשרויות חדשות שעשויות להניב תגמולים גבוהים אף יותר.
במונחים טכניים, מדובר בפשרה בין מיצוי תגמולים מוכרים לבין חקירת אפשרויות חדשות במטרה להשיג מידע על התגמולים שהן עשויות לספק, ובכך לשפר החלטות עתידיות ולהגדיל ככל האפשר את התגמולים לאורך זמן.
ברמה ההתנהגותית, האיזון מוצג לעיתים קרובות כהחלטה בין הישארות עם האפשרות הנוכחית לבין מעבר לאפשרות אחרת. לדוגמה, שחקן טניס שבדרך כלל נוהג להישאר בקו האחורי עשוי להחליט לשנות טקטיקה ולעלות לרשת כדי לבצע הנחתות במטרה לזכות בנקודות במהירות רבה יותר ולהפתיע את היריב.
עם זאת, בהתאם לדינמיקה התלויה בהקשר ולתנאים המשתנים ללא הרף, בספורט, אך גם בהקשרים אחרים של קבלת החלטות, ההתמודדות עם האיזון בין החקירה והמיצוי משקפת לעיתים קרובות תהליך מורכב יותר של למידה והסתגלות. לכן, אין לראות באיזון בין חקירה ומיצוי בחירה יחידה ובינארית, אלא רצף, שבו מיצוי טהור וחקירה טהורה מייצגים את שני הקצוות.
חקירה מתמדת אינה הסתגלותית, משום שהיא כרוכה באיסוף בלתי פוסק של מידע על אפשרויות שונות של תגמול, מבלי לנצל את הידע שנצבר. בכך למעשה מוותרים על האפשרות ליהנות מהתגמולים הללו באמצעות ניצולם. לדוגמה, שחקן כדורסל שמנסה ללא הרף זריקות מסוגים שונים, מבלי להתמיד בזריקה שהוכחה כיעילה, מסתכן בהחטאות.. כאשר הוא מתמקד יתר על המידה בחקירת אפשרויות, הוא מקבל החלטה להתבסס על אסטרטגיה מוצלחת מאוחר מדי, ולכן אינו מנצל כראוי את האסטרטגיות המוצלחות.
מצד שני, מיצוי מתמיד, ללא איסוף מידע חדש, מונע הסתגלות לשינויים בסביבה. לדוגמה, שחקן כדורסל שממשיך להסתמך על זריקה מאותה נקודה, אף שהיריבים התאימו את ההגנה שלהם, עלול להתקשות לקלוע.
בעוד שההחלטה בדוגמה הראשונה כרוכה בהפסקת החקירה ובהצמדות למיצוי האפשרות שהוכחה כיעילה, הדוגמה השנייה מתמקדת באפשרות לעבור ממיצוי אפשרות שהייתה מתגמלת אך הפכה להיות פחות מתגמלת בשל השינויים בהגנה שעשתה הקבוצה היריבה, אל חקירת חלופות. אף ששתי ההחלטות נכללות במסגרת האיזון בין חקירה למיצוי, הן אינן משקפות בדיוק את אותה פשרה, משום שההקשר שבו מתקבלת ההחלטה ומבנה התגמולים הם שונים.
דוגמאות אלה מראות כי מסגרת החקירה–מיצוי כוללת קשת רחבה של החלטות, וכי אופיו של האיזון תלוי בהקשר הספציפי שבו מתקבלת ההחלטה. לפיכך, נעשה שימוש בפרדיגמות שונות בניסיון ללכוד אופני תפעול שונים של האיזון.
גישות חישוביות יושמו לצורך מידול החלטות פשוטות, המתקבלות פעם אחת ובתנאי תגמול קבועים, וכן לצורך מידול החלטות מורכבות יותר המדמות תנאים מציאותיים יותר, שבהם הסביבה דינמית והתגמולים משתנים לאורך זמן.
מאחר שפרדיגמות שונות עשויות להתאים לשאלות מחקר שונות הקשורות לספורט ולפעילות גופנית, יוצגו שלוש הפרדיגמות הללו בסעיפים הבאים. עבור כל אחת מהן תובא דוגמה הקשורה לספורט או לפעילות גופנית, שתמחיש כיצד ניתן ליישם את הפרדיגמה בפועל. תובא סקירה של המאפיינים הכלליים של הפרדיגמה ויוסבר כיצד ניתן לכמת את התנהגות החקירה–מיצוי בהקשר זה.


חקירה ומיצוי בחיפוש מידע – כיצד לבחור ענף ספורט?


אנשים נדרשים לעיתים קרובות לקבל החלטות הכרוכות בבחירה מתוך רצף של אפשרויות. בחירה כזו מחייבת לעיתים איסוף מידע על האפשרויות השונות לפני קבלת ההחלטה. לדוגמה, כאשר ילד בוחר ענף ספורט חדש, הוא עשוי לבחון תחילה כמה ענפי ספורט (למשל כדורגל, שחייה וטניס), כדי לאסוף מידע על מה שכל אחד מהם מציע. עם זאת, בשלב מסוים הוא יעבור מחקירה למיצוי, ויבחר בענף הספורט שבו יתמקד. מעבר זה משקף דרך אחת לתפעול האיזון בין החקירה למיצוי, והוא מהווה מושג מרכזי בחקר בעיות עצירה אופטימלית – .optimal stopping problems
בעיות עצירה אופטימלית מספקות מסגרת כללית להבנת האופן שבו אנשים מקבלים החלטות כאשר הם נדרשים לבחור מתוך רצף של אפשרויות נתונות. דוגמה פורמלית קלאסית היא בעיית המזכירה – Secretary Problem – שבה המשתתפים צריכים לבחור את המועמד הטוב ביותר לתפקיד לאחר שריאיינו מועמדים בזה אחר זה.
במשימה זו, התפלגות הערכים של האפשרויות אינה ידועה כלל. במילים פשוטות, המגייס אינו יודע עד כמה המועמדים הזמינים טובים או גרועים. באמצעות החקירה נאסף מידע על הערך של כל מועמד ביחס למשרה, וכך ניתן לדרג את המועמדים זה ביחס לזה. לאחר הערכת המועמד הנוכחי, מקבל ההחלטה צריך לבחור אם לקבל אותו או לדחותו. חשוב לציין כי לאחר שמועמד נדחה, לא ניתן לחזור אליו.
המשימה דורשת קבלת החלטה חד-פעמית: מתי להפסיק את שלב החקירה ולהתחייב להעסקת מועמד, ובכך לעבור לניצול התגמול. גישה זו מניחה תגמול קבוע עבור כל בחירה, ודורשת מהמשתתפים להתמודד עם הפשרה בין הסתפקות מוקדמת מדי לבין האפשרות למצוא אפשרות טובה יותר באמצעות המשך החקירה. לפיכך, מטרת המשימה היא להגיע להסתברות הגבוהה ביותר להפסיק את החקירה כאשר מגיעים לאפשרות בעלת הערך הגבוה ביותר.
ניתן למדל אסטרטגיה אופטימלית זו באמצעות כלל סף – cutoff rule – לפי כלל זה, בתחילה האדם אוסף מידע באמצעות הערכה של מספר אפשרויות במהלך שלב החקירה. הערך הגבוה ביותר שנצפה במהלך שלב זה נקבע כסף. לאחר מכן, האדם בוחר באפשרות הראשונה שערכה עולה על סף זה, ובכך עובר לשלב הניצול.
מכיוון שניתן למסגר החלטות יומיומיות רבות כבעיות עצירה אופטימלית, פרדיגמה זו זכתה במהירות לפופולריות במחקר הפסיכולוגי. עם זאת, ההנחות הנוקשות העומדות בבסיס המשימות הקלאסיות, כגון תגמולים קבועים, התפלגויות תגמול שאינן ידועות, היעדר אפשרות לחזור לאפשרויות שנדחו, והצגת הפשרה כבחירה בינארית חד-פעמית, ספגו ביקורת. ביקורת זו הובילה לעלייה ניכרת במחקרים המיישמים את הפרדיגמה תוך שימוש בהנחות פחות נוקשות.
מחקרים בתחומים שונים הראו כי אנשים מקבלים לעיתים קרובות החלטות שאינן אופטימליות במשימות אלה, כגון חקירה מועטה מדי או חקירה רבה מדי. נוסף על כך, נראה כי קבלת התגמול הגדול ביותר האפשרי משתנה בהתאם למידע מוקדם, להבדלים בין-אישיים, למסגרת הזמן, לתחרות במשימה ולרגשות.
אף שהחלטות שונות בספורט ובפעילות גופנית (למשל, בחירת שותף למשחק כדורעף חופים, בחירת מאמן או בחירת ציוד מסוים) יכולות להיות ממוסגרות כבעיות עצירה אופטימלית, וחקר משימות אלה יכול לספק תובנות לגבי עצם התרחשותן של החלטות כאלה ואיכותן, רוב ההחלטות מתקבלות בסביבות דינמיות יותר. לכן נדרשת גישה לאיזון החקירה–מיצוי הכוללת גם התאמות אסטרטגיות.
לדוגמה, נחזור לדוגמה הראשונית של בחירת ענף ספורט. אדם עשוי להעדיף בתחילה כדורגל על פני שחייה, משום שהוא תופס את התגמולים האפשריים בכדורגל כגבוהים יותר. אולם, ככל שהוא ממשיך לחקור ולאסוף מידע נוסף, ההעדפות והתפיסות שלו עשויות להשתנות בעקבות גורמים סביבתיים או פנימיים. שינוי זה עשוי לגרום לו לבחון מחדש את הבחירה הראשונית שלו, ואף להוביל להחלטה לחזור לשחייה.
לפיכך, קבלת החלטות בסביבות דינמיות משקפת לעיתים רחוקות בחירה חד-פעמית. במקום זאת, היא כוללת מעברים חוזרים ונשנים בין מיצוי לחקירה.


חקירה וניצול בחיפוש מזון – מתי לעבור לקבוצה אחרת?


תגמולים אינם תמיד קבועים. כאשר הנסיבות משתנות, גם דרך הפעולה המיטבית משתנה. אם התגמולים הקשורים לאסטרטגיה אינם קבועים אלא דינמיים, קבלת החלטות הסתגלותית הופכת לחיונית. למשל, בספורט ובאימון גופני, נפוץ שאסטרטגיה או פעולה שהיו מוצלחות בתחילה מניבות תמורה הולכת ופוחתת לאורך זמן. "עקרון התמורה הפוחתת" הוא עקרון חשוב באימון. אחרי התחלת תוכנית אימונים רואים כמעט תמיד שיפור בהישגים. כדי להשיג שיפור נוסף מעלים את התדירות, ההיקף והעוצמה של האימונים, אחד מהם או אפילו כמה מהם ביחד. למשל רץ שהתאמן 3 פעמים בשבוע, עבר באימוניו בסך הכל 25 ק"מ בשבוע ומהירות הריצה הממוצעת שלו הייתה 5 דקות לק"מ, מחליט להתאמן 5 פעמים בשבוע, לעבור בשבוע אימונים 40 ק"מ ולרוץ במהירות ממוצעת של 4:50 דקות לק"מ. אחרי מספר שבועות הוא מבצע הגברה נוספת בפרמטרים של האימון אך בשלב מסוים הוא רואה כי למרות שהוא ביצע עליה של ההיקף והעוצמה של האימונים, לא חל שינוי גדול בהישגים או אולי שהם אפילו ההישגים מתחילם להיות פחות טובים. מצב זה מאלץ את הרץ להעריך האם להמשיך בגישה הנוכחית או להסתגל באמצעות חקירת אפשרויות חלופיות.
לדוגמה, דמיינו שאתם נהגי פורמולה 1 (F1) , אך לא סתם נהגי F1, אתם חברי הקבוצה של אלוף העולם ארבע פעמים, מקס וורסטאפן (בשנת 2024). כ״נהג השני״ של הקבוצה, תפקידכם הוא לסייע לוורסטאפן לנצח במרוצים ולצבור נקודות שיבטיחו את זכיית הקבוצה באליפות היצרנים, תוך מתן עדיפות להצלחת הקבוצה על פני ניצחון אישי.
בעוד שהישארות בקבוצה של וורסטאפן – Red Bull Racing – מציעה תגמולים מוכרים כמו: שכר, פופולריות, מכונית תחרותית, מקומות על דוכן המנצחים (סיום בין שלושת הראשונים במרוץ) ואפילו ניצחונות מזדמנים, הצלחתכם האישית עשויה להצטמצם ככל שתפקידכם מתמקד יותר בתמיכה במקס וורסטאפן. עם הזמן, התגמולים הנתפסים הולכים ופוחתים, עשויים להפוך לצפויים יותר, והופכים פחות תואמים למטרות האישיות שלכם. כתוצאה מכך, ערך ההישארות בקבוצה הנוכחית עלול לרדת.
כעת דמיינו שפרארי מציעה לכם מכונית טובה יותר, פוטנציאל גבוה יותר למקומות על דוכן המנצחים, מעמד טוב יותר בתוך הקבוצה ושכר גבוה יותר. לפיכך, מעבר לקבוצה אחרת מבטיח לכאורה תגמולים התחלתיים גבוהים יותר בהשוואה להישארות בקבוצה הנוכחית. מבחינה מנגנונית, ככל שהתגמולים מהמצב הנוכחי פוחתים, עולה ערכן של האפשרויות החדשות שניתן לחקור.
עם זאת, חקירה כרוכה בעלויות. נדרשים זמן, אנרגיה ומאמץ כדי להסתגל לקבוצה חדשה. נוסף על כך, כרוכים בכך אי-ודאות וסיכונים הנוגעים לשאלה אם התגמולים הצפויים אכן יתממשו.
הישארות ב-Red Bull והתגמולים המוכרים הכרוכים בכך מונעות סיכונים אלה, אך כרוכות בעלויות הזדמנות, משום שהמשך מיצוי המצב הנוכחי משמעו אולי ויתור על תגמולים אפשריים גדולים יותר במקומות אחרים.
לסיכום, הסוגיה המרכזית בתרחיש זה היא שהתגמולים מהישארות בקבוצה הנוכחית הולכים ופוחתים בהדרגה, ולכן חקירת האפשרות לעבור לקבוצה חדשה נעשית כדאית כאשר היתרונות של האפשרות הנוכחית אינם עולים עוד על עלויות המעבר.
בסופו של דבר, ההחלטה לעבור מניצול האפשרות הנוכחית לחקירת אפשרות חדשה כרוכה בניתוח עלות–תועלת.
הדוגמה הטיפוסית ביותר, ככל הנראה, לאורגניזם הניצב בפני ניתוח עלות–תועלת בין אפשרות שהתגמולים ממנה הולכים ופוחתים לבין העלויות הכרוכות במעבר לאפשרות חדשה, היא התנהגות חיפוש המזון של בעלי חיים, שבה ההחלטות מתמקדות בחיפוש אחר משאבים חיוניים הדרושים להישרדות. כדי לחקור החלטות מסוג זה באופן שיטתי יותר, פותחו במחקרים בבעלי חיים מטלות חיפוש מזון. במטלות אלה, בעל החיים נע בסביבה שבה נמצאות כמה חלקות (תאי שטח מופרדים). בכל חלקה יש כמות מסוימת של משאבים (מזון). לכל חלקה משויך תגמול מסוים, שלעיתים קרובות ניתן לחיזוי. על הפרט להחליט אם להישאר בחלקה הנוכחית ול״קצור״ את התגמולים הזמינים, כלומר מיצוי, או לעבור לחלקה הבאה, כלומר חקירה, מתוך ציפייה שהמשאבים בה יהיו טובים יותר.
בכל חלקה יש כמות מוגבלת של משאבים, ולכן ככל שהמיצוי נמשך, התגמולים הולכים ומתמעטים בהדרגה, והתועלת שבהישארות בחלקה מתקרבת לאפס. מאחר שמטרתן של מטלות אלה היא להגיע לתגמולים הגבוהים ביותר בטווח הארוך, בשלב מסוים עשוי להיות מוצדק לעזוב את החלקה הנוכחית ולחקור חלקה שבה אולי יש יותר משאבים. עם זאת, המעבר לחלקה החדשה כרוך בעלויות כגון זמן מעבר או השקעת מאמץ.
במטלות חיפוש מזון, החוקרים משנים את עלויות החקירה, את עושרi של החלקות בסביבה, וכן את קצב התגמול הקשור למיצוי, ובכך משפיעים על עלות ההזדמנות של ההישארות בחלקה הנוכחית. אם נחזור לדוגמת הפורמולה 1 שהובאה לעיל, עלויות החקירה עשויות להתבטא במאמץ ובזמן הדרושים להסתגלות לקבוצה חדשה. עושר הסביבה מקביל לתגמולים שקבוצות אחרות עשויות להציע, כגון מכוניות טובות יותר או משכורות גבוהות יותר, בעוד שקצב התגמול הקשור למיצוי משקף את המהירות שבה היתרונות שבהישארות בקבוצת רד בול הולכים ופוחתים.
לסיכום, מטלות חיפוש מזון כוללות סדרה של החלטות בנוגע למועד שבו יש להפסיק להמשיך לנסות למצות את המשאבים הקיימים ומתי לעבור ולחקור משאבים חדשים. לפיכך, מטלות אלה נועדו לבחון את המעברים החוזרים ממיצוי לחקירה בתגובה לירידה בתגמולים ולעלויות הכרוכות בחקירה.
ממצאים אמפיריים מצביעים על כך שמקבלי ההחלטות מסתמכים על התפלגויות התגמולים של האפשרויות הזמינות כדי לבחור את הנקודה האופטימלית למעבר זה. תהליך זה ממודל בדרך כלל במסגרת משפט הערך השולי.
על פי משפט הערך השולי, הבחירות מוכרעות באמצעות כלל סף: על הפרט להפסיק למצות את החלקה הנוכחית ולעבור לחלקה חדשה כאשר התגמול המיידי מהחלקה הנוכחית יורד מתחת לתגמול הממוצע המשוער הזמין בסביבה.
בספורט ובפעילות גופנית, מעבר מאסטרטגיה שהופכת לפחות יעילה הוא דבר נפוץ. הדבר נוגע להחלטות משמעותיות, כגון בחירת מסלול קריירה, אך גם להחלטות קטנות ורגעיות, כמו התאמת הטקטיקה כאשר היריב לומד כיצד להתמודד עם החבטות שלך. מבחינה מושגית, החלטות אלה דומות מאוד לאלה המתקבלות במטלות חיפוש מזון.
מטלות חיפוש מזון יכולות לספק תובנות לגבי האופן שבו אנשים מסתגלים, באמצעות השוואת החלטותיהם לפתרון אופטימלי שנקבע באמצעות מודל. השוואה זו עשויה לחשוף את האסטרטגיות שבהן אנשים משתמשים כדי להגיע לתגמולים הגבוהים ביותר, ועד כמה הן תואמות את האסטרטגיה האופטימלית להשגת תגמולים מרביים, בתנאים שונים הקשורים לספורט.
עם זאת, מצבים רבים בספורט שונים מהפרדיגמות המקובלות של חיפוש מזון בכך שהאפשרויות אינן מוצגות בזו אחר זו אלא בו-זמנית, ולעיתים קרובות מאופיינים באי-ודאות רבה לגבי מה יהיה יעיל בהקשר נתון. כדי לזהות אפשרות שתניב תגמול, נדרשת חקירה ראשונית. נוסף על כך, התגמולים הקשורים לאפשרויות השונות לא רק הולכים ומתמעטים, אלא גם משתנים לאורך הזמן, ולכן קשה עוד יותר לנווט באופן הסתגלותי באיזון שבין חקירה למיצוי.
הדבר מוסיף מורכבות לדילמת החקירה–מיצוי, שכן היא מבקשת לזהות את האיזון האופטימלי בין חקירה למיצוי בסביבה דינמית המשתנה ללא הרף.


חקירה וניצול בלמידת חיזוקים – באילו צמיגים לבחור?


בסביבות דינמיות, האסטרטגיה שמניבה את התגמול הגבוה ביותר משתנה ככל שההקשר מתפתח. נחזור לדוגמה של פורמולה 1. כנהג, עליך לקבל החלטות אסטרטגיות במהלך מרוץ בנוגע לבחירת הצמיגים. עומדים לרשותך כמה סוגי צמיגים: רכים, בינוניים וקשים. התועלת של כל סוג צמיגים במהלך מרוץ מושפעת ממספר גורמים המקיימים ביניהם יחסי גומלין, כגון מזג האוויר, טמפרטורת המסלול, שחיקת הצמיגים ומיקום הנהג במרוץ.
אף שהנהגים (והקבוצות שלהם) מודעים היטב לכך שלגורמים אלה יש חשיבות, העיתוי המדויק של השפעתם, עוצמתה והאינטראקציה ביניהם נותרים בלתי ודאיים ומשתנים באופן דינמי. לדוגמה, סוג צמיד מסוים עלול לאבד לפתע אחיזה במסלול, או לחלופין להחזיק מעמד זמן רב יותר מהצפוי, בהתאם להתפתחות המרוץ.
משמעות הדבר היא שהתגמולים היחסיים של האפשרויות השונות משתנים באופן בלתי צפוי, ובכל הקפה ניצבים הנהגים בפני אותה שאלה בסיסית: האם להמשיך למצות את הבחירה הנוכחית, או לחקור חלופה בתקווה להסתגל למבנה תגמולים מתפתח אך בלתי ודאי?
אי-ודאות זו נעשית חריפה עוד יותר כאשר מתעוררים תנאים בלתי צפויים. לדוגמה, נהג קבוצת מקלארן, לנדו נוריס, הוביל את הגרנד פרי של רוסיה בשנת 2021, כאשר החל לרדת גשם כבד. באותו רגע ניצבה בפניו דילמה: הוא יכול היה להיכנס לרחבת הטיפולים ולהחליף לצמיגים המיועדים לתנאי גשם, אך בכך הסתכן באובדן ההובלה בשל הזמן שהיה מאבד בעצירה ברחבת הטיפולים. לחלופין, הוא יכול היה להמשיך עם צמיגי סליקס, תוך הסתכנות באובדן השליטה במכונית על המסלול החלקלק. חשוב לציין שאף אחת מהאפשרויות לא הבטיחה הצלחה, ולא היה ברור איזו אסטרטגיה תגדיל את סיכוייו לנצח. למרות שירד מהמסלול כמה פעמים, נוריס סירב להיכנס לרחבת הטיפולים ולהחליף לצמיגי ביניים, בניגוד לעצת המהנדסים שלו, לאחר שצבר פער של 50 שניות מהמקום השלישי. לואיס המילטון נשאר בתחילה על המסלול כדי להיאבק בנוריס על ההובלה, לפני שעבר לצמיגי ביניים בהקפה שלאחר מכן, ואז התברר שהגשם צפוי להימשך. גם סרחיו פרס, אלונסו ולקלר בחרו להמשיך עם צמיגי סליקס, בעודם נאבקים זה בזה בצמוד על המקום השלישי. המילטון יצא מרחבת הטיפולים כשהוא מפגר ב-25 שניות אחרי מוביל המרוץ, וצמצם את הפער לפחות משתי שניות בהקפה 51, לפני שנוריס החליק על שכבת מים ויצא מהמסלול בפנייה 5. בעקבות זאת עבר המילטון להוביל וניצח במרוץ. הנהגים שעצרו מוקדם, ורסטפן, סיינץ וריקיארדו, עקפו את שלושת הנהגים שהמשיכו עם צמיגי סליקס ונאבקו על המקום השלישי. אלונסו ופרס נכנסו בסופו של דבר לרחבת הטיפולים בהקפה 51 והצליחו להישאר בין צוברי הנקודות, אך לקלר המשיך ללא עצירה וצנח מהמקום הרביעי למקום ה-15 בשתי ההקפות האחרונות שלו. נוריס נכנס לבסוף לרחבת הטיפולים כדי להחליף לצמיגי ביניים בהקפה 52 (מתוך 53, אורכה של כל הקפה היה 5.848 ק"מ). הוא סיים את המרוץ במקום השביעי.

נוריס מחליק במרוץ המכוניות ברוסיה ב-2021
נוריס מחליק במרוץ המכוניות ברוסיה ב-2021

בתמונה: נוריס מחליק בגשם במרוץ המכוניות ברוסיה ב-2021


מצב זה מהווה דילמה של ממש: הנהג ניצב בפני כמה אפשרויות שהתגמול הצפוי מכל אחת מהן אינו ודאי, ונדרש לאזן בין סיכונים מיידיים לבין תגמולים פוטנציאליים בטווח הארוך. באופן רחב יותר, החלטות מסוג זה מבטאות את הפשרה בין חקירה, שנועדה להפחית את אי-הוודאות ולשפר אולי את התוצאות בעתיד, לבין מיצוי של תגמולים מיידיים שכבר מוכרים לנו.
פשרה זו נחקרת בדרך כלל באמצעות מטלות שודד בעל n זרועות – n-armed bandit .tasks במטלת שודד בעל n זרועות שאינו נח – restless n-armed bandit task – על הפרט לבחור בין כמה מכונות מזל (או ״זרועות״), שכל אחת מהן מציעה תגמולים שונים, במטרה להגיע לתשואה הגבוהה ביותר האפשרית.
ערכי התגמול הקשורים לכל אחת מהזרועות אינם ידועים ואינם נייחים, כלומר הם משתנים באופן דינמי. סביבה דינמית זו יוצרת רמה גבוהה של אי-ודאות, המעודדת חקירה לצורך איסוף מידע על ערכי התגמול הקשורים לכל אחת מהאפשרויות. מידע זה ניתן להשגה רק באמצעות בחירת האפשרות המתאימה והתבוננות בתגמול שהיא מניבה.

מכונות מזל
מכונות מזל

בתמונה: שורה של מכונות מזל. באיזו מהן לבחור?


עם זאת, אופיים הלא-נייח של התגמולים מבטיח שרמה מסוימת של אי-ודאות תמיד תישאר. בכל ניסיון ניצב הפרט בפני דילמה: האם לנצל את האפשרות הטובה ביותר הידועה כיום (דבר הכרוך בעלויות הזדמנות, שכן תגמולים גבוהים יותר עשויים לחמוק ממנו), או להמשיך לחקור כדי לגלות אולי יש אפשרות טובה יותר.
מטרת החקירה היא להפחית את אי-הוודאות ואילו מטרת המיצוי היא לקבל את התגמולים המיידיים הגבוהים ביותר. כדי לקבל את התגמולים הגבוהים ביותר בטווח הארוך בסביבה המשתנה באופן דינמי, הדגש עובר ממעבר פשוט בין חקירה למיצוי אל מציאת האיזון האופטימלי בין השניים.
פתרון אנליטי של האיזון האופטימלי בין חקירה לניצול בפרדיגמות מורכבות הוא לעיתים קרובות בלתי אפשרי מבחינה חישובית אך ניתן להשתמש בגישות מקורבות רבות כדי להנחות את קבלת ההחלטות. השיטות נבדלות זו מזו במקור המידע שבו הן משתמשות כדי לקבוע את ההסתברות לבצע חקירה.
גישה פופולרית אחת היא להשתמש בפונקציית Softmax (סופטמקס), שבה לבחירה בעלת הערך הגבוה ביותר יש ההסתברות הגבוהה ביותר להיבחר (מיצוי), אך גם האפשרויות האחרות נחקרות בהסתברות שאינה אפס, התלויה באומדן הערך הנוכחי שלהן. למעשה, סופטמקס מיישמת גישה זהירה, המשלבת התמקדות במיצוי עם נטייה לחקירה תוך התחשבות בעלויות.
גישה פופולרית נוספת, המכונה כלל הגבול העליון של רווח הסמך – Upper Confidence Bound – UCB – מתמקדת באופן ישיר יותר באיסוף מידע, ולכן נוטה לחקור אפשרויות שעליהן ידוע הכי פחות, גם כאשר אומדן התגמול שלהן נמוך.
לבסוף, גישה אקראית לחלוטין מיושמת באסטרטגיית ε-greedy (אפסילון־גרידי), שבה משתמשים פשוט בהסתברות קבועה כדי לחקור באופן אקראי כל אחת מהאפשרויות שאינה האפשרות הטובה ביותר, ללא קשר לערכה או לרמת אי-הוודאות לגביה.
מעניין לציין שגישות מקורבות שונות אלה עשויות להציג רמות הצלחה שונות, בהתאם לסביבה. באופן כללי, מחקרים על קבלת החלטות בבני אדם מצביעים על כך שבני אדם מתאימים באופן גמיש את השימוש שלהם בגישות חקירה אקראיות יותר או מכוונות יותר לתנאים הנוכחיים.
כפי שמודגש באמצעות בחירתנו בגישות המקורבות, מידול של החלטות בהקשרים דינמיים מסוג זה תלוי ביעדים הספציפיים המנחים את האופן שבו מתאמנים או ספורטאים מאזנים בין חקירה למיצוי בתהליך קבלת ההחלטות שלהם.


מקור:


Rewitz, K., Schuck, N. W., & Wolff, W. (2026). The explore-exploit trade-off in sports and exercise: A primer on empirical and computational approaches. Psychology of Sport and Exercise, 83, 103036.
https://doi.org/10.1016/j.psychsport.2025.103036



יש לך שאלה למומחים של המרכז האקדמי לוינסקי-וינגייט? אין צורך להתבייש, רק ללחוץ כאן