דילוג לתוכן

למידת חיזוק

Reinforcement learning

למידת חיזוק (נקרא גם: למידה באמצעות חיזוקים; באנגלית: Reinforcement learning או בקיצור: RL) הוא תחום במדעי המחשב של למידת מכונה הנוגע לאופן שבו סוכנים פועלים בסביבה דינמית באופן שימקסם את הרווח המצטבר כתוצאה מהפעולות הללו. למידת חיזוק נחשבת לאחת משלוש הפרדיגמות של למידת מכונה, לצד למידה מונחית (Supervised learning) ולמידה בלתי מונחית (Unsupervised learning).

עודכן ב־

בעמוד הזה

איך זה קשור לאוטומציה?

למידת חיזוק מאמנת סוכן לפי תגמול מהסביבה ולא לפי דוגמאות מסומנות בלבד. באוטומציה עסקית היא נדירה יחסית; רוב הסוכנים עובדים לפי כללים, כלים ומודל שפה, לא לפי אימון תגמול מתמשך.

דוגמאות שימוש באוטומציה

הדוגמאות להמחשה. את החיבורים והכללים מתאימים למערכות ולתהליך של העסק.

צוות בוחן מודל שמציע סדר פעולות לשירות. התגמול נמדד לפי סגירת פנייה נכונה בסביבת סימולציה. אין חיבור לגבייה או לשינוי מחיר בלי אישור אדם, גם אם המודל מקבל ציון גבוה.

באילו כלים זה רלוונטי?

LangGraph
אפשר לבנות סוכן עם שלבים ואישור אדם; זה אינו אימון למידת חיזוק כשלעצמו אלא שליטה בזרימה.

מה חשוב לבדוק לפני שמיישמים?

  • תגמול שגוי מלמד את הסוכן לקצר שיחות או לאשר הנחות בלי שהעסק התכוון לכך.

מונחים שיעזרו להעמיק

מקורות והמשך קריאה