Ofer Shapira

רובוטים תמיד ידעו לבצע פקודות, עכשיו הם מתחילים להבין *הקשרים* כמו בני אדם.

פורסם במקור ב LinkedIn

רובוטים תמיד ידעו לבצע פקודות, עכשיו הם מתחילים להבין *הקשרים* כמו בני אדם.

במהלך שנים, רובוטיקה התבססה על תגמולים פשוטים וקבועים מראש: משימות כמו "הרם את הקופסה" או "הימנע ממכשול" תוגמלו בנקודות.
שיטה ברורה, אך מוגבלת. ברגע שהמשימה מסתבכת או משתנה מעט, האלגוריתם מתבלבל.

אלגוריתם חדש בשם GRPO, שפותח לאחרונה על ידי DeepSeek, מציע גישה אחרת לגמרי: במקום לתגמל פעולה ספציפית, הוא מעריך את כלל הפעולות שבוצעו ומעניק תגמול יחסי. המשמעות: למידה שמבוססת על השוואה בין ניסיונות שונים, בדומה לאופן שבו בני אדם משתפרים.

המודל הזה כבר חולל פריצת דרך בלמידת חיזוק של מודלים שפתיים (LLMs), אבל הפוטנציאל האמיתי עשוי להתגלות דווקא בעולם הפיזי - תארו לכם רובוט שלומד לא רק מהצלחה או כישלון, אלא מהבדלים עדינים בין ניסיונות. כמו ילד שלומד לרכב על אופניים, כל פעם קצת יותר טוב.

אם זה יעבוד - זו לא תהיה עוד קפיצת מדרגה ביכולת של רובוטים לבצע משימות, זו תהיה קפיצת מדרגה בדרך שבה הם לומדים.

מקור: https://lnkd.in/dvdPzsdM