You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
ML-For-Beginners/8-Reinforcement/1-QLearning/translations/assignment.az.md

3.9 KiB

Daha Real Dünya

Bizim vəziyyətimizdə Piter, demək olar ki, yorulmadan və ac qalmadan hərəkət edə bilirdi. Daha realist bir dünyada isə zaman-zaman oturub dincəlməli, həm də qidalanmalı oluruq. Aşağıdakı qaydaları həyata keçirməklə dünyamızı daha real edək:

  1. Bir yerdən başqa yerə köçməklə Piter enerjisini itirir və bir qədər yorğunluq qazanır.
  2. Piter alma yeməklə daha çox enerji qazana bilər.
  3. Piter ağacın altında və ya çəmənlikdə dincəlməklə yorğunluqdan qurtula bilər (yəni ağac və ya ot olan bir xanaya getmək - yaşıl sahə)
  4. Piter canavarı tapıb öldürməlidir
  5. Qurdu öldürmək üçün Piterin müəyyən enerji və yorğunluq səviyyəsinə malik olması lazımdır, əks halda o, döyüşü uduzur.

Təlimatlar

Həlliniz üçün başlanğıc nöqtəsi kimi orijinal notebook.ipynb noutbukundan istifadə edin.

Yuxarıdakı mükafat funksiyasını oyunun qaydalarına uyğun olaraq dəyişdirin. Oyunda qalib gəlmək üçün lazım olan ən yaxşı strategiyanı öyrənmək üçün isə gücləndirilmiş öyrənmə alqoritmini işlədin və təsadüfi gedişin nəticələrini qazandığınız və itirdiyiniz oyunların sayına görə alqoritminizlə müqayisə edin.

Qeyd: Yeni dünyanızda insanın mövqeyindən əlavə, yorğunluq və enerji səviyyələri də olduğuna görə vəziyyət daha mürəkkəbdir. Siz vəziyyəti bir qrup kimi təqdim etməyi seçə bilərsiniz(Board, enerji, yorğunluq) və ya vəziyyət üçün bir sinif yarada bilə(onu Board-dan da alt sinif olaraq yaratmağınız mümkündür) və ya rlboard.py içərisindəki orijinal Board sinfini dəyişdirə bilərsiniz.

Həllinizdə, lütfən, kodu təsadüfi gediş strategiyasına cavab verəcək formada saxlayın və ən sonda alqoritminizin nəticələrini təsadüfi gedişlə müqayisə edin.

Qeyd: Onun işləməsi üçün hiperparametrləri, xüsusən də dövrlərin sayını tənzimləməlisiniz. Oyunun uğuru(canavarla mübarizə) nadir bir hadisə olduğundan, daha uzun məşq vaxtı gözləmək olar.

Rubrika

Meyarlar Nümunəvi Adekvat İnkişaf Etdirilməli Olan
Yeni dünya qaydalarının tərifi, Q-Öyrənməsi alqoritmi və bəzi mətn izahatları ilə notebook təqdim olunur. Q-Öyrənməsi təsadüfi gedişlə müqayisədə nəticələri əhəmiyyətli dərəcədə yaxşılaşdıra bilir. Notebook təqdim olunur, Q-Öyrənməsi həyata keçirilir və təsadüfi gedişlə müqayisədə nəticələri yaxşılaşdırsa, əhəmiyyətli dərəcədə deyil; və ya notebook zəif sənədləşdirilib və kod yaxşı strukturlaşdırılmayıb Dünyanın qaydalarını yenidən müəyyən etmək üçün bəzi cəhdlər edilib, lakin Q-Öyrənməsi alqoritmi işləmir və ya mükafat funksiyası tam müəyyən edilməyib.