|
|
|
|
Рейтинг 4.91/11:
|
|
8 / 8 / 12
Регистрация: 16.05.2014
Сообщений: 151
|
|
Обучение агента методом Монте Карло27.01.2019, 12:07. Показов 2738. Ответов 26
Метки нет (Все метки)
Здравствуйте. Пытаюсь разобраться с методом Монте Карло.
Есть среда состоящая из пяти состояний связанных в линейный отрезок: Агент может за одно действие перейти в соседнее состояние, т.е. из S1в S2, из S3 в S4, соответственно варианты действий в каждом состоянии у агента A = {влево, вправо}. В крайних состояниях(S1 и S5) действия влево и вправо соответственно оставляют агента в том же состоянии. В одном из состояний находится агент, другое случайным образом выбранное состояние является терминальным. Задачей агента является добраться в терминальное состояние, после чего другое состояние будет выбрано терминальным и уже туда нужно будет добраться агенту, и т.д. Правильно ли я понимаю, что стратегия поведения агента будет определятся функцией ценности действия а в состоянии s, а само состояние будет описано координатой состояния и координатой терминального состояния(к примеру если терминальное состояние S5 то состояние S1 будет описано как {1,5})? Тогда получается что необходимо будет хранить 5^2 состояний и для каждого по ценности двух действий?
0
|
|
| 27.01.2019, 12:07 | |
|
Ответы с готовыми решениями:
26
Программа для вычисления интеграла с заданной точностью методом Симпсона и методом Монте-Карло вычисление pi методом монте карло Интеграл методом Монте-Карло |
|
821 / 580 / 75
Регистрация: 20.09.2014
Сообщений: 3,826
|
||
| 31.01.2019, 16:15 | ||
|
0
|
||
|
8 / 8 / 12
Регистрация: 16.05.2014
Сообщений: 151
|
|||||
| 01.02.2019, 07:40 [ТС] | |||||
|
Q(X, ->) = 1 Q(X, <-) = 0.1 Q(Y, ->) = 0.1 Q(Y, <-) = 1 В остальном в принципе согласен. Добавлено через 3 минуты А вообще что бы как то адекватно поступить в каком либо состоянии, агент должен будет побывать заранее в этом состоянии хоть раз? То есть тут не получиться какого то универсального решения?
0
|
|||||
| 01.02.2019, 10:00 | |
|
Darkos,
я решил немного по-экспериментировать и написал программу, которая подсчитывает число шагов, чтобы попасть точку 5. Вот результаты (примерное число шагов на 1000 попыток) 1 => 5 (20 шагов) 2 => 5 (18 шагов) 3 => 5 (13 шагов) 4 => 5 (8 шагов) 5 => 5 (3 шагов) (здесь программа дает возможность сделать один шаг), в противном случае число шагов равно 0. ... примечание линейной зависимости не наблюдается...
0
|
|
|
8 / 8 / 12
Регистрация: 16.05.2014
Сообщений: 151
|
|
| 02.02.2019, 12:59 [ТС] | |
|
В итоге могу сказать что задача решена, если кому интересно могу выложить исходники моей реализации.
Некоторые вопросы остаются открытыми, в частности: Возможно ли построение универсальной системы, которая будет действовать в незнакомой среде не случайным образом? Или стратегия формируется чисто на основе обучающих состояний и агент будет уметь действовать только в этих самых состояниях?
0
|
|
| 02.02.2019, 16:51 | ||
|
0
|
||
|
8 / 8 / 12
Регистрация: 16.05.2014
Сообщений: 151
|
|
| 03.02.2019, 16:11 [ТС] | |
|
нтч, я немного не за то. Если к примеру разрабатывать бота для RTS, и противник будет действовать нестандартно то не получится ли что бот столкнувшись с этим начнет действовать случайным образом? Должна же оставаться хоть какая то стратегия.
0
|
|
| 03.02.2019, 17:09 | |
|
Darkos,
стратегия в незнакомой среде должна основываться на цели. пример. Допустим человек не умеет играть в шашки. Но ему сказали, что его цель - это "съесть" все шашки противника и стараться не терять свои шашки. Так начинают играть все новички и постепенно выучиваются стратегии и тактики игры в шашки.
0
|
|
| 03.02.2019, 17:09 | |
|
Площадь методом Монте-Карло Вычислить методом Монте-Карло
Интегрирование методом Монте-Карло Нахождение Пи, методом Монте - карло Искать еще темы с ответами Или воспользуйтесь поиском по форуму: |
|
Новые блоги и статьи
|
|||
|
Скрипты Tampermonkey для CyberForum, ChatGPT, Claude и пр.
Jin X 06.09.2026
Скрипты Tampermonkey для CyberForum, ChatGPT, Claude и пр.
Работая с форумом и нейросетями в браузере часто хочется что-то подкорректировать или добавить какого-то функционала.
Ниже прикреплён. . .
|
Программа опроса у.з. расходомера SLS-720F
Argus19 02.09.2026
Программа опроса у. з. расходомера SLS-720F
Программа опрашивает один раз в минуту три ультразвуковых расходомера SLS-720F через интерфейс RS-485 по протоколу Modbus RTU.
Опрашиваются регистры. . .
|
Hyper-V: Компьютер должен поддерживать доверенный платформенный модуль 2.0.
Maks 31.08.2026
При установке Windows 11 на виртуальную машину Hyper-V 2-го поколения вылезла такая ошибка:
Решение: в параметрах виртуальной машины, в разделе "Безопасность" (Security) активировать флаг. . .
|
Архитектура биовида Стива в Майнкрафте: Зачем бонобо кубический каннибализм
anaschu 30.08.2026
Кубический Вагинокапитализм в Minecraft: Математический инвариант ОДУ и рок Стивов-бонобо
Главная задача разработанной «Модели Всего» — наглядно продемонстрировать наличие системной «судьбы». . .
|
|
Оттачиваю умение писать js программы.
russiannick 30.08.2026
Проектом выходного дня стало написание Книги шифров Виженера. Итогом стала версия 200, синий туман.
Синий туман назван так, потому что замораживает текст под собой. Нажатие синих кнопок управляют. . .
|
мат медиц модель 30. презентация проекта
anaschu 27.08.2026
хоп хоп хоп хидахоп, а я кладую))
|
Как у меня протекала болезнь
zorxor 27.08.2026
Здравствуйте, друзья! Эта запись блога предназначена именно для вас - для моих дорогих друзей, которые знали меня лично. Чтобы ответить на вопрос - а что же со мной произошло на самом деле? Я учился. . .
|
Нашел вот забавное видео о измерениях. Лучшее что я видел на эту тему
kumehtar 26.08.2026
ILETXiw9bMQ
Основная суть и тезисы по измерениям:
0D (Нулевое измерение): точка, не имеющая длины, ширины, высоты или объема.
Объект не может перемещаться в 0D.
1D (Первое измерение):. . .
|