Форум программистов, компьютерный форум, киберфорум
ИИ, нейросети, LLM, ML, Data Science, ИИ-агенты
Войти
Регистрация
Восстановить пароль
Блоги Сообщество Поиск  
 
 
Рейтинг 4.91/11: Рейтинг темы: голосов - 11, средняя оценка - 4.91
8 / 8 / 12
Регистрация: 16.05.2014
Сообщений: 151

Обучение агента методом Монте Карло

27.01.2019, 12:07. Показов 2738. Ответов 26
Метки нет (Все метки)

Студворк — интернет-сервис помощи студентам
Здравствуйте. Пытаюсь разобраться с методом Монте Карло.

Есть среда состоящая из пяти состояний связанных в линейный отрезок:
Название: states.PNG
Просмотров: 56

Размер: 1.4 Кб

Агент может за одно действие перейти в соседнее состояние, т.е. из S1в S2, из S3 в S4, соответственно варианты действий в каждом состоянии у агента A = {влево, вправо}. В крайних состояниях(S1 и S5) действия влево и вправо соответственно оставляют агента в том же состоянии.

В одном из состояний находится агент, другое случайным образом выбранное состояние является терминальным. Задачей агента является добраться в терминальное состояние, после чего другое состояние будет выбрано терминальным и уже туда нужно будет добраться агенту, и т.д.

Правильно ли я понимаю, что стратегия поведения агента будет определятся функцией ценности действия а в состоянии s, а само состояние будет описано координатой состояния и координатой терминального состояния(к примеру если терминальное состояние S5 то состояние S1 будет описано как {1,5})? Тогда получается что необходимо будет хранить 5^2 состояний и для каждого по ценности двух действий?
0
cpp_developer
Эксперт
20123 / 5690 / 1417
Регистрация: 09.04.2010
Сообщений: 22,546
Блог
27.01.2019, 12:07
Ответы с готовыми решениями:

Программа для вычисления интеграла с заданной точностью методом Симпсона и методом Монте-Карло
Здравствуйте, подскажите как решить эту задачу, пожалуйста: Разработать программу для вычисления интеграла с заданной точностью методом...

вычисление pi методом монте карло
вот прога ,но она результат pi всегда не более 1,... в чем ошибка понять не могу. const n=10000; var x,y,pi:real; a:integer;i,...

Интеграл методом Монте-Карло
Добрый день. Неполучается написать код для метода монте-карло. Помогите пожалуйста. fun = sin(x) { srand(time(NULL)); double...

26
821 / 580 / 75
Регистрация: 20.09.2014
Сообщений: 3,826
31.01.2019, 16:15
Студворк — интернет-сервис помощи студентам
Цитата Сообщение от Darkos Посмотреть сообщение
могу ли я в процессе модифицировать состояние?
Ну только в случае подобной структуры графа. Стоит структуру графа изменить с линейной на структуру с ответвлениями....
0
8 / 8 / 12
Регистрация: 16.05.2014
Сообщений: 151
01.02.2019, 07:40  [ТС]
Цитата Сообщение от нтч Посмотреть сообщение
1. симметрия (пример {1, 5} = {5, 1} или (2, 3) = (3, 2))
Думаю что нет, ведь это противоположные состояния, и действовать в них нужно будет противоположно. То есть если обозначить состояния (2, 3) как "Х" а (3, 2) как "Y", то оценки действий будут соответственно
Q(X, ->) = 1
Q(X, <-) = 0.1

Q(Y, ->) = 0.1
Q(Y, <-) = 1

Цитата Сообщение от нтч Посмотреть сообщение
2. если новое терминальное состояние совпадает со старым (например {3, 3}), то никуда двигаться не надо. Такие состояния {1, 1}; {2, 2}; {3, 3}; {4, 4}; {5, 5} можно обозначить числом 0?
Я предполагал исключить такие случаи.

Цитата Сообщение от нтч Посмотреть сообщение
4. кроме всего прочего, чтобы различать направление движения, достаточно охарактеризовать движение вправо положительным числом (например +1), а влево - отрицательным (например -1)
Я пока не понимаю как это использовать.

В остальном в принципе согласен.

Добавлено через 3 минуты
Цитата Сообщение от Mikhaylo Посмотреть сообщение
Стоит структуру графа изменить с линейной на структуру с ответвлениями....
Ну я рассматривал конкретный случай.

А вообще что бы как то адекватно поступить в каком либо состоянии, агент должен будет побывать заранее в этом состоянии хоть раз? То есть тут не получиться какого то универсального решения?
0
1104 / 480 / 33
Регистрация: 05.07.2018
Сообщений: 1,870
Записей в блоге: 8
01.02.2019, 10:00
Darkos,
я решил немного по-экспериментировать и написал программу, которая
подсчитывает число шагов, чтобы попасть точку 5. Вот результаты
(примерное число шагов на 1000 попыток)
1 => 5 (20 шагов)
2 => 5 (18 шагов)
3 => 5 (13 шагов)
4 => 5 (8 шагов)
5 => 5 (3 шагов) (здесь программа дает возможность сделать один шаг),
в противном случае число шагов равно 0.
...
примечание
линейной зависимости не наблюдается...
0
8 / 8 / 12
Регистрация: 16.05.2014
Сообщений: 151
02.02.2019, 12:59  [ТС]
В итоге могу сказать что задача решена, если кому интересно могу выложить исходники моей реализации.

Некоторые вопросы остаются открытыми, в частности:
Возможно ли построение универсальной системы, которая будет действовать в незнакомой среде не случайным образом? Или стратегия формируется чисто на основе обучающих состояний и агент будет уметь действовать только в этих самых состояниях?
0
1104 / 480 / 33
Регистрация: 05.07.2018
Сообщений: 1,870
Записей в блоге: 8
02.02.2019, 16:51
Цитата Сообщение от Darkos Посмотреть сообщение
Возможно ли построение универсальной системы, которая будет действовать в незнакомой среде не случайным образом? Или стратегия формируется чисто на основе обучающих состояний и агент будет уметь действовать только в этих самых состояниях?
Человек тоже универсальная система. Но и он без обучения в незнакомой среде мало что стоит. То есть обучение (полное или частичное) необходимо. А так, получится: пойди туда - не знаю куда, принеси то - не знаю что.
0
8 / 8 / 12
Регистрация: 16.05.2014
Сообщений: 151
03.02.2019, 16:11  [ТС]
нтч, я немного не за то. Если к примеру разрабатывать бота для RTS, и противник будет действовать нестандартно то не получится ли что бот столкнувшись с этим начнет действовать случайным образом? Должна же оставаться хоть какая то стратегия.
0
1104 / 480 / 33
Регистрация: 05.07.2018
Сообщений: 1,870
Записей в блоге: 8
03.02.2019, 17:09
Darkos,
стратегия в незнакомой среде должна основываться на цели.
пример.
Допустим человек не умеет играть в шашки. Но ему сказали, что его цель -
это "съесть" все шашки противника и стараться не терять свои шашки.
Так начинают играть все новички и постепенно выучиваются стратегии
и тактики игры в шашки.
0
Надоела реклама? Зарегистрируйтесь и она исчезнет полностью.
raxper
Эксперт
30234 / 6612 / 1498
Регистрация: 28.12.2010
Сообщений: 21,154
Блог
03.02.2019, 17:09

Площадь методом Монте-Карло
Нужно найти площадь заштрихованной области методом Монте-Карло в частности нужны условия попадания точек в эту область

Вычислить методом Монте-Карло
Помогите Вычислить методом Монте-Карло: а)площадь фигуры, ограниченной половиной синусоиды; б)площадь фигуры, ограниченной квадратной...

вычисление методом монте карло
шарю в инете и не могу найти внятного объяснения метода монте карло для вычисления площади круга (хотя бы пока площади) круг...

Интегрирование методом Монте-Карло
доброго времени суток форумчане, была поставлена задача написать программу которая будет вычислять интеграл методом Монте-Карло вот что я...

Нахождение Пи, методом Монте - карло
Добрый день, прошу помощи в реализации графического отображения. код работает, но нужно сделать наглядное отображение, чтобы в квадрат...


Искать еще темы с ответами

Или воспользуйтесь поиском по форуму:
27
Ответ Создать тему
Новые блоги и статьи
Скрипты Tampermonkey для CyberForum, ChatGPT, Claude и пр.
Jin X 06.09.2026
Скрипты Tampermonkey для CyberForum, ChatGPT, Claude и пр. Работая с форумом и нейросетями в браузере часто хочется что-то подкорректировать или добавить какого-то функционала. Ниже прикреплён. . .
Программа опроса у.з. расходомера SLS-720F
Argus19 02.09.2026
Программа опроса у. з. расходомера SLS-720F Программа опрашивает один раз в минуту три ультразвуковых расходомера SLS-720F через интерфейс RS-485 по протоколу Modbus RTU. Опрашиваются регистры. . .
Hyper-V: Компьютер должен поддерживать доверенный платформенный модуль 2.0.
Maks 31.08.2026
При установке Windows 11 на виртуальную машину Hyper-V 2-го поколения вылезла такая ошибка: Решение: в параметрах виртуальной машины, в разделе "Безопасность" (Security) активировать флаг. . .
Архитектура биовида Стива в Майнкрафте: Зачем бонобо кубический каннибализм
anaschu 30.08.2026
Кубический Вагинокапитализм в Minecraft: Математический инвариант ОДУ и рок Стивов-бонобо Главная задача разработанной «Модели Всего» — наглядно продемонстрировать наличие системной «судьбы». . .
Оттачиваю умение писать js программы.
russiannick 30.08.2026
Проектом выходного дня стало написание Книги шифров Виженера. Итогом стала версия 200, синий туман. Синий туман назван так, потому что замораживает текст под собой. Нажатие синих кнопок управляют. . .
мат медиц модель 30. презентация проекта
anaschu 27.08.2026
хоп хоп хоп хидахоп, а я кладую))
Как у меня протекала болезнь
zorxor 27.08.2026
Здравствуйте, друзья! Эта запись блога предназначена именно для вас - для моих дорогих друзей, которые знали меня лично. Чтобы ответить на вопрос - а что же со мной произошло на самом деле? Я учился. . .
Нашел вот забавное видео о измерениях. Лучшее что я видел на эту тему
kumehtar 26.08.2026
ILETXiw9bMQ Основная суть и тезисы по измерениям: 0D (Нулевое измерение): точка, не имеющая длины, ширины, высоты или объема. Объект не может перемещаться в 0D. 1D (Первое измерение):. . .
КиберФорум - форум программистов, компьютерный форум, программирование
Powered by vBulletin
Copyright ©2000 - 2026, CyberForum.ru