GotAI.NET
Форум: Проблемы искусственного интеллекта
Регистрация
|
Вход
Все темы
|
Новая тема
Стр.20 (26)
<<
< Пред.
|
След. >
>>
Поиск:
Автор
Тема: На: Управление агентами
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 4:15
Цитата:
Автор: daner
среда логически разбивается на состояния и награды -- то не считаю злом
Зло конечно есть, и те кто здесь высказывались именно на это и напирали ...
Но я не столько принципиальный, т.к. в отличии от них совершенно четко понимаю, что не упращая вначале задачу - результата не получить ... но просто надо отдавать себе отчет в том, где задача упращается, чтобы потом не выдавать желаемое за действительное (к сожалению я это часто наблюдаю - и даже несколько преуспел в "Развеявании мифов"
)
[
Ответ
][
Цитата
]
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 4:20
Цитата:
Автор: daner
вся Q таблица -- это прогноз Выгодности состояния.
Только в смысле планирования ... и не больше ... В состоянии которого агент никогда не встречал - НИКАКОГО прогноза сделано не будет !
[
Ответ
][
Цитата
]
daner
Сообщений: 4633
На: Управление агентами
Добавлено: 19 окт 09 13:45
QUOTE's Автор: tac
Цитата:
Ну, в QFix - это так ... а "применение функции МАХ" особой погоды не делает ... хотя понимаю, что теоритически моделирует историю ...
это только вашему qfix минус, потому-что еще как делает. И если даже без нее, то нужно было бы что-то вместо (например как в алгоритме sarsa).
Цитата:
Ну, для ИНС - нужно вводить обратные связи ... и нет особых проблем ...
ожидал...
а конкретнее, откуда куда связи?
Цитата:
"А про РАНО говорилось о другом. О трансформации части сложной награду в скалярную величину. это не то о чем вы сейчас говорите."
Ну, предметно о другом ... но алгоритм будет тот же ... трансформация состояний в награду - это точно та же задача ...
не знаю... может и так, но я общего между ними не вижу. ВООБЩЕ.
[
Ответ
][
Цитата
]
daner
Сообщений: 4633
На: Управление агентами
Добавлено: 19 окт 09 14:01
QUOTE's Автор: tac
Цитата:
Ну, и потом сведя QL к QFix, где я еще больше ввел явных сущностей, которые неявно присутствуют в QL.
Не в коем случае, особенно после услышанного о функции Update. Это делает qfix не просто недоказанным на предмет справляемости с МДП...
я в своей работе тоже подобное изменение применил, но меня тогда спасло то, что я работал со средой только из двух состояний и переходов в самого себя не было. Вот тогда мах не имеет смысла (это математически очевидно). Но это же меня оставило в очень жестких рамках задачи координации, а не вообще. (с другой стороны мне этого за глаза хватало).
Цитата:
Думаю во все "поглощающем подходе сетевиков" меня обвинить сложно
И здесь мы меняемся ролями - QL по отношению к QFix здесь уже выглядит как сделать сеть похитрее - бац и все .... поэтому мы просто говорим даже не о подходах, а о разных уровнях гибкости алгоритма ....
Совсем не так. q-таблица имеет очень четкий логический смысл. (1) это мат.ожидание прибыли (причем формально доказано, что это именно оно самое) (2) логически четкий алгоритм updata, который заполняет q-таблицу по принципу динамического программирования, на основе рекурсивной функции. Так что... никакого "бац" тут нет.
И именно поэтому, когда делаешь модификацию Q-learning необходимо понимать, что "что-то ты безусловно портишь", но если это оправданно (чем-то) тогда другой разговор.
А у вас оно чем оправданно? тем что вы к более частной задачи перешли? но у нас-то цель не конкретно вот эта специфическая задача. У меня точно нет.
[
Ответ
][
Цитата
]
daner
Сообщений: 4633
На: Управление агентами
Добавлено: 19 окт 09 14:10
QUOTE's Автор: tac
Цитата:
Зло конечно есть, и те кто здесь высказывались именно на это и напирали ...
На здоровье. я остаюсь при своем мнении. я не вижу никакой проблемы в умеренном и явном использовании логичных и обоснованных эвристик. Более того, считаю важным и полезным, выявление основополагающих эвристик, которые могут быть использованы агентом универсальным способом (др.словами в создании теорий). Такие, как например, представление среды в виде состояний и наград.
[
Ответ
][
Цитата
]
daner
Сообщений: 4633
На: Управление агентами
Добавлено: 19 окт 09 14:15
Цитата:
Автор: tac
Только в смысле планирования ... и не больше ... В состоянии которого агент никогда не встречал - НИКАКОГО прогноза сделано не будет !
В отношении нового состояния -- не будет. Но любой прогноз в отношении нового состояния... не очень универсальная штука. Но вообще это тема интересная (правда решать ее можно по разному, и как мне кажется у нас с вами будут разные способы...)
[
Ответ
][
Цитата
]
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 15:18
Цитата:
Автор: daner
это только вашему qfix минус, потому-что еще как делает. И если даже без нее, то нужно было бы что-то вместо (например как в алгоритме sarsa).
Нет, это плюс
А все что есть "вместо" - я тоже указал (в вике) ... мне кажется достаточно ... если знаете конкретный пример, в котором из-за этого qfix может "свалится" - расскажите как его сделать ... проверю ...
[
Ответ
][
Цитата
]
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 15:27
Цитата:
Автор: daner
Совсем не так. q-таблица имеет очень четкий логический смысл. (1) это мат.ожидание прибыли (причем формально доказано, что это именно оно самое) (2) логически четкий алгоритм updata, который заполняет q-таблицу по принципу динамического программирования, на основе рекурсивной функции. Так что... никакого "бац" тут нет.
И именно поэтому, когда делаешь модификацию Q-learning необходимо понимать, что "что-то ты безусловно портишь", но если это оправданно (чем-то) тогда другой разговор.
А у вас оно чем оправданно? тем что вы к более частной задачи перешли? но у нас-то цель не конкретно вот эта специфическая задача. У меня точно нет.
Совсем не так. Я безусловно одно заменяю другим (и хоть формально не доказал, но ничего не испортил это покажет любой эксперимент). И благодаря этой замене алгоритм стал окончально жестко - логическим, без стохастических поисков (и благодаря этому он получил преимущество над QL - он не нуждает в параметрах LF, DF, EF, и работает по максимальному уровню, т.е. даже если отобрать в QL лучшие LF, DF, EF - QFix в детерминированной среде будет таким же/лучше, в вероятностной среде по средней оценке из N агентов таким же, и единственно некоторые случайные агенты могут быть лучше ... и все это еще без протокола общения между агентами ... ) ! К частной задаче я не переходил, если Вы о детерминированной задаче - то да она меня интересует на порядок больше. Но к алгоритму это относится мало ...
P.S. никакого "бац" - нету и в ИНС
[
Ответ
][
Цитата
]
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 15:30
Цитата:
Автор: daner
В отношении нового состояния -- не будет. Но любой прогноз в отношении нового состояния... не очень универсальная штука. Но вообще это тема интересная (правда решать ее можно по разному, и как мне кажется у нас с вами будут разные способы...)
Хотелось бы понять что это за "разные способы" ?
[
Ответ
][
Цитата
]
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 15:38
Цитата:
Автор: daner
ожидал...
а конкретнее, откуда куда связи?
http://ru.vlab.wikia.com/wiki/С
ергей_Яковлев:Статья:Yak1
http://ru.vlab.wikia.com/wiki/С
ергей_Яковлев:Статья:Yak2
[
Ответ
][
Цитата
]
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 16:23
Цитата:
Автор: daner
я не вижу никакой проблемы в умеренном и явном использовании логичных и обоснованных эвристик.
Это и отличает ваш подход ... к сожалению, в итоге - вы скатываетесь к частным математическим задачкам, теряя связь с реальностью ... хорошо если отдаете себе в этом отчет ... но многие этого не замечают, а Вы кажется на грани
(нужно долго обсуждать пока вам объяснишь ваши апприорные ограничения)
[
Ответ
][
Цитата
]
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 16:24
Цитата:
Автор: daner
В отношении нового состояния -- не будет. Но любой прогноз в отношении нового состояния... не очень универсальная штука.
Прогноз может быть лишь в отношении нового состояния - иначе это не прогноз
[
Ответ
][
Цитата
]
daner
Сообщений: 4633
На: Управление агентами
Добавлено: 20 окт 09 2:14
Цитата:
Автор: tac
Нет, это плюс
А все что есть "вместо" - я тоже указал (в вике) ... мне кажется достаточно ... если знаете конкретный пример, в котором из-за этого qfix может "свалится" - расскажите как его сделать ... проверю ...
а что делать то? сделайте в вашей среде еще и состояние с 100000 и ваш агент наплюет на него с высокой колоколни, в то время как qл агент в конце концов найдет лучшее.
Кроме того, среда у вас в примере САМАЯ простая, какую можно придумать (даже по меркам МДП). В ней награды от действий не зависят да еще детерминированность полная. вот это и есть частный случай. Результатом эксперимента является не просто "сколько агент собрал", а стратегия которую он нашел. В вашей среде, не сомневаюсь, что он находит то что надо, а вот в не детерминированной, да еще и с зависимостью от действий... хана ему. В прочем ... думаю и в детерминированной не сложно будет найти пример где он скатиться в лок. минимум, только потому, что не умеет из него выбираться.
Попробуйте такой пример:
http://content.foto.mail.ru/inbox/daner/charts/i-14.jpg
Скорее всего он у вас не выйдет, если я правильно понимаю ваш алгоритм.
А про мульти агентов даже не говорите. Там вообще все сложнее. В них и Q-л не работает, да и ваш не будет. Там скорее надо будет на Фиксишон Плей ровняться. В прочем это не совсем верно, там вариантов больше поэтому и алгоритмов с разными вариантами работающих побольше.
[
Ответ
][
Цитата
]
daner
Сообщений: 4633
На: Управление агентами
Добавлено: 20 окт 09 2:15
Цитата:
Автор: tac
http://ru.vlab.wikia.com/wiki/С
ергей_Яковлев:Статья:Yak1
http://ru.vlab.wikia.com/wiki/С
ергей_Яковлев:Статья:Yak2
разбираться надо... пока ничего сказать не могу.
[
Ответ
][
Цитата
]
daner
Сообщений: 4633
На: Управление агентами
Добавлено: 20 окт 09 2:19
Цитата:
Автор: tac
Это и отличает ваш подход ... к сожалению, в итоге - вы скатываетесь к частным математическим задачкам, теряя связь с реальностью ... хорошо если отдаете себе в этом отчет ... но многие этого не замечают, а Вы кажется на грани
(нужно долго обсуждать пока вам объяснишь ваши апприорные ограничения)
В итоге, я проверяю свои тезисы на РЕАЛЬНОЙ среде.
так что, далеко не скатишься.
А мат. задачки обычно в реальности тоже работают, если правильно понимаешь когда должно работать, а когда нет. Зато без обматиматичивания (формализации и формального анализа) теории (даже работающие на практики, по мнению их авторов) не достаточно ценны, так как к новой ситуации применять их сложно. Гарантий НОЛЬ... вилами по воде писанно.
[
Ответ
][
Цитата
]
Стр.20 (26)
:
1
...
16
17
18
19
[20]
21
22
23
24
...
26
<<
< Пред.
|
След. >
>>
Главная
|
Материалы
|
Справочник
|
Гостевая книга
|
Форум
|
Ссылки
|
О сайте
Вопросы и замечания направляйте нам по
Copyright © 2001-2022, www.gotai.net