GotAI.NET

Форум: Проблемы искусственного интеллекта

 

Регистрация | Вход

 Все темы | Новая тема Стр.20 (26)<< < Пред. | След. > >>   Поиск:  
 Автор Тема: На: Управление агентами
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 4:15
Цитата:
Автор: daner

среда логически разбивается на состояния и награды -- то не считаю злом


Зло конечно есть, и те кто здесь высказывались именно на это и напирали ...

Но я не столько принципиальный, т.к. в отличии от них совершенно четко понимаю, что не упращая вначале задачу - результата не получить ... но просто надо отдавать себе отчет в том, где задача упращается, чтобы потом не выдавать желаемое за действительное (к сожалению я это часто наблюдаю - и даже несколько преуспел в "Развеявании мифов" )



[Ответ][Цитата]
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 4:20
Цитата:
Автор: daner

вся Q таблица -- это прогноз Выгодности состояния.


Только в смысле планирования ... и не больше ... В состоянии которого агент никогда не встречал - НИКАКОГО прогноза сделано не будет !
[Ответ][Цитата]
daner
Сообщений: 4633
На: Управление агентами
Добавлено: 19 окт 09 13:45
QUOTE's Автор: tac

Цитата:
Ну, в QFix - это так ... а "применение функции МАХ" особой погоды не делает ... хотя понимаю, что теоритически моделирует историю ...

это только вашему qfix минус, потому-что еще как делает. И если даже без нее, то нужно было бы что-то вместо (например как в алгоритме sarsa).

Цитата:
Ну, для ИНС - нужно вводить обратные связи ... и нет особых проблем ...

ожидал... а конкретнее, откуда куда связи?

Цитата:
"А про РАНО говорилось о другом. О трансформации части сложной награду в скалярную величину. это не то о чем вы сейчас говорите."

Ну, предметно о другом ... но алгоритм будет тот же ... трансформация состояний в награду - это точно та же задача ...

не знаю... может и так, но я общего между ними не вижу. ВООБЩЕ.
[Ответ][Цитата]
daner
Сообщений: 4633
На: Управление агентами
Добавлено: 19 окт 09 14:01
QUOTE's Автор: tac

Цитата:
Ну, и потом сведя QL к QFix, где я еще больше ввел явных сущностей, которые неявно присутствуют в QL.

Не в коем случае, особенно после услышанного о функции Update. Это делает qfix не просто недоказанным на предмет справляемости с МДП...
я в своей работе тоже подобное изменение применил, но меня тогда спасло то, что я работал со средой только из двух состояний и переходов в самого себя не было. Вот тогда мах не имеет смысла (это математически очевидно). Но это же меня оставило в очень жестких рамках задачи координации, а не вообще. (с другой стороны мне этого за глаза хватало).


Цитата:
Думаю во все "поглощающем подходе сетевиков" меня обвинить сложно И здесь мы меняемся ролями - QL по отношению к QFix здесь уже выглядит как сделать сеть похитрее - бац и все .... поэтому мы просто говорим даже не о подходах, а о разных уровнях гибкости алгоритма ....

Совсем не так. q-таблица имеет очень четкий логический смысл. (1) это мат.ожидание прибыли (причем формально доказано, что это именно оно самое) (2) логически четкий алгоритм updata, который заполняет q-таблицу по принципу динамического программирования, на основе рекурсивной функции. Так что... никакого "бац" тут нет.
И именно поэтому, когда делаешь модификацию Q-learning необходимо понимать, что "что-то ты безусловно портишь", но если это оправданно (чем-то) тогда другой разговор.
А у вас оно чем оправданно? тем что вы к более частной задачи перешли? но у нас-то цель не конкретно вот эта специфическая задача. У меня точно нет.
[Ответ][Цитата]
daner
Сообщений: 4633
На: Управление агентами
Добавлено: 19 окт 09 14:10
QUOTE's Автор: tac

Цитата:
Зло конечно есть, и те кто здесь высказывались именно на это и напирали ...

На здоровье. я остаюсь при своем мнении. я не вижу никакой проблемы в умеренном и явном использовании логичных и обоснованных эвристик. Более того, считаю важным и полезным, выявление основополагающих эвристик, которые могут быть использованы агентом универсальным способом (др.словами в создании теорий). Такие, как например, представление среды в виде состояний и наград.
[Ответ][Цитата]
daner
Сообщений: 4633
На: Управление агентами
Добавлено: 19 окт 09 14:15
Цитата:
Автор: tac
Только в смысле планирования ... и не больше ... В состоянии которого агент никогда не встречал - НИКАКОГО прогноза сделано не будет !

В отношении нового состояния -- не будет. Но любой прогноз в отношении нового состояния... не очень универсальная штука. Но вообще это тема интересная (правда решать ее можно по разному, и как мне кажется у нас с вами будут разные способы...)
[Ответ][Цитата]
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 15:18
Цитата:
Автор: daner

это только вашему qfix минус, потому-что еще как делает. И если даже без нее, то нужно было бы что-то вместо (например как в алгоритме sarsa).



Нет, это плюс А все что есть "вместо" - я тоже указал (в вике) ... мне кажется достаточно ... если знаете конкретный пример, в котором из-за этого qfix может "свалится" - расскажите как его сделать ... проверю ...
[Ответ][Цитата]
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 15:27
Цитата:
Автор: daner

Совсем не так. q-таблица имеет очень четкий логический смысл. (1) это мат.ожидание прибыли (причем формально доказано, что это именно оно самое) (2) логически четкий алгоритм updata, который заполняет q-таблицу по принципу динамического программирования, на основе рекурсивной функции. Так что... никакого "бац" тут нет.
И именно поэтому, когда делаешь модификацию Q-learning необходимо понимать, что "что-то ты безусловно портишь", но если это оправданно (чем-то) тогда другой разговор.
А у вас оно чем оправданно? тем что вы к более частной задачи перешли? но у нас-то цель не конкретно вот эта специфическая задача. У меня точно нет.


Совсем не так. Я безусловно одно заменяю другим (и хоть формально не доказал, но ничего не испортил это покажет любой эксперимент). И благодаря этой замене алгоритм стал окончально жестко - логическим, без стохастических поисков (и благодаря этому он получил преимущество над QL - он не нуждает в параметрах LF, DF, EF, и работает по максимальному уровню, т.е. даже если отобрать в QL лучшие LF, DF, EF - QFix в детерминированной среде будет таким же/лучше, в вероятностной среде по средней оценке из N агентов таким же, и единственно некоторые случайные агенты могут быть лучше ... и все это еще без протокола общения между агентами ... ) ! К частной задаче я не переходил, если Вы о детерминированной задаче - то да она меня интересует на порядок больше. Но к алгоритму это относится мало ...

P.S. никакого "бац" - нету и в ИНС
[Ответ][Цитата]
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 15:30
Цитата:
Автор: daner

В отношении нового состояния -- не будет. Но любой прогноз в отношении нового состояния... не очень универсальная штука. Но вообще это тема интересная (правда решать ее можно по разному, и как мне кажется у нас с вами будут разные способы...)


Хотелось бы понять что это за "разные способы" ?
[Ответ][Цитата]
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 15:38
Цитата:
Автор: daner

ожидал... а конкретнее, откуда куда связи?



http://ru.vlab.wikia.com/wiki/Сергей_Яковлев:Статья:Yak1
http://ru.vlab.wikia.com/wiki/Сергей_Яковлев:Статья:Yak2
[Ответ][Цитата]
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 16:23
Цитата:
Автор: daner

я не вижу никакой проблемы в умеренном и явном использовании логичных и обоснованных эвристик.


Это и отличает ваш подход ... к сожалению, в итоге - вы скатываетесь к частным математическим задачкам, теряя связь с реальностью ... хорошо если отдаете себе в этом отчет ... но многие этого не замечают, а Вы кажется на грани (нужно долго обсуждать пока вам объяснишь ваши апприорные ограничения)
[Ответ][Цитата]
tac
Сообщений: 2601
На: Управление агентами
Добавлено: 19 окт 09 16:24
Цитата:
Автор: daner


В отношении нового состояния -- не будет. Но любой прогноз в отношении нового состояния... не очень универсальная штука.


Прогноз может быть лишь в отношении нового состояния - иначе это не прогноз
[Ответ][Цитата]
daner
Сообщений: 4633
На: Управление агентами
Добавлено: 20 окт 09 2:14
Цитата:
Автор: tac
Нет, это плюс А все что есть "вместо" - я тоже указал (в вике) ... мне кажется достаточно ... если знаете конкретный пример, в котором из-за этого qfix может "свалится" - расскажите как его сделать ... проверю ...

а что делать то? сделайте в вашей среде еще и состояние с 100000 и ваш агент наплюет на него с высокой колоколни, в то время как qл агент в конце концов найдет лучшее.
Кроме того, среда у вас в примере САМАЯ простая, какую можно придумать (даже по меркам МДП). В ней награды от действий не зависят да еще детерминированность полная. вот это и есть частный случай. Результатом эксперимента является не просто "сколько агент собрал", а стратегия которую он нашел. В вашей среде, не сомневаюсь, что он находит то что надо, а вот в не детерминированной, да еще и с зависимостью от действий... хана ему. В прочем ... думаю и в детерминированной не сложно будет найти пример где он скатиться в лок. минимум, только потому, что не умеет из него выбираться.
Попробуйте такой пример: http://content.foto.mail.ru/inbox/daner/charts/i-14.jpg
Скорее всего он у вас не выйдет, если я правильно понимаю ваш алгоритм.

А про мульти агентов даже не говорите. Там вообще все сложнее. В них и Q-л не работает, да и ваш не будет. Там скорее надо будет на Фиксишон Плей ровняться. В прочем это не совсем верно, там вариантов больше поэтому и алгоритмов с разными вариантами работающих побольше.
[Ответ][Цитата]
daner
Сообщений: 4633
На: Управление агентами
Добавлено: 20 окт 09 2:15
Цитата:
Автор: tac
http://ru.vlab.wikia.com/wiki/Сергей_Яковлев:Статья:Yak1
http://ru.vlab.wikia.com/wiki/Сергей_Яковлев:Статья:Yak2

разбираться надо... пока ничего сказать не могу.
[Ответ][Цитата]
daner
Сообщений: 4633
На: Управление агентами
Добавлено: 20 окт 09 2:19
Цитата:
Автор: tac
Это и отличает ваш подход ... к сожалению, в итоге - вы скатываетесь к частным математическим задачкам, теряя связь с реальностью ... хорошо если отдаете себе в этом отчет ... но многие этого не замечают, а Вы кажется на грани (нужно долго обсуждать пока вам объяснишь ваши апприорные ограничения)


В итоге, я проверяю свои тезисы на РЕАЛЬНОЙ среде. так что, далеко не скатишься.
А мат. задачки обычно в реальности тоже работают, если правильно понимаешь когда должно работать, а когда нет. Зато без обматиматичивания (формализации и формального анализа) теории (даже работающие на практики, по мнению их авторов) не достаточно ценны, так как к новой ситуации применять их сложно. Гарантий НОЛЬ... вилами по воде писанно.
[Ответ][Цитата]
 Стр.20 (26)1  ...  16  17  18  19  [20]  21  22  23  24  ...  26<< < Пред. | След. > >>