GotAI.NET
Форум: Проблемы искусственного интеллекта
Регистрация
|
Вход
Все темы
|
Новая тема
Стр.11 (13)
<<
< Пред.
|
След. >
>>
Поиск:
Автор
Тема: На: Распознавание образов.
ЭСГТР
Сообщений: 8461
На: Распознавание образов.
Добавлено: 03 апр 11 19:35
Цитата:
Автор: NO.
Тогда это должна быть уж очень широкая "алгоритмическая схема". Там такие глубины, о существовании которых никто и не знает. А какие там твари плавают! Парсезавры, рекогнодоны, матченогие синергопсы. И целые стаи индексов, тучные стада. И тут вы со своим ведёрком.
Закон Ома это глубины?
А ведь компьютер работает по законам Ома.
ЭГТР предлагает тоже свои законы:
1. Закон эмоционального синтеза.
2. Закон эмоционального резонанса.
3. Закон тринитарности функции жизнедеятельности.
[
Ответ
][
Цитата
]
dr2chek
Сообщений: 871
На: Распознавание образов.
Добавлено: 03 апр 11 21:17
Цитата:
Автор: ЭГТР
Отдельное произношение звуков однозначно не показатель.
Само собой. Но помогает уяснить некоторые базовые вещи. Можно ведь ради смеха синтезировать речь, перевернув длительности звуков, сделать гласные короткими, взрывные согласные длинными, но это уже будет не человеческая, нифига-не-понятная речь. А оно вам надо?
[
Ответ
][
Цитата
]
ЭСГТР
Сообщений: 8461
На: Распознавание образов.
Добавлено: 03 апр 11 21:40
Цитата:
Автор: dr2chek
Само собой. Но помогает уяснить некоторые базовые вещи. Можно ведь ради смеха синтезировать речь, перевернув длительности звуков, сделать гласные короткими, взрывные согласные длинными, но это уже будет не человеческая, нифига-не-понятная речь. А оно вам надо?
На самом деле всё приводится к генотипу. Протоязык был потому всем понятен, потому что он был генотипичен. Изменять звуки нельзя потому что они тоже генотипичны, только сначала к объектам окружающего нас мира, а потом уже нашли отражение и в нашем генотипе. Если звук С короткий, это не планетарный (не атмосферный) звук. Звуки сами по себе определены окружающей средой.
Поэтому мне ОНО не надо, моя НС просто не знает что с этим эмоционально делать. Другое дело если он находится в слове, но это уже другой звук, ибо слово это тоже звук. Можно не знать алфавита и при этом отлично понимать и говорить. Я встречал людей которые не умели ни читать ни писать даже по слогам, однако врать при этом были способны на 5+. И вообще нужно ли компьютер учить азбуке? Для написания наверно да, а для понимания - наверно нет.
Кстати сказать... приведённая к генотипу языковая эмоция не привязана к языкам... она протоязыковая. Её можно размыслить на любой язык. Т.е. машинный перевод должен выглядеть так... оригинал сначала осмысливается в протоэмоциональный генотипичный язык а затем размышляется в любой, какой нужен. Кстати и действительно после первых пяти языков, все остальные учатся намного легче и быстрее. Протоязыковые эмоции видимо формируется... полиглотные.
[
Ответ
][
Цитата
]
Андрей
Сообщений: 3944
На: Распознавание образов.
Добавлено: 03 апр 11 22:05
Из подручных средств собрал
осциллограф
.
Записывает звуковые данные (44100 Гц / 8 бит) в буфер размером 2000 байт. Примерно такой величины кадр, судя по нижней частоте слуха, обрабатывает ухо за "один такт".
Исходники для экспериментов прилагаются.
[
Ответ
][
Цитата
]
ЭСГТР
Сообщений: 8461
На: Распознавание образов.
Добавлено: 03 апр 11 22:11
Цитата:
Автор: Андрей
Из подручных средств собрал
осцилограф
.
Записывает звуковые данные (44100 Гц / 8 бит) в буфер размером 2000 байт. Примерно такой величины кадр, судя по нижней частоте слуха, обрабатывает ухо за "один такт".
Исходники для экспериментов прилагаются.
Лучше бы анализатор спектра .... а лучше бы сразу с иерархическим древом. Мы бы попытались сравнить ваше слово и моё....
Простое древо тоже наверно примитивно... надо бы многомерное... Ну да ничего... можно поработать проекцией, хотя НС наверно использует пространственные электромагнитные резонансы. Какое нибудь пространственное голографическое сканирование.
Можно попробовать круговую диаграмму.
[
Ответ
][
Цитата
]
ЭСГТР
Сообщений: 8461
На: Распознавание образов.
Добавлено: 04 апр 11 8:09
Каждый переход на более высокий этаж для сканирования более дисперсной части эмоционального кортежа сопровождается увеличением возбуждения НС. Всякое затруднение в осознании, вызывает усиление сначала нервной, а потом и сосудистой деятельности организма.
[
Ответ
][
Цитата
]
Анатоль
Сообщений: 1964
На: Распознавание образов.
Добавлено: 04 апр 11 9:36
Цитата:
Автор: Андрей
Это гипотеза, или есть какие-то экспериментальные исследования?
На момент моего знакомства с этим вопросом (40 лет назад) это были две конкурирующие гипотезы, обе имеющие достаточно сильные экспериментальные аргументы.
Думаю, с тех пор они обе только подтвердились.
Цитата:
начиная с какого количества импульсов в сигнале мозг (или ухо) перестаёт считать отдельные импульсы, "сдаётся" и начинает "мерять" спектр.
Считается, что синхронизация нервных импульсов с сигналом происходит до нескольких (3-4)кгц.
Цитата:
Ничего не понял про 95% данных, которые идут непонятно куда и непонятно почему их надо куда-то выбросить.
Все данные идут в мозг и там обрабатываются.
Слух ведь нужен не только для распознавания звуков речи, но и других звуков, между которыми могут быть важны очень тонкие различия.
Да и в звуках речи мы распознаём не только их фонемное содержание, но и особенности голоса говорящего, интонацию, эмоциональную окраску, особенности диалекта, акцент...
Да и обеспечить синхронность импульсов звуку до 4 кгц. нервной системе дорого обходится. Ведь предельная частота одиночного нейрона около 300 гц. Поэтому на передачу каждой частоты нужны группы из десятков нейронов.
Короче говоря для распознавания речи компутер может сэкономить в раз 20 по сравнению со слухом.
[
Ответ
][
Цитата
]
Анатоль
Сообщений: 1964
На: Распознавание образов.
Добавлено: 04 апр 11 9:39
Критерий достаточности данных для представления образа.
Если синтезированный по этим данным образ мы можем распознать - значит данных достаточно.
Является ли динамика огибающей спектра достаточным представлением образа?
В синтезированном по этим данным звуковом сигнале мы можем распознать фонетическое содержание, но звук будет очень неестественным.
Добавка параметра тон-шум (ТШ) (даже однобитного) улучшит качество звука, но всё же он будет безликим, механистичным.
Значительно улучшит качество звука добавка параметра, передающего динамику частоты основного тона (ЧОТ).
Ресинтезировать (а значит и распознавать) звуки можно не только по спектру.
Можно применять для этого и вейвлеты.
Вообще проблема сжатия данных имеет тесное отношение к распознаванию.
Ведь для хорошего сжатия нужна подходящая модель образов.
Но это нужно и для распознавания.
Настройка параметров модели и является содержанием процесса обучения.
Но является ли динамика огибающей спектра минимально необходимым набором данных, представляющих образ?
Думаю, динамика спектра не является оптимальной моделью для звуков речи.
Оптимальная модель видится такой, в которой разграничены параметры, определяющие фонетическое содержание звуков речи, и параметры, определяющие особенности диктора и просодику речи.
[
Ответ
][
Цитата
]
Андрей
Сообщений: 3944
На: Распознавание образов.
Добавлено: 04 апр 11 18:36
Цитата:
Автор: Анатоль
Думаю, динамика спектра не является оптимальной моделью для звуков речи
+10
Цитата:
Автор: Анатоль
Считается, что синхронизация нервных импульсов с сигналом происходит до нескольких (3-4)кгц.
Непонятно.
Цитата:
Автор: Анатоль
Оптимальная модель видится такой, в которой разграничены параметры, определяющие фоненическое содержание звуков речи
Правильно задача распознавания формулируется как-то так: определить пространство признаков, достаточных для классификации (отождествления) одинаковых слов, произнесённых разными людьми.
Мы слышим, что слово, произнесённое дедушкой и ребёнком, но распознанное нами, отличаются между собой по какими-то признакам (длительность, тембр, частота), значит именно эти признаки не являются определяющими и не должны быть нам интересны для задачи распознавания. Частота в том числе. В распознавании интересны не те признаки, по которым можно
различить
звуки, а те, по которым их можно
отождествить
. Т.е. вопрос стоит вот в чём - чем тождественны (одинаковы, равны) слова, произнесённые разными людьми. Всё то, в чём они различны, очевидно, к распознаванию отношения не имеет. А имеет отношение к классификации источника сигнала.
Соображения такие:
- время играет важную роль. Вот какие аналогии просматриваются - быстрый повтор кадров зрения воспринимается как движение, быстрый повтор кадров звука воспрнимается как тон (частота), повтор действия или события создают в нашем уме память этого; существенное замедление/ускорение звучания при сохранении частотных показателей приводят к полной невозможности распознавания.
- инвариантность по размерам, в визуальном восприятии, как-то связана с инвариантностью по аплитуде в слуховом восприятии, инвариантность по частоте - с инвариантностью к перемещению. Вообще интересно провести параллели между разными инвариантностями в разных системах перцепции, может это натолкнёт на какие-то мысли.
- звук имеет иерархическое строение: в базе - изменение интонации ("бубнение"), в деталях - всякие шумовые широкоспектральные призвуки (уточняющие детали). Слово намного лучше распознаётся, когда отрезана высшая часть спектра и есть только "бубнение" (нижние частоты), чем когда наоборот - оставлены только высшие частоты.
P.S. Скинули мне тут
ссылку
на одного ИИ-кулибина, может кому пригодится.
[
Ответ
][
Цитата
]
Анатоль
Сообщений: 1964
На: Распознавание образов.
Добавлено: 04 апр 11 21:16
Цитата:
Автор: Андрей
Непонятно.
Возмём какую-то точку на мембране улитки, например соответствующую частоте 200 гц.
Если спектр сигнала имеет на этой частоте какую-то интенсивность, то этот участок мембраны будет совершать "поперечные" колебания с частотой 200 гц. и амплитудой тем большей, чем больше значения спектра (плотности энергии на даной частоте).
При отклонении мембраны она будет изгибать чувствительные волоски рецепторных нейронов, что будет приводить к генирированию ими импульсов.
Импульсы будут синхронизированы с отклонением мембраны.
Для 200 гц. проблем нет.
А теперь возмём точку на мембране соответствующую например 800 гц.
При наличии в сигнале энергии на этой частоте этот участок мембраны будет совершать поперечные колебания с частотой 800 гц., отклоняя чувствительные волоски нейронов.
Но нейрон не может генерить импульсы с такой частотой (пусть для него максимальная частота 300 гц.).
Но всё равно он будет выдавать импульсы не случайно, а "синхронно" колебанию мембраны, при нек. её отклонении (например близком к максимальному).
Т.е. на нек. периоды он будет выдавать импульс, а некоторые будет пропускать.
Но если с этой точкой мебраны связаны несколько нейронов, то другие нейроны могут генерить импульсы в те периоды отклонения мембраны, когда этот нейрон отдыхает.
Таким образом группа нейронов, связанных с этим участком мембраны может генерировать импульсы на каждом периоде отклонения мембраны, т.е. с частотой 800 гц.
(На самом деле ситуация чуть сложнее из-за того, что интенсивность сигнала на этой частоте также кодируется увеличением числа импульсов при увеличении интенсивности).
[
Ответ
][
Цитата
]
ЭСГТР
Сообщений: 8461
На: Распознавание образов.
Добавлено: 04 апр 11 22:10
Шо-шо, а нейронов у человека хватает...
Конечно не только показатели спектра определяют эмоцию идущую на распознавание звука и формирования иерархической древовидной эмоции поступающей в НС (мышление, фаза осмысления). НС для выработки сентенции осуществляет эмоциональный синтез, в котором принимают участие и зрительные образы (жесты, движение губ), и общее состояние организма. Распознаётся синтезированная информация. Однако процесс распознавания начинается с простого.... в начале Фурье, затем могут быть востребованы подробности и детали вплоть до ощущений. Это лишний раз доказывает что распознаваемая информация имеет универсальный характер, и увеличивающийся, расширяющийся по мере необходимости объём.
[
Ответ
][
Цитата
]
Андрей
Сообщений: 3944
На: Распознавание образов.
Добавлено: 04 апр 11 22:20
Цитата:
Автор: Анатоль
При наличии в сигнале энергии на этой частоте этот участок мембраны будет совершать поперечные колебания с частотой 800 гц., отклоняя чувствительные волоски нейронов.
Но нейрон не может генерить импульсы с такой частотой
1. В своём вопросе я имел в виду совсем другое, а именно: какова частота сигнала, при которой, например, щелчки меандра перестают быть слышимыми человеком как последовательность различимых раздельно щелков, а становятся слышимыми как слитный сигнал некоторой частоты и некоторой длительности.
2. По существу Вашего ответа. Неясно, при чём здесь частота колебания мембраны к частоте генерации импульсов нейроном. Если допустить верность гипотезы о том, что улитка является спектроанализатором, то каждый нейрон самим своим месторасположением задаёт ту частоту, на которую он реагирует. А вот частота генерации импульсов этим нейроном зависит не от частоты внешнего сигнала, а от его энергии. Чем выше сила возбудителя, тем выше частота генерации спайков нейроном. Вот, что пишет
"От нейрона к мозгу"
стр. 26:
"Учитывая, что каждый ПД [потенциал действия] имеет фиксированную амплитуду, неясно, в чем же oтpaжается величина стимула.
Интенсивность кодируется частотой ПД
. Более эффективный зрительный стимул вызывает большую деполяризацию и, как следствие, более высокую частоту rенерации ПД".
Если один нейрон не в состоянии передать всю информацию об энергии стимула, то к нему подключаются его собратья, чтобы вместе "кричать погромче": (там же)
"... более сильный стимул активирует большее количество чувствительных волокон."
[
Ответ
][
Цитата
]
ЭСГТР
Сообщений: 8461
На: Распознавание образов.
Добавлено: 04 апр 11 22:26
Цитата:
Неясно, при чём здесь частота колебания мембраны к частоте генерации импульсов нейроном. Если допустить верность гипотезы о том, что улитка является спектроанализатором, то каждый нейрон самим своим месторасположением задаёт ту частоту,...
Да?... Аккелло промахнулся?...
[
Ответ
][
Цитата
]
Анатоль
Сообщений: 1964
На: Распознавание образов.
Добавлено: 04 апр 11 22:59
1. У Вас же есть генератор. Вот и поэксперементируйте, при какой частоте прямоугольный сигнал воспринимается как тон (гудение), а при какой как щелчки.
Вообще-то считается, что ухо начинает слышать тон при частоте выше (16-20 гц.).
Но при такой частоте слышимый тон очень слабый из-за малой чувствительности уха на низких частотах, поэтому, думаю, щелчки сольются в гудение только при более высоких частотах. Возможно эта частота будет зависеть и от скважности (будет минимальна при длительности импульса равной половине периода, и будет расти когда длительность импульса короче при даном периоде.
2. Да, мембрана является спектроанализатором, и место на ней определяет частоту.
Да, количесто импульсов, генерируемых с определённого участка мембраны увеличивается с увеличением плотности энергии на этой частоте.
Но, для низкочастотных участков (до 3-4 кгц) эти импульсы не случайно равномерно распределены во времени (на протяжении периода), а синхронизированы с частотой этого участка (в момент максимального отклонения участка их больше).
[
Ответ
][
Цитата
]
Андрей
Сообщений: 3944
На: Распознавание образов.
Добавлено: 04 апр 11 23:05
Цитата:
Анатоль
Вот и поэксперементируйте
Вот и поэкспериментировал и никакой чёткой границы различить не могу. Я не могу сказать точно, сколько щелчков прошло на сравнительно большой частоте (>20 Гц), но я всё-таки слышу щелчки. А тон как-бы рядом появляется.
Цитата:
Анатоль
для низкочастотных участков (до 3-4 кгц) эти импульсы не случайно равномерно распределены во времени, а синхронизированы с частотой этого участка
Откуда это взято? Книжка пишет о том, что частота спайков кодирует интенсивность сигнала и больше ничего.
[
Ответ
][
Цитата
]
Стр.11 (13)
:
1
...
7
8
9
10
[11]
12
13
<<
< Пред.
|
След. >
>>
Главная
|
Материалы
|
Справочник
|
Гостевая книга
|
Форум
|
Ссылки
|
О сайте
Вопросы и замечания направляйте нам по
Copyright © 2001-2022, www.gotai.net