Главная › Услуги › Что такое «Сири»: обзор интерактивного помощника Apple и его аналога. Siri от Apple: что умеет программа и как ею пользоваться

Что такое «Сири»: обзор интерактивного помощника Apple и его аналога. Siri от Apple: что умеет программа и как ею пользоваться

Совершенно очевидно, что у людей, которые уже давно пользуются техникой от Apple, не возникнет вопрос, о том, что такое SIRI и наверняка может вызвать улыбку, фраза – «Кто такая Сири?». Но для тех, кто только осваивает весь функционал гаджетов Эпл, данная статья может быть полезна.

Итак, что такое Siri ?

Siri – это голосовой помощник или интерактивная система, которая обрабатывает вашу речь и формулирует нужный вам ответ, или запускает определенные действия на гаджете. Из самых простых, например вызов абонента, поиск нужной информации в интернете, чтение сообщений, включение/отключение музыкального плеера, и так далее.

Siri, это аббревиатура – Speech Interpretation and Recognition Interface, которая расшифровывается так: Интерфейс интерпретации и распознавания речи.
Siri отличается от своих аналогов, тем, что индивидуально приспосабливается к каждому пользователю – слушает и изучает владельца устройства, анализирует его предпочтения.

Стоит отметить, что Сири, впервые выпустили и разрабатывали для англоговорящей аудитории. Поэтому функционал, точный, правильный и наилучший отклик от Siri по запросам, все же, выдает лучше на английском, чем на других языках.

У Сири есть централизованный доступ ко многим сервисам, и в США, например, найти нужный магазин, ресторан или любое другое место с помощью Сири, значительно проще, так как эти данные Сири черпает из специализированных сервисов, а не в строке поисковика, как делают его аналоги.

Например, если вы ищите билеты в кино в своем городе, то Сири «дает запрос» на сервера Apple, где хранится информация по нужным сервисам, в данном случае будут сервисы бронирования билетов и кинотеатры. Это значительно расширяет границы поиска и позволяет получить нужный ответ быстрее и, что самое главное, с большой вероятностью, это будет то, что вы искали. К сожалению, сегодня, такие преимущества в большом охвате сервисов и их разнообразии, доступны только для зарубежного пользователя.

Также, нужно помнить, что пользуясь Сири, нужен стабильный и быстрый интернет, в США давно работает 4G, на подходе уже 5G, когда в странах СНГ, на сегодняшний день, покрытие 3G точечное, и работает стабильно лишь в крупных городах.

Как пользоваться Сири?

Если вы не знаете, как включить Сири или просто не включили его при запуске iOS-устройства, то перейдите в «Настройки », далее «Основные » – «Siri ». Еще один способ включить Сири, это нажать и удерживать несколько секунд главную кнопку «Home» или «Домой». Пример включения Сири в айфоне:Не лишним может быть функция «Привет, Siri», которая также активируется в настройках, просто нажмите Разрешить «Привет, Siri» и ваш гаджет Apple будет реагировать на ваши голосовые команды.

Аналоги Siri

Так как интеллектуальная собственность – Сири, принадлежит компании Apple, то пользователи смартфонов и других гаджетов на windows или android, не имеют возможности воспользоваться данным сервисом. Но существует множество аналогов Сири на андроид:

Assistant
Pocket Assistant
Dragon Mobile Assistant
Top Assistant
Robin – the Siri Challenger
Indigo Virtual Assistant
Jeannie
ANDY Voice Assistant
и другие.

Вышеперечисленные голосовые помощники доступны в Google Play, но к сожалению или к счастью, у Гугл Плей, нет такого «жесткого отбора» приложений для своих пользователей. Поэтому далеко не всегда эти программные продукты могут быть безопасны или вообще как-то полезны вашему гаджету.

Ok Google, похож на помощника Siri, но более ограничен в своем функционале. Хотя, имеет больше возможностей, чем многие думают. Google Now не ограничивается одним поиском в Гугл. «Гугл Нау» умеет распознавать музыку, делать заметки, напоминалки, ставить будильник, писать сообщения, звонить не касаясь телефона, запускать приложения и так далее.

Так что если вам не подойдут по каким-либо причинам, приложения из Google Play, аналоги Siri для Android, то попробуйте воспользоваться Google Now.

Пользоваться Google Now могут и владельцы гаджетов от Apple, у которых есть возможность сравнить Привет, Сири с Окей Гугл , а также их аналоги. Если вы регулярно пользуетесь интерактивными помощниками, и вам есть с чем сравнить, то обязательно поделитесь своим мнением в комментариях!

В последнее время в нашу повседневную жизнь всё больше проникают голосовые помощники. Большинство пользователей iPhone и других продуктов компании Apple хорошо знакомы с одним из них – Siri, но мало кто понимает все перспективы виртуальных ассистентов и умеет пользоваться всеми их возможностями и функциями.

Что такое голосовой помощник

Представьте, с вами рядом всегда находится ваш преданный друг, который в любое время дня и ночи готов с вами поговорить, ответить на любой ваш вопрос и выполнить поручения. При этом он никогда не устает, у него не бывает плохого настроения, и он с каждым днем становится всё умнее и понимает вас всё лучше. Это и есть голосовые помощники, которые доступны для повседневного использования уже сегодня.

Голосовые помощники встроены в компьютеры, планшеты, телефоны, умные часы, умные колонки и даже в автомобили. Важно понимать, что взаимодействие с голосовым помощником осуществляется исключительно голосом, без использования рук, не нажимая ни на какие кнопки. Это принципиально новый способ взаимодействия человека и программы, который очень похож на общение между людьми.

Siri от компании Apple.
Google Ассистент компании Google.
Alexa от Amazon.
Алиса от компании Яндекс.

Мы уже писали ранее и , а в этой статье мы подробно расскажем о Сири.

Голосовой помощник Siri

Siri – это голосовой помощник, который первым стал поддерживать русский язык, и только потом появилась отечественная , вышедшая в конце 2017 года, а еще позже летом 2018 на русском заговорил . Сири довольно хорошо распознает русскую речь, даже если рядом играет музыка или присутствуют посторонние шумы.

Сири в iPhone SE

Siri не всегда принадлежала компании Apple. Изначально, это было отдельное приложение в App Store для iOS. В 2010 году Apple приобрела компанию Siri Inc. и их уникальную разработку. Вскоре после покупки, Apple встроила Сири в iPhone 4S, а затем и в последующие свои устройства. Тогда, в 2011 году, Siri стала первым продуктом на рынке персональных голосовых ассистентов.

Siri подстраивается под каждого пользователя индивидуально, изучает его предпочтения и начинает лучше понимать своего «хозяина». В первую очередь это заметно в улучшении распознавания вашего голоса после первых недель использования. Также есть возможность указать Siri, как следует обращаться к вам и называть имена ваших контактов из адресной книги, чтобы она лучше вас понимала. А когда Siri произносит имена неправильно, всегда можно её поправить, показать правильное ударение.

Siri доступна на iPhone, iPad, Mac, Apple Watch, Apple TV и , а также почти во всех современных автомобилях через функцию CarPlay. Способ запуска Siri и список доступных команд разнится в зависимости от устройства.

Как запустить Siri на iPhone, iPad и iPod touch

Запуск нажатием кнопки «Домой»

Siri доступна на всех iPhone, начиная с iPhone 4s, на операционной системе iOS 5 и выше. Для запуска Siri на iPhone (за исключением iPhone X), нужно нажать и удерживать центральную кнопку «Домой».

Чтобы запустить Сири на iPhone X необходимо нажать и удерживать боковую кнопку.

После звукового сигнала, можно произносить запрос. На некоторых устройствах следует дождаться появления Siri на экране, прежде чем давать команду.

Привет, Сири – Как включить Siri голосом

Siri можно запускать исключительно с помощью голоса, вообще без нажатия на кнопки. Нужно будет всего лишь сказать: «Привет, Siri». После звукового сигнала можно задавать вопрос или давать команду.

Для этого на устройстве должна быть активирована функция «Привет, Siri»: Настройки → Siri и поиск → Слушать «Привет, Siri».

На всех моделях iPhone, начиная с iPhone 6s, а также на iPad Pro эту функцию можно использовать в любой момент, сказав «Привет, Siri» так, чтобы это уловили микрофоны гаджета. На более ранних айфонах и айпадах функция «всегда слушает» работает только тогда, когда ваш гаджет подключен к зарядному устройству.

Как включить Сири в наушниках

Используя оригинальную гарнитуру Apple с кнопками дистанционного управления или совместимые Bluetooth-наушники, активировать Siri можно нажатием на центральную кнопку или кнопку вызова. После звукового сигнала можно делать запрос.

Используя беспроводную гарнитуру AirPods от Apple, для запуска Siri дважды прикоснитесь к внешней поверхности любого наушника.

Сири на компьютере Mac

Siri доступна на компьютерах Mac с macOS 10.12 Sierra и более новыми версиями операционной системы. Однако, на данный момент функционал голосового помощника на маке ограничен. Все, что здесь умеет Siri – звонить по FaceTime, писать сообщения, включать музыку, показывать прогноз погоды и помогать работать с файлами и папками.

Сири на маке

Стоит отметить, что работа с файлами на компьютере с помощью голосового ассистента действительно удобна. Сири может осуществлять быстрый поиск файлов, сортировать их по типу, дате или ключевому слову. Например, если сказать Сири: «Покажи мои фотографии за вчерашний день», то откроется папка с соответствующими медиафайлами.

Активировать Siri на Mac можно несколькими способами:

Вероятно, в следующих версиях macOS появится больше команд для Siri, включая команды для HomeKit. Это будет логичным продолжением интеграции голосового помощника от Apple в свои ноутбуки и настольные компьютеры.

Функции Сири

Персональный ассистент Siri умеет отвечать на вопросы, давать рекомендации и выполнять команды. Давайте рассмотрим некоторые из них.

Это лишь малая часть всего того, что умеет Siri. Ознакомиться с большим количеством команд можно в нашей статье о командах для Сири . Полный же список команд для голосового помощника в айфонах и умных колонках Хоум Под вы найдете в нашем справочном мобильном приложении, которое мы регулярно обновляем. Скачать приложение «Команды Siri» можно бесплатно. Установив его, вы всегда будете иметь под рукой самый актуальный список команд для голосового помощника.

О чем стоит поговорить с девушкой из телефона.

Персональная голосовая помощница Siri появилась в iOS-устройствах в 2011 году. С того момента Apple активно развивает ее способность отвечать на самые сложные вопросы. Ниже дадим список полезных команд Сири, о которых ты мог не знать.

Описанное ниже работает на iPhone и iPad . Возможно, и на Mac с последней бета-версией macOS Sierra.

1. Найди фотографии, которые я сделал…

Siri умеет фильтровать сделанные фотографии по местоположению. Запрос «найди фотографии, которые я сделал в Москве» позволил мне легко найти нужные среди сотен фото из столицы России. Главное, чтобы в приложении фото был включен сервис геолокации. Также можно попросить Siri показать фотографии и видео за определенную дату, месяц или год.

2. Напомни мне о…

С помощью Siri очень легко создавать напоминания. Настолько, что перестал пользоваться одноимённым приложением. Запрос «напомни мне о статье, когда я вернусь домой» помогает лично мне, а вы экспериментируйте, сохраняя общую структуру фразы. Также напоминание можно сделать не по привязке к конкретной локации, а по времени – просто упомяните дату в формате «напомни в 22:00» .

3. Включи Bluetooth

Многие вещи Siri может делать быстрее тебя. Например, включать/выключать сетевые функции. Например, «включить Bluetooth» или «Авиарежим» . Правда, при этом Siri напомнит, что далее она не сможет работать без интернета.

4. Сколько будет…

Голосовая помощница умеет считать. Проговорите любое вычисление: «двадцать пять тысяч минус восемьнадцать тысяч двести тридцать один» , услышите результат вслух. Ещё Siri знает количество дней с определенной даты или до определенного события. Может даже сказать расстояние до определенного пункта. Но самое удобное – в возможности конвертировать величины . Сколько будет 300 футов в метрах, 45 унций в граммах и так далее.

5. Прочитай последнее сообщение от…

Siri умеет находить сообщения: просто попроси «прочитать последние сообщения от Артёма» . После этого предложит ответить под диктовку. Самое то, когда ты едешь или просто спешишь. Или если руки грязные.

6. Выключи свет в гостиной

Если твой дом оборудован smart-гаджетами, (например, умными лампочками), и в приложении HomeKit проведена соответствующая настройка, запросы о включении/выключении приборов Siri щелкает как орешки. Если, конечно, есть что щелкать – «установи температуру двадцать два градуса» или «выключи розетки в гостиной» .

7. Поставь будильник

Обычное дело, когда ложусь спать. «Разбуди меня в 7 утра» или «поставь будильник на девять двадцать пять» . Также настраивается и таймер.

8. Что за песня играет

Можно не включать Shazam, чтобы узнать название проигрываемой мелодии по радио. Достаточно об этом спросить Siri, она подскажет: «что за песня играет» или «что это за трек» . Кроме того, помощница добавляет найденный трек в специальную вкладку мобильной версии iTunes. Не потеряешь.

9. Включи музыку

Простой запрос, простой результат: «включи музыку» – включается музыка из плеера iOS. Кроме того, можно попросить запустить определенный плейлист, подборку и жанр. Ещё есть возможность запустить треки конкретных исполнителей или альбомов. Но будьте готовы мучаться с произношением их названий, особенно если они английские:)

Если ты подписан на Apple Music, помощница будет искать музыку среди 30 миллионов композиций. Мечта меломана.

10. Что с погодой

Siri понимает практически любые запросы, связанные с погодой: «какая погода» , «будет ли дождь сегодня» , «стоит ли брать зонт» , «какая погода будет вечером» , «какая температура сейчас» . Причём её ответы всегда немного разные, чётко соответствуют запросу. Может сказать про погоду в конкретный день недели, может ответить, стоит ли ждать солнца и так далее.

Это далеко не полный список возможных команд – он внушителен и постоянно расширяется новыми прошивками. Радует, что сегодня с Siri действительно можно общаться, и она реально экономит время. Что раньше было в фантастических фильмах, стало реальностью.

Вот только один вопрос:

сайт О чем стоит поговорить с девушкой из телефона. Персональная голосовая помощница Siri появилась в iOS-устройствах в 2011 году. С того момента Apple активно развивает ее способность отвечать на самые сложные вопросы. Ниже дадим список полезных команд Сири, о которых ты мог не знать. Описанное ниже работает на iPhone и iPad. Возможно, и на Mac с...

Siri - голосовой ассистент, который впервые был представлен в 2011 году вместе с iOS 5. Разумеется, с тех пор он серьезно развивался: научился говорить на разных языках (в том числе и на русском), пришел на компьютеры Mac, научился взаимодействовать с программами от сторонних разработчиков и т.д., но качественный скачок он сделал только с анонсом iOS 10 - теперь его голос основан на глубоком обучении, что позволяет ему звучать более естественно и плавно. Что такое глубокое обучение и как синтезируется голос Siri - об этом мы и поговорим в этой статье.

Введение

Синтез речи - искусственное воспроизведение человеческой речи - широко используется в различных областях, от голосовых помощников до игр. Недавно, в сочетании с распознаванием речи, синтез речи стал неотъемлемой частью виртуальных персональных помощников, таких как Сири.

Существуют две технологии синтеза речи, используемые в звуковой индустрии: выбор звуковых единиц и параметрический синтез. Синтез выбора единиц обеспечивает наивысшее качество при достаточном количестве высококачественных речевых записей, и, таким образом, это наиболее широко используемый метод синтеза речи в коммерческих продуктах. С другой стороны, параметрический синтез обеспечивает очень понятную и плавную речь, но имеет более низкое общее качество. Современные системы выбора звуковых единиц объединяют некоторые преимущества двух подходов, и поэтому они называются гибридными системами. Методы выбора гибридных единиц аналогичны методам классической селекции единиц, но они используют параметрический подход для прогнозирования того, какие звуковые единицы должны быть выбраны.

В последнее время глубокое обучение набирает обороты в области речевых технологий, и в значительной степени превосходит традиционные методы, такие как скрытые марковские модели (СММ), в принципе работы которых лежит разгадывание неизвестных параметров на основе наблюдаемых, при этом полученные параметры могут быть использованы в дальнейшем анализе, например, для распознавания образов. Глубокое обучение обеспечило полностью новый подход к синтезу речи, который называется прямое моделирование формы волны. Он может обеспечить как высокое качество синтеза выбора единиц, так и гибкость параметрического синтеза. Однако, учитывая его чрезвычайно высокие вычислительные затраты, реализовать его на пользовательских устройствах пока не получится.

Как работает синтез речи

Создание высококачественной системы преобразования текста в речь (TTS) для персонального помощника - непростая задача. Первый этап - найти профессиональный голос, звучание которого будет приятным, разбочивым и соответствующим личности Сири. Чтобы охватить некоторые вариации из огромного разнообразия человеческой речи требуется записать 10-20 часов речи в профессиональной студии. Сценарии записи варьируются от аудиокниг до инструкций по навигации, и от подсказок до ответов на остроумные шутки. Как правило, эта естественная речь не может использована в голосовом помощнике, потому что невозможно записать все возможные высказывания, которыми может говорить помощник. Таким образом, выбор звуковых единиц в TTS основан на разрезании записанной речи на ее элементарные компоненты, такие как фонемы, а затем их рекомбинации в соответствии с входным текстом для создания совершенно новой речи. На практике, выбор соответствующих сегментов речи и объединение их друг с другом непростая задача, поскольку акустические характеристики каждой фонемы зависят от соседних и интонации речи, что часто делает речевые единицы несовместимыми друг с другом. На рисунке ниже показано, как речь может быть синтезирована с использованием речевой базы данных, разделенной на фонемы:

В верхней части рисунка показано синтезированное высказывание «Синтез выбора единиц» и его фонетическая транскрипция с использованием фонем. Соответствующий синтетический сигнал и его спектрограмма показаны ниже. Речевые сегменты, разделенные линиями, являются непрерывными сегментами речи из базы данных, которые могут содержать одну или несколько фонем.

Основная проблема выбора звуковых единиц в TTS заключается в том, чтобы найти последовательность единиц (например, фонем), которые удовлетворяют входному тексту и предсказанной интонации, при условии, что они могут быть объединены вместе без слышимых сбоев. Традиционно процесс состоит из двух частей: front-end и back-end (входящие и выходящие данные), хотя в современных системах граница иногда может быть неоднозначной. Целью front-end является предоставление фонетической транскрипции и информации об интонации на основе исходного текста. Сюда же включается и нормализация исходного текста, который может содержать числа, сокращения и т.д.:

Используя символьное лингвистическое представление, созданное модулем текстового анализа, модуль генерации интонации предсказывает значения для акустических характеристик, таких как, например, продолжительность фразы и интонации. Эти значения используются для выбора соответствующих звуковых единиц. Задача выбора единицы имеет высокую сложность, поэтому современные синтезаторы используют методы машинного обучения, которые могут изучить соответствие между текстом и речью, а затем предсказать значения речевых функций из значений подтекста. Эта модель должна быть изучена на этапе обучения синтезатора с использованием большого количества текстовых и речевых данных. Входные данные для этой модели - это числовые лингвистические функции, такие как идентификация фонемы, слова или фразы, преобразованные в удобную численную форму. Выходной сигнал модели состоит из числовых акустических характеристик речи, таких как спектр, основная частота и продолжительность фразы. Во время синтеза обучаемая статистическая модель используется для сопоставления входных текстовых функций с речевыми функциями, которые затем используются для управления бэкэнд-процессом выбора звуковой единицы, где важны соответствующие интонации и длительность.

В отличие от front-end, бэкэнд в основном не зависит от языка. Он состоит из выбора нужных звуковых единиц и их конкатенации (то есть склейки) в фразу. Когда система обучается, записанные речевые данные сегментируются в отдельные речевые сегменты, используя принудительное выравнивание между записанной речью и сценарием записи (с использованием акустических моделей распознавания речи). Затем сегментированная речь используется для создания базы данных звуковых единиц. База данных дополнительно пополняется важной информацией, такой как лингвистический контекст и акустические характеристики каждой единицы. Используя построенную базу данных устройства и предсказанные интонационные функции, которые определяют процесс выбора, выполняется поиск Витерби (вверху - целевые фонемы, ниже - возможные звуковые блоки, красная линия - наилучшее их сочетание):

Выбор основан на двух критериях: во-первых, звуковые единицы должны иметь одну (целевую) интонацию, и, во-вторых, единицы должны быть, по возможности, объединены без слышимых сбоев на границах. Эти два критерия называются соответственно целевыми и конкатенационными расходами. Целевая стоимость - это разница между прогнозируемыми целевыми акустическими характеристиками и акустическими характеристиками, извлекаемыми из каждого блока, тогда как стоимость конкатенации представляет собой акустическую разницу между последующими единицами:

После определения оптимальной последовательности единиц отдельные звуковые сигналы конкатенируются для создания непрерывной синтетической речи.

Скрытые марковские модели (СММ) обычно используются в качестве статистической модели для целевых прогнозов, поскольку они непосредственно моделируют распределения акустических параметров, и, таким образом, их можно легко использовать для вычисления целевой стоимости. Тем не менее, подходы, основанные на глубоком обучении, часто превосходят СММ в синтезе параметрической речи.

Целью системы TTS Сири является подготовка единой модели, основанной на глубоком обучении, которая может автоматически и точно прогнозировать как целевые, так и конкатенационные затраты для звуковых единиц в базе данных. Таким образом, вместо СММ использует смесь плотности сети (СПС, mixture density network) для прогнозирования распределений по определенным признакам. СПС объединяют обычные глубокие нейронные сети (ГНС) с гауссовскими моделями.

Обычный ГНС представляет собой искусственную нейронную сеть с несколькими скрытыми слоями нейронов между входным и выходным уровнями. Таким образом, ГНС может моделировать сложную и нелинейную зависимость между входными и выходными характеристиками. Напротив, СММ моделирует распределение вероятностей выходных данных с учетом входных данных с использованием набора гауссовых распределений, и обычно обучается с использованием метода максимизации ожидания. СПС сочетает преимущества ГНС и СММ, используя ГНС для моделирования сложной взаимосвязи между входными и выходными данными, но обеспечивая распределение вероятностей на выходе:

Для Siri используется унифицированная целевая и конкатенационная модели на основе СПС, которые могут прогнозировать распределение как целевых характеристик речи (спектра, высоты тона и продолжительности), так и стоимости конкатенации между звуковыми единицами. Иногда речевые особенности, такие как аффиксы, довольно стабильны и развиваются медленно - например, в случае гласных. В другом месте речь может изменяться довольно быстро - например, при переходе между озвученными и невокализованными звуками речи. Чтобы учитывать эту изменчивость, модель должна иметь возможность корректировать свои параметры в соответствии с вышеупомянутой изменчивостью. СПС делает это используя отклонения, встроенные в модель. Это важно для улучшения качества синтеза, поскольку мы хотим рассчитать целевые и конкатенационные издержки, характерные для текущего контекста.

После подсчета единиц на основе общей стоимости с использованием СПС выполняется традиционный поиск по Витерби, чтобы найти лучшее сочетание звуковых единиц. Затем они объединяются с использованием метода совпадения с перекрытием формы волны, чтобы найти оптимальные моменты времени конкатенации для создания плавной и непрерывной синтетической речи.

Итоги

Для использования СПС в Сири было записано как минимум 15 часов высококачественных речевых записей на частоте 48 кГц. Речь была разделена на фонемы с использованием принудительного выравнивания, то есть было применено автоматическое распознавание речи, чтобы выровнять входную звуковую последовательность с акустическими характеристиками, извлеченными из речевого сигнала. Этот процесс сегментации привел к созданию примерно 1-2 миллионов фонем.

Чтобы провести процесс отбора звуковых единиц на основе СПС была создана единая целевая и конкатенационная модели. Входные данные для СПС состоят в основном из двоичных значений с некоторыми дополнительными функциями, которые представляют собой информацию о контексте (по две предшествующих и следующих фонемы).

Качество новой системы TTS Сири превосходит предыдущую - это подтверждают многочисленные тесты на картинке ниже (интересно, что лучше всего оценили как раз новый русский голос Сири):

Лучшее качество звука связано как раз с базой данных на основе СПС - это обеспечивает лучший выбор и конкатенацию звуковых блоков, более высокую частоту дискретизации (22 кГц против 48 кГц) и улучшенное сжатие звука.

Прочесть оригинал статьи (требуется хорошее знание английского и физики), а также послушать, как менялся голос Сири в iOS 9, 10 и 11, можно .

Летом на выставке WWDC 2011 компания Apple показа iOS 5, представив большинство новых функций, за исключением одной, презентацию которой отложили на несколько месяцев…

В октябре 2011 очередную презентацию Apple уже проводит не Стив Джобс , а новый глава компании Тим Кук . На этом мероприятии показывают iPhone 4S, и в самом конце евента, достаётся слово Скотту Форстоллу - старшему вице-президенту Apple по iOS на тот момент. И именно Скотт Форсталл представил всему миру бета-версию интеллектуального голосового помощника Siri, которая стала не только ключевым нововведением iOS 5, но и эксклюзивом для iPhone 4S.

Ликование толпы, критика обозревателей и журналистов… Сколько холивара породила Siri на страницах интернета? Почему Siri наделала столько шума?

Кто создал Siri?

Кто же создал Siri? Компания SRI International, являющаяся подразделением DARPA (Агентство по перспективным оборонным научно-исследовательским разработкам), в 2007 году начала работу над Siri, а не Apple , как многие предполагают.

Интересен тот факт, что Siri является результатом работы исследований, которые накапливались более сорока лет. Первоначальными разработчиками Siri стали Даг Китлаусс , Том Грюбер, Норман Винарский и Адам Чейнер. Главным исполнительным директором Siri являлся Даг Китлаус, но после того, как Siri купила компания Apple, Даг ушел с поста, что вполне логично.

Вообразите, насколько масштабна была предыстория создания Siri, а точнее объём работы исследователей в области распознавания и обработки голоса. Исследовательские группы из:

Университета Карнеги-Меллона, Университета штата Масачусетс
Университета Рочерстера, Стэнфордского университета
Университета Южной Калифорнии
Института по правам человека и познания машин
Университета штата Орегон

...работали долгие годы и накапливали информацию, прежде чем DARPA решила серьезно заняться разработкой компьютерного голосового ассистента.

Siri в iPhone 4S

И вот 4 октября 2011, на презентации iPhone 4S показывают Siri. Именно на ней компания Apple акцентирует внимание при пиаре очередного iPhone: Siri интегрирована в iPhone 4S , взаимодействует с основными приложениями iOS, отвечает на трудные вопросы - все это невероятно впечатляет всех тех, кто успел лично поработать с Siri.

Конечно, не обошлось без обвинений и критики. В адрес Apple посыпались обвинения в попытке выдать Siri за нечто новое и невероятное. По мнению некоторых, на других мобильных платформах нечто подобное уже было давно, а Apple снова не изобрела ничего нового...

Однако это не совсем так. Стоит лишь опробовать Siri в работе, как подобное мнение кардинально меняется. Известный критик Эльдар Муртазин , сохранял свое скептичное отношение к новинке, но лишь до того момента, пока iPhone 4S не попал ему в руки.

Так в чем же особенность Siri?

Что такого особенного в Siri? - вероятно, самый распространенный вопрос. Дело в том, что Siri ведет полноценный диалоговый разговор с пользователем. На момент анонса iPhone 4S Siri была еще в бета-версией, но это не так важно, потому что Siri постоянно совершенствуется и дорабатывается, при чем, все это происходит удаленно.

Кроме этого, Siri использует совершенствующуюся технологию распознавания речи человека, которую разработала компания Nuance Communications. Siri индивидуально приспосабливается к каждому пользователю: слушает и изучает своего владельца, анализируя его предпочтения. Это удивительно…

Как работает Siri?

Тут все очень интересно. Если другие голосовые помощники до этого работали просто с поисковой системой, то Siri работает с множеством сервисами, что позволяет точно отвечать на самые разные вопросы, в том числе и очень сложные.

Задав вопрос, он отравляется на сервера Apple (Siri), где обрабатывается и направляется к соответствующему сервису. А тут не только поисковые гиганты Google и Bing … Например, для деловых вопросов используются OpenTable, André Gayot, Citysearch, BooRah, Yelp Inc, Yahoo Local, ReserveTravel и Localeze. Для поиска информации о мероприятиях Siri обращается к Eventful, StubHub и LiveKick. Если спрашивать Siri о фильмах, то она отвечает, используя информацию с MovieTickets.com, Rotten Tomatoes и The New York Times... Таким образом голосовой ассистент от Apple справится с большинством повседневных вопросов, но ключевой особенностью является то, что Siri работает с WolframAlpha.

WolframAlpha позволяет Siri давать ответы на самые трудные вопросы, так как это не поисковая система. WolframAlpha позиционирует себя, как computational knowledge engine (перевод: база знаний и набор вычислительных алгоритмов).

Благодаря всему вышеперечисленному, Siri удается понимать речь человека и его вопросы, которые он задает в достаточно свободной форме, а не конкретные команды. На презентации в пример приводили вопрос: «Стоит ли мне сегодня взять зонтик ». Siri анализирует вопрос и понимает, что ей нужно ответить - какая погода ожидается в этой местности.

Конечно же, Siri еще не совершенна, но сам факт того, что такое решение появилось в мобильных телефонах не может не говорить о перспективном будущем технологии распознавания речи и компьютерных голосовых ассистентов.

И напоследок предлагаю Вам посмотреть небольшую подборочку .

Если вы не нашли ответа на свой вопрос или у вас что-то не получилось, а в комментаряих ниже нет подходящего решения, задайте вопрос через нашу . Это быстро, просто, удобно и не требует регистрации. Ответы на свой и другие вопросы вы найдете в разделе.