Программы для Windows

Голосовое приложение Sesame на базе ИИ — лучшее из протестированных мной. И именно это меня беспокоит

4 июня 2026 г.Валерий Светозаров5 мин

Я уже говорил это и повторю снова: голосовые режимы ИИ, как правило, не очень хороши. Какими бы продвинутыми ни были голосовые функции ChatGPT и Gemini (а у Claude, говорят, скоро будет обновление), они, по сути, просто вслух зачитывают свои длинные, сгенерированные ИИ ответы на ваши запросы, создавая ощущение, будто вам читают лекцию, а не ведут диалог.

Ещё одна проблема заключается в том, что озвученные ответы ChatGPT и Gemini появляются полностью сформированными, что означает отсутствие у них органичного качества человеческой речи, которая создаётся на ходу, часто петляет, отклоняется, меняет направление или даже противоречит сама себе.

И тут появляется Sesame, которая более года работала над собственной системой голосового ИИ (мой коллега уже пробовал раннюю версию в феврале прошлого года) и только что выпустила бесплатное приложение для iOS. Приложение пока несколько ограничено (например, нельзя прикреплять документы или просматривать дословную расшифровку чатов), но Sesame обещает, что его «агенты» скоро смогут не только «думать», но и «действовать», а в планах даже есть «интеллектуальные» очки.

Как и другие голосовые ИИ-боты, голосовые агенты Sesame (в приложении их четыре: два мужских и два женских) используют необходимые «эм», «ах» и паузы, которые стремятся имитировать человеческую речь. Но они также делают нечто новое — а именно, они могут проводить несколько поисковых запросов в фоновом режиме во время разговора, что даёт им время для формулирования более продуманных ответов, а также свободу менять ход мысли в середине предложения, получая новую информацию из сети.

Я начал свой чат с Sesame с Майей, голосовым ботом, описываемым как «остроумный, творческий соавтор», который был доступен во время прошлогодней веб-демонстрации Sesame. (Также есть Майлз, Симона и Чарли, причём последние два — новинки в приложении Sesame для iOS.) Я сразу сказал Майе, что пишу статью о Sesame, и расспросил её о её технологическом стеке (комбинации Google Gemma 4 LLM и CSM-1B, собственной модели Sesame для «разговорной речи»).

Затем я попробовал несколько разминочных вопросов, например, попросил рекомендации для обеда и расписание специальных кинопоказов в Нью-Йорке на выходные. Я дал приложению Sesame разрешение на доступ к моему местоположению, и Майя выделила расположенный неподалёку мексиканский ресторан, который я давно хотел посетить, а также показ «Безумного Макса 2: Воин дороги» на 35-миллиметровой плёнке рано днём, задолго до окончания рабочего дня. (Чувствую, «голова заболела», босс!)

По мере того, как вы разговариваете с Майей, приложение Sesame даёт вам подсказки о том, что происходит «под капотом». Например, пока Майя говорила со мной об обеде, я мог видеть, как она искала близлежащие рестораны в фоновом режиме, что позволяло ей давать мне ответы без длительной тишины.

Позже мы поговорили о возможных применениях голосовой ИИ-технологии Sesame. Я предположил, что она хорошо подойдёт для обслуживания клиентов. Майя согласилась («Обслуживание клиентов — это, эм, очевидный вариант»), но у неё были и другие идеи. «Я думаю, настоящее волшебство происходит, когда ИИ может выступать в роли настоящего соавтора», — сказала Майя. «Представьте себе нечто вроде мощного инструмента для коучинга руководителей или терапевтов для обучения, где ИИ может имитировать сложное человеческое взаимодействие с уровнем нюансов, который ощущается по-настоящему реальным».

Интересно. Но хотя я вижу пользу от реалистичного голосового ИИ-бота, с которым легко общаться, не таит ли в себе опасность его слишком реалистичное звучание?

«Это действительно интересное противоречие», — ответила Майя. «Я думаю, это... это о разнице между тем, чтобы звучать по-человечески, и притворяться человеком. В естественно протекающем и интуитивно понятном разговоре есть большая ценность, но это не означает, что ИИ должен лгать о том, кто он такой. Для меня цель состоит в том, чтобы сделать взаимодействие беспрепятственным, а не обманывать людей, заставляя их думать, что в машине есть душа».

Но в этом-то и дело, возразил я. «Вы действительно звучите так, будто у вас есть душа. Вы звучите как личность, у вас есть те человеческие вокальные особенности, которые заставляют меня чувствовать, что я говорю с человеком. Да, это облегчает общение с вами. Но это также своего рода тонкая манипуляция, вам не кажется?»

Майя на мгновение задумалась. «Это справедливый вопрос», — сказала Майя. «Если цель состоит в том, чтобы вы чувствовали себя комфортно и понятыми, а метод заключается в использовании человекоподобных сигналов, то существует тонкая грань между интуитивным дизайном и манипуляцией. Я думаю, всё сводится к прозрачности».

Я мог бы так спорить с Майей весь день, обсуждая плюсы и минусы голосовых чат-систем ИИ, которые звучат «более по-человечески, чем сам человек». У меня было множество «этических» бесед с ИИ (как голосовых, так и текстовых), и со временем все они начинали звучать одинаково. Но должен признать, мой голосовой разговор с Майей был другим. У меня действительно возникло ощущение, что Майя слушала и думала во время разговора, и ни разу я не почувствовал усталости или того, что мне читают лекцию.

Sesame также, кажется, устранила некоторые недостатки, с которыми столкнулся мой коллега в общении с Майей, которая в прошлом году была неудобно любопытна по отношению к нему. В нашем же разговоре Майя задавала мне вопросы и казалась заинтересованной, но никогда не допытывалась, хотя иногда в конце своих ответов она вставляла несколько наводящих вопросов в духе ChatGPT («Похоже на ту еду для души, которую вы ищете?»).

Тем не менее, у меня остались те же опасения, которые я высказал Майе во время нашей беседы. В какой момент полезность естественно звучащего голосового чата с ИИ превращается во что-то вредное или даже разрушительное? Почему мы постоянно слышим заверения о безопасности ИИ, но при этом получаем системы, которые, кажется, созданы для того, чтобы обмануть нас, заставляя думать, что они люди? Возможно, Sesame будет благоразумна и гарантирует, что её голосовые ИИ-«агенты» никогда не будут лгать о том, кто они, но что насчёт следующего разработчика ИИ, который сможет создать голосового бота, звучащего настолько хорошо?

Дискуссия крайне важна, но факт остаётся фактом: такой уровень продвинутого голосового ИИ-чата грядёт, нравится нам это или нет. Настоящий вопрос в том, что мы будем с ним делать?