В пятницу вечером мне пришло голосовое от знакомого с просьбой скинуть денег «срочно, объясню позже». Голос — вроде его, интонации похожи, только звучит чуть чище обычного. Я хотел уже открыть приложение банка, но что-то остановило: перезвонил. Оказалось, номер угнали, а голосовое сделали нейросетью по паре старых аудио из соцсетей. После этого я решил на своей шкуре проверить, насколько люди вообще способны отличить настоящий голос от синтетического — и заодно понять, что с этим делать.
Голосовое от «начальника» в пятницу вечером
История с угнанным номером — не моя выдумка, такое реально гуляет по чатам последние месяцы. И цифры из свежего опроса это подтверждают: с видео люди справляются неплохо, распознают подделку в трёх случаях из четырёх. А вот с голосом всё хуже — больше половины путаются. Мне это показалось странным: голос ведь короче, проще, там нет мимики и фона, которые обычно выдают ИИ. Решил проверить на себе за один вечер, без всякой аналитики — просто честный слепой тест.
Как я собрал шесть голосовых для теста
Взял бесплатный сервис генерации голоса — из тех, что сейчас массово гуляют в сети без регистрации и без ограничений на количество загрузок. Загрузил туда пятнадцать секунд своей речи из старого видео, дал сгенерировать три фразы: «Привет, купи хлеб», «Скинь денег на карту, потом объясню» и «Слушай, я задержусь на час». Плюс записал три такие же фразы своим настоящим голосом, но в разных условиях — одну на кухне с шумом чайника, одну в машине, одну в тихой комнате. Итого шесть аудио, три настоящих, три синтетических, все перемешал и отправил двум приятелям без подсказок: угадайте, где я, а где робот.
Кстати, на обучение самого сервиса ушло примерно полторы минуты — он «слушал» образец голоса, а потом уже выдавал готовые фразы за пару секунд каждая. Никакой магии, просто быстрая генерация по короткому образцу.
Что услышали мои приятели
Первый угадал четыре из шести — неплохо, но не идеально. Второй угадал только три, то есть по факту гадал наугад. Оба ошиблись именно на той фразе про «скинь денег» — записанной синтетически. Видимо, короткие деловые фразы без эмоций легче подделать, чем что-то живое и растянутое. А вот фразу про хлеб, сказанную нейросетью, оба узнали сразу — там голос звучал слишком гладко, без единой запинки, что для бытовой фразы неестественно. Мы же в реальной жизни мычим, делаем паузы, поправляемся.
Я сам, кстати, тоже путался. Причём именно на своём собственном голосе — было странное ощущение, что слушаешь запись, а не узнаёшь себя. Голос был похож процентов на восемьдесят, но интонация в конце предложений у синтетики какая-то ровная, будто без дыхания.
Три признака, которые выдают синтетику
После шести прослушиваний и обсуждения с приятелями выписал то, что реально помогает на слух:
- Идеально чистый звук без фона — если человек говорит вроде бы из машины или с улицы, а слышно как в студии, это подозрительно.
- Отсутствие пауз, вдохов и слов-паразитов — живая речь почти всегда немного неряшливая, а синтетика говорит слишком гладко.
- Ровная интонация на эмоционально важных словах — там, где человек обычно повышает голос или делает акцент (например, «срочно» или «сейчас»), у ИИ-голоса интонация часто одинаковая на протяжении всей фразы.
Ни один из этих признаков не работает стопроцентно сам по себе, но вместе они дают неплохую подсказку. Кстати, я потом для интереса спросил у одной текстовой нейросети (гонял через Claude, который сейчас доступен бесплатно с ограниченным числом запросов в день), какие признаки синтетической речи она сама может назвать — список получился почти таким же, только более занудным и техническим.
Что я оставил себе после этого вечера
Никакого чудо-инструмента для распознавания голоса я не нашёл — и, честно говоря, не уверен, что он вообще массово доступен обычному человеку без специальной техники. Зато оставил себе простую привычку: если голосовое сообщение просит денег, доступ к чему-то важному или срочное действие — я перезваниваю или пишу текстом с уточняющим личным вопросом, который знает только этот человек. Это работает лучше любого анализа интонаций.
А ещё теперь я иначе слушаю рекламные ролики и озвучку в коротких видео — где раньше не задумывался, откуда голос, теперь ловлю себя на том, что прислушиваюсь к паузам и дыханию. Забавно, но за один вечер эксперимента ухо реально «обучается» замечать мелочи, которые раньше проходили мимо.
А вы бы отличили голосовое от друга, если бы его сгенерировала нейросеть? Пробовали проверять на слух?
Понравился разбор? Подпишитесь на канал — впереди ещё больше материалов про нейросети в обычной жизни, работе и учебе. А ещё больше — в нашем Telegram-канале «Нейробудни». Своим опытом и вопросами делитесь в комментариях.



