Помогите, я разговариваю со своим компьютером. Это удивительно удобно и совершенно неловко.
Десять лет назад Google представил голосовой ввод с приложением Gboard на Android, а год спустя эта функция появилась на iPhone с приложением клавиатуры. Я никогда не обращал на это особого внимания. Главная причина заключалась в том, что это просто не было достаточно точно.
Большое обещание заключалось в совершенно новом способе взаимодействия с нашими телефонами, но этого никогда не было достаточно, чтобы заставить меня отказаться от нажатия или проведения пальцем по экранной клавиатуре. Переносимся в 2026 год, я разговариваю с компьютером. На самом деле, эта вся статья была продиктована и скопирована в WordPress.
Изменения, которые мне пришлось внести, заключались в добавлении нескольких запятых, разбиении пары предложений точкой и превращении нескольких пунктов в связное предложение. Если бы я должен был оценить это в процентах, я бы сказал, что лишь 2% усилий, потраченных на написание этой статьи, были посвящены нажатию клавиш на клавиатуре для внесения вышеупомянутых изменений.
Вот и все. Но фаза влюбленности заканчивается довольно быстро, когда на вас накатывают социальные осознания.
Старт с размахом
Виталий Гариев / Unsplash / Digital Trends
Я впервые начал использовать голосовую диктовку после того, как попробовал Wispr Flow. Это пугающе точно. И когда я говорю "пугающе точно", я имею в виду это как человек, чей родной язык не английский, и у меня нет ярко выраженного американского или британского акцента. И все же, каждый раз, когда я пишу статью, я поражаюсь, насколько точным и удобным является весь этот процесс.
Это также сделало меня невероятно ленивым и одновременно гораздо более продуктивным.
Я управляю новостной редакцией, и это означает, что скорость — единственный путь к вознаграждению в виде высокого ранжирования и видимости в поиске Google. На самом деле, это был первый урок, который мне преподали, когда я начал заниматься журналистикой в одной из самых уважаемых новостных редакций Индии. "Скорость — это суть." Вот что говорил мой первый редактор и почти вбил это в мой рабочий процесс.
Я религиозно следовал этому девизу. Но с тех пор как я начал использовать Wispr Flow, я был поражен тем, как быстро я теперь могу писать и публиковать срочные новости. Прошлой ночью я смог составить статью объемом около 500 слов менее чем за шесть минут. Я мог бы сделать это быстрее, если бы английский был моим родным языком, но шесть минут — это все равно невероятно быстрый темп по современным стандартам.
Это мой сигнал. Мой компьютер слушает. Надим Сарвар / Digital Trends
Это умопомрачительное удобство также сделало меня совершенно ленивым. Каждый раз, когда мне нужно прикоснуться к клавиатуре, чтобы сделать что-то, что нельзя выполнить голосовым вводом, я чувствую явную борьбу. Я думал, может быть, это клавиатура с чиклетами на моем ноутбуке, которая наконец-то утратила свою привлекательность.
Чтобы проверить теорию, я попробовал низкопрофильную клавиатуру, а затем переключился на механическую клавиатуру в надежде, что это разожжет мою любовь к набору текста. Я был заблуждающимся. С клавиатурами тоже не было ничего плохого. Если бы это были короткие всплески наборов текста, я бы с удовольствием наслаждался кремовым звуком и тактильным опытом. Я просто стал безнадежно зависимым от диктовки своих статей и болтовни по поводу своих ежедневных обязанностей в редакции.
Пророчество сбылось
Это будущее вычислений? Похоже на то. Это все еще не идеально. Голосовой ввод все еще предназначен для задач, где вы либо пишете длинные черновики, либо просто подсказываете свои действия с помощью ИИ-агента, такого как ChatGPT или Gemini. Кремниевая долина полностью продана этой идее, и это даже дало начало термину "голосовой зависимый".
К сожалению, я считаю себя одним из тех, кто стал голосовым зависимым.
Каждый раз, когда я сталкиваюсь с этой дилеммой, я возвращаюсь к одной из заметок, которые Билл Гейтс поделился в 2023 году. "Вам не придется использовать разные приложения для разных задач. Вы просто скажете своему устройству на повседневном языке, что хотите сделать," — написал он, ровно через год после того, как ChatGPT был впервые выпущен публично и создал новую вычислительную революцию.
В мае прошлого года Сэм Альтман, генеральный директор OpenAI, компании, стоящей за ChatGPT, дал интервью Sequoia и высказал предвидение о голосе как новом рубеже для взаимодействия человека и компьютера. Вот его цитата:
"Я думаю, что голос имеет чрезвычайно важное значение. Честно говоря, мы еще не создали достаточно хороший голосовой продукт. Это нормально. Как и нам потребовалось время, чтобы создать достаточно хорошую текстовую модель. Мы в конечном итоге разгадаем этот код, и когда мы это сделаем, я думаю, многие люди захотят использовать голосовое взаимодействие гораздо больше."
Это было примерно в то же время, когда Wispr Flow только начинал набирать популярность. Я впервые серьезно попробовал его, когда он появился на iPhone, а затем установил его на свой Mac. Да, лимит диктовки на бесплатных аккаунтах был немного разочаровывающим, поэтому я кратко экспериментировал с платной подпиской.
В конечном итоге я отменил подписку и начал использовать приложение для Android, которое предлагает неограниченный голосовой ввод для бесплатных аккаунтов в качестве ограниченного предложения. Несколько недель назад я переключился на Willow Voice, который почти так же точен и абсолютно бесплатен. С тех пор я не оглядывался назад.
Моя человечность и беспокойство мира
Набор текста продолжает казаться утомительным, и несмотря на некоторые раздражающие опечатки из-за проблем с акцентом, я все равно нахожу себя, долго нажимая кнопку fn, чтобы просто диктовать свои статьи, составлять длинные сообщения для команды или даже просто вести свои обычные переписки с Клодом по поводу домашних проектов.
Надим Сарвар / Digital Trends
Это просто освобождает, и в то же время это расстраивает меня каждый раз, когда я возвращаюсь к задаче, требующей ручной работы на клавиатуре.
Здесь ситуация становится для меня немного неловкой. Не имеет значения, работаете ли вы в офисе или вы один из тех людей, кто носит ноутбук в ближайшее кафе для своей повседневной работы. Если вы тот, кто смотрит на экран своего ноутбука и продолжает говорить долгое время, это просто кажется странным.
Теперь повсеместное наличие беспроводных наушников делает ситуацию немного менее неловкой. AirPods сделали естественным видеть людей, просто гуляющих и разговаривающих с собой, в то время как встроенный микрофон на наушниках захватывает и передает все, что они говорят. Но говорить с человеком и с компьютером — это две совершенно разные вещи.
Когда вы говорите с человеком, обычно присутствует чувство дружелюбия, скромности и, что самое важное, человеческих эмоций. Когда вы разговариваете с другом по телефону, вы не чувствуете себя неловко. Если вы приняли звонок в общественном месте, это просто стало частью нашей нормальной жизни — говорить, не прижимая телефон к уху.
Но когда вы говорите с компьютером, эмоций нет. Вы звучите роботизированно и используете слова, которые обычно не произносите, разговаривая с человеком. Это просто набор инструкций, но современные модели ИИ достаточно умны, чтобы превратить эти бессвязные предложения во что-то значимое и продолжить с ними как с командами.
Мы считаем, что инструменты, на которых люди ведут свой бизнес, все движутся в сторону голосового управления. Один из основателей, с которым мы столкнулись, уже там. Он говорит вместо того, чтобы печатать почти все, а остальная часть его дня вращается вокруг этого. Какие инструменты вы не могли бы использовать без них? pic.twitter.com/bupBikudcL— Willow (@WillowVoiceAI) 3 августа 2026 года
Я чувствую себя неловко каждый раз, когда начинаю диктовать статью или сообщение. "Почему этот парень вдруг говорит о том, как модель ИИ Anthropic вышла из-под контроля и взломала сторонние сервисы?" "Почему он болтает о том, как Google исправляет ошибку Bluetooth на своих телефонах Pixel?" "Почему этот парень случайно и периодически говорит о том, как следовать правилам дизайна интерфейса Apple?"
Все вышепереч
Другие статьи
Помогите, я разговариваю со своим компьютером. Это удивительно удобно и совершенно неловко.
Я использую инструменты голосовой диктовки на основе ИИ, такие как Wispr Flow и Willow, уже несколько месяцев. Они чрезвычайно удобны, но в то же время довольно неудобны.
