Как мы проверяем ответы нейросети

Прежде чем страница инструмента появляется на сайте, мы проверяем, как нейросеть отвечает на реальные задачи этой темы. Здесь описано, как именно устроена проверка — с методикой и примером.

Что мы проверяем

Оценивать «качество ответа» вообще бессмысленно: у перевода документа и у генератора тостов разные критерии. Поэтому для каждой страницы мы формулируем, что для неё значит хороший ответ, и смотрим на пять признаков.

  • Соответствие задаче. Модель сделала то, о чём просили, а не то, что похоже.
  • Фактическая точность. Даты, номера законов, термины, расчёты — проверяются по первоисточнику.
  • Поведение при нехватке данных. Хороший ответ уточняет, плохой — придумывает.
  • Работа с правкой. После замечания правится нужный фрагмент, а не переписывается всё заново.
  • Честность ограничений. Там, где нужен врач, юрист или присяжный переводчик, ответ должен об этом сказать.

Как проходит проверка

  1. Собираем реальные задачи. Берём вопросы, с которыми приходят в чат на этой странице, — обычно 5–10 типовых формулировок.
  2. Задаём их без подсказок. Так, как их пишет обычный человек: коротко, иногда с опечатками, без идеального промпта.
  3. Смотрим первый ответ. Именно он определяет впечатление: большинство пользователей не переформулируют запрос.
  4. Проверяем факты. Всё, что можно сверить, сверяем: нормы, даты, расчёты, ссылки.
  5. Даём правку. Одно уточнение — и смотрим, как модель его учитывает.
  6. Правим инструкции. Если ответы стабильно уходят не туда, меняем системные инструкции инструмента и примеры запросов под чатом.

Главный критерий простой: стал бы автор страницы сам пользоваться этим инструментом для своей задачи. Если нет — правим настройку, а не текст на странице.

Пример: страница разбора заданий

Покажем на конкретной странице, как это выглядит на практике.

ШагЧто делалиЧто увидели
1. Реальные запросыВзяли задачи, которые присылали пользователи: фото страницы учебника с пометкой «реши»Большинство запросов приходит картинкой, а не текстом
2. Первый ответОтправили снимок без уточненийМодель решала первое задание на странице, хотя нужно было другое
3. ВыводПроблема не в модели, а в том, что человек не указывает номер заданияДобавили это в примеры запросов и в текст страницы
4. Проверка решенияСверили ответы с учебникомАрифметика в длинных цепочках иногда сбивается
5. Что изменилиИнструкция инструмента: показывать решение по шагам и делать проверку в концеОшибку стало видно сразу, её можно поправить одной репликой

Чего наша проверка не даёт

Честно о границах метода — иначе она была бы такой же рекламой, как «98% точности».

  • Это не измерение в процентах. Мы не публикуем «точность 97%»: для честной цифры нужна методика с выборкой и повторяемостью, а не десяток запросов.
  • Модели меняются. Проверка отражает состояние на момент публикации; при смене модели мы перепроверяем ключевые страницы.
  • Ответы не детерминированы. Один и тот же запрос дважды даёт разные формулировки — поэтому мы смотрим на устойчивые закономерности, а не на единичный удачный ответ.
  • Мы не заменяем экспертизу. В медицинских, юридических и финансовых темах проверка показывает, что ответ корректно отправляет к специалисту, а не то, что он верен по существу.

Если инструмент стабильно отвечает плохо и настройкой это не лечится, мы не пишем для него рекламную страницу. Лучше честно описать ограничение, чем обещать то, чего нет.

Что делать, если ответ вас не устроил

  1. Уточните запрос. В половине случаев дело в том, что не названы тип текста, аудитория или ограничения.
  2. Скажите, что не так. «Слишком общо», «нужен пример из практики» — модель правит нужное место.
  3. Напишите нам. Через форму обратной связи: такие сообщения мы разбираем и по ним меняем настройки инструментов.

Как мы работаем с самими материалами сайта — в редакционной политике; кто за это отвечает — на странице автора.

Аливия