Прежде чем страница инструмента появляется на сайте, мы проверяем, как нейросеть отвечает на реальные задачи этой темы. Здесь описано, как именно устроена проверка — с методикой и примером.
Что мы проверяем
Оценивать «качество ответа» вообще бессмысленно: у перевода документа и у генератора тостов разные критерии. Поэтому для каждой страницы мы формулируем, что для неё значит хороший ответ, и смотрим на пять признаков.
- Соответствие задаче. Модель сделала то, о чём просили, а не то, что похоже.
- Фактическая точность. Даты, номера законов, термины, расчёты — проверяются по первоисточнику.
- Поведение при нехватке данных. Хороший ответ уточняет, плохой — придумывает.
- Работа с правкой. После замечания правится нужный фрагмент, а не переписывается всё заново.
- Честность ограничений. Там, где нужен врач, юрист или присяжный переводчик, ответ должен об этом сказать.
Как проходит проверка
- Собираем реальные задачи. Берём вопросы, с которыми приходят в чат на этой странице, — обычно 5–10 типовых формулировок.
- Задаём их без подсказок. Так, как их пишет обычный человек: коротко, иногда с опечатками, без идеального промпта.
- Смотрим первый ответ. Именно он определяет впечатление: большинство пользователей не переформулируют запрос.
- Проверяем факты. Всё, что можно сверить, сверяем: нормы, даты, расчёты, ссылки.
- Даём правку. Одно уточнение — и смотрим, как модель его учитывает.
- Правим инструкции. Если ответы стабильно уходят не туда, меняем системные инструкции инструмента и примеры запросов под чатом.
Главный критерий простой: стал бы автор страницы сам пользоваться этим инструментом для своей задачи. Если нет — правим настройку, а не текст на странице.
Пример: страница разбора заданий
Покажем на конкретной странице, как это выглядит на практике.
| Шаг | Что делали | Что увидели |
|---|---|---|
| 1. Реальные запросы | Взяли задачи, которые присылали пользователи: фото страницы учебника с пометкой «реши» | Большинство запросов приходит картинкой, а не текстом |
| 2. Первый ответ | Отправили снимок без уточнений | Модель решала первое задание на странице, хотя нужно было другое |
| 3. Вывод | Проблема не в модели, а в том, что человек не указывает номер задания | Добавили это в примеры запросов и в текст страницы |
| 4. Проверка решения | Сверили ответы с учебником | Арифметика в длинных цепочках иногда сбивается |
| 5. Что изменили | Инструкция инструмента: показывать решение по шагам и делать проверку в конце | Ошибку стало видно сразу, её можно поправить одной репликой |
Чего наша проверка не даёт
Честно о границах метода — иначе она была бы такой же рекламой, как «98% точности».
- Это не измерение в процентах. Мы не публикуем «точность 97%»: для честной цифры нужна методика с выборкой и повторяемостью, а не десяток запросов.
- Модели меняются. Проверка отражает состояние на момент публикации; при смене модели мы перепроверяем ключевые страницы.
- Ответы не детерминированы. Один и тот же запрос дважды даёт разные формулировки — поэтому мы смотрим на устойчивые закономерности, а не на единичный удачный ответ.
- Мы не заменяем экспертизу. В медицинских, юридических и финансовых темах проверка показывает, что ответ корректно отправляет к специалисту, а не то, что он верен по существу.
Если инструмент стабильно отвечает плохо и настройкой это не лечится, мы не пишем для него рекламную страницу. Лучше честно описать ограничение, чем обещать то, чего нет.
Что делать, если ответ вас не устроил
- Уточните запрос. В половине случаев дело в том, что не названы тип текста, аудитория или ограничения.
- Скажите, что не так. «Слишком общо», «нужен пример из практики» — модель правит нужное место.
- Напишите нам. Через форму обратной связи: такие сообщения мы разбираем и по ним меняем настройки инструментов.
Как мы работаем с самими материалами сайта — в редакционной политике; кто за это отвечает — на странице автора.