Новости ИИ

Как сравнить нейросети на своих задачах: проверка по шагам

Sergey
Автор
Sergey
Опубликовано 28.09.2026
0,0
Views 2

Сравнить нейросети для своей работы надёжнее всего на трёх-пяти собственных задачах: одинаковые запросы, одни и те же исходные материалы и критерии оценки, записанные заранее. Так проверяет новые модели руководитель десктопного приложения Codex в OpenAI Эндрю Амброзино. В интервью, отрывок из которого Fireside Alpha опубликовал 27 сентября 2026 года, он рассказал, что каждую новую модель просит переписать приложение Codex на Rust с библиотекой интерфейсов GPUI.

Для проверки Амброзино выбрал задачу из своей работы: приложение, которое делает его команда. По его словам, сложность в ней не только техническая: приложение работает на нескольких платформах, и функции во всех версиях должны совпадать. Такая проверка показывает, справится ли модель с его реальной работой. Общий рейтинг модели на этот вопрос не отвечает.

Почему бенчмарки не показывают, какая нейросеть подойдёт вам

Бенчмарк, это набор задач, который собрали авторы теста. Результат бенчмарка показывает, как модель решает эти задачи в среднем. Письмо вашему клиенту, выжимка из вашего договора и пост в вашем стиле в такие наборы не входят.

Разница между моделями на конкретной задаче бывает заметнее разницы в рейтинге. Одна и та же модель может выиграть одну рабочую задачу и проиграть соседнюю, это видно на замере в разделе ниже. Как выглядят цифры бенчмарков в анонсе новой модели, показано в разборе GPT-6 Sol и Luna.

Какие задачи взять для проверки нейросети

Для проверки нейросети подходят задачи, которые вы делаете регулярно и результат которых можете оценить сами, без помощи другой нейросети. Трёх-пяти задач достаточно: при большем числе ответы трудно сравнивать между собой.

Примеры задач для проверки:

1) письмо клиенту с конкретными условиями: сроки, цена, что входит в работу

2) выжимка из длинного документа, который вы сами хорошо знаете

3) формула для таблицы с несколькими условиями

4) пост или описание товара в вашем стиле по образцу

5) картинка с надписью на русском языке, если вы работаете с изображениями

В каждой задаче полезно заложить подвох, ответ на который вы знаете заранее. В письме это условие из середины переписки, в выжимке это цифра из середины документа. Подвох показывает, прочитала ли модель материал целиком.

Как записать запросы для сравнения нейросетей

Запрос для проверки записывается один раз и дальше не меняется. Если переформулировать запрос для следующей модели, в сравнение попадёт разница формулировок, и разницу моделей от неё уже не отделить.

Что сохранить для каждой задачи:

1) полный текст запроса

2) исходные материалы: документ, таблицу, образец текста

3) критерии, по которым вы оцените ответ

4) ответы прошлых моделей, чтобы новую было с чем сравнить

Каждую модель стоит проверять в новом диалоге. В старом диалоге модель видит прошлую переписку, и ответ зависит от неё.

Один ответ модели ещё не результат проверки. Нейросеть на один и тот же запрос отвечает по-разному, поэтому каждую задачу разумно прогнать на каждой модели хотя бы два раза.

Как оценить ответы нейросетей

Критерии оценки записываются до того, как вы увидели ответы. Иначе впечатление от первого удачного ответа влияет на оценку остальных.

Критерии, которые подходят для большинства задач:

1) факты и цифры совпадают с исходными материалами

2) выполнены все условия запроса

3) сколько правок нужно, чтобы ответ можно было отправить

4) сколько стоил ответ и сколько времени заняла генерация

Результаты проверки удобно свести в таблицу: строки это задачи, столбцы это модели, в ячейке число правок или короткая пометка об ошибке. После двух-трёх проверок по такой таблице видно, какой модели какую работу отдавать.

Что показала проверка моделей на задачах нашего канала

14 августа 2026 года мы проверили несколько моделей на рабочих задачах канала aisferaic на YouTube. Две задачи из этого замера: составить план роликов с учётом уже запланированных тем и написать закадровый текст для шортса по правилам канала.

На плане роликов лучший результат дала самая дешёвая из четырёх моделей, проверенных на этой задаче, deepseek-v4-flash. Прогон стоил 1,66 ₽ против 7,4 ₽ у glm-5.2, 9,2 ₽ у qwen3.7-max и 32 ₽ у claude-sonnet-5. Модель deepseek-v4-flash единственной прочитала список уже запланированных тем и не стала их повторять.

На закадровом тексте deepseek-v4-flash проиграла. По правилам канала в конце текста стоит дословная фраза и упоминание платформы: модель заменила часть фразы своими словами и пропустила упоминание. Закадровый текст мы оставили за glm-5.2, которая выполнила оба условия.

На замере 11 сентября 2026 года более дешёвая модель на двух задачах из трёх потратила больше токенов и времени, чем модель, на которой задачи уже работали. Низкая цена токена не гарантирует низкую цену готового результата.

На замере канала aisferaic модель deepseek-v4-flash закрыла одну задачу лучше дорогих моделей и провалила другую. Средний рейтинг такую разницу не показывает, её видно только на своих задачах.

Как часто повторять проверку нейросетей

Проверку стоит повторять при выходе каждой новой модели, которую вы рассматриваете для работы. Запросы и критерии уже записаны, поэтому повторная проверка занимает время одного прогона. Амброзино работает так же: задача у него одна и та же, меняется только модель.

Ответы прошлых моделей стоит хранить рядом с новыми. Без сохранённых ответов новая модель сравнивается с воспоминанием о старой.

Частые ошибки при сравнении нейросетей

1) запрос меняется от модели к модели

2) вывод делается по одному ответу

3) выбрана задача, правильность ответа в которой вы проверить не можете

4) проверка идёт в старом диалоге с прошлой перепиской

5) сравнивается цена токена, а считать нужно цену готового результата

Где сравнить несколько нейросетей в одном окне

В чате платформы aisferaic.ru собрано больше 20 моделей: Claude, Gemini, DeepSeek, Qwen, MiniMax, Kimi и GLM. Модель переключается в том же окне, оплата идёт по токенам без подписки, поэтому для проверки нескольких моделей не нужен отдельный тариф в каждом сервисе. При переключении в том же окне переписка сохраняется, поэтому для чистого сравнения каждую модель лучше запускать в новом диалоге. Готовые запросы для типовых задач есть в каталоге промптов.

Коротко

Как сравнить нейросети для своей работы? Взять три-пять своих регулярных задач, дать всем моделям одинаковые запросы и оценить ответы по критериям, записанным заранее.

Почему не выбрать нейросеть по рейтингу? Рейтинг показывает средний результат на задачах авторов теста. На замере канала aisferaic 14 августа 2026 года самая дешёвая модель выиграла одну задачу и проиграла другую.

Сколько раз прогонять задачу на одной модели? Хотя бы два раза: ответы на один и тот же запрос различаются.

Как часто повторять проверку? При выходе каждой новой модели, которую вы рассматриваете для работы.

Авторизуйтесь, чтобы оставить комментарий.

Комментариев: 0

Нет комментариев.

Тут может быть ваша реклама

Пишите info@aisferaic.ru

Похожие новости