Thinking против Instruct

Thinking стоила в 15,6 раза дороже. Дешёвая версия пропустила один баг

Две версии одной Qwen получили одинаковую задачу на TypeScript. Обе собрали код. Потом пришёл тест с часовым поясом — и экономия стала чуть менее убедительной.

Марина, редакция TokenTool8 минут
Две похожие бумажные машины сортируют карточки со временем: сложная кладёт карточку правильно, простая ошибается лотком

Мы дали двум версиям одной Qwen задачу, которая с виду похожа на сортировку массива. Thinking съела 3,2863 ₽ и 5 974 токена. Instruct — 21 копейку и 693 токена. Экономия была прекрасна ровно до даты с часовым поясом.

Обе модели вернули готовый код без объяснений. Обе прошли строгую проверку TypeScript. Если остановиться здесь, вывод готов: зачем платить в пятнадцать раз больше. Мы не остановились.

01

Одна задача, две соседние Qwen

Нужна была функция, которая выбирает следующую неудачную задачу для повторного запуска. Перед выбором она обязана убрать дубликаты, оставить самую свежую запись, отбросить исчерпанные попытки и будущие даты, а затем честно разрулить ничьи по времени, числу попыток и идентификатору.

Звучит скучно. Поэтому и годится для теста: здесь нельзя выиграть эффектным ответом. Либо очередь запускает правильную задачу, либо однажды повторно списывает деньги, отправляет письмо или дёргает внешний сервис.

В режиме сравнения TokenTool мы одновременно запустили qwen/qwen3-next-80b-a3b-thinking и qwen/qwen3-next-80b-a3b-instruct. Промпт, исходные условия и ключ были одинаковыми. Системного промпта не было.

Просили только код. Уверенно объяснить, почему неверная дата на самом деле верная, не получалось.

02

На карточке победила дешёвая

Один промпт · code only

Qwen3 Next 80B Thinking

Время
28,95 с
Токены
5 974
Цена
3,2863 ₽
Проверки
9 из 9

Один промпт · code only

Qwen3 Next 80B Instruct

Время
60,81 с
Токены
693
Цена
0,2101 ₽
Проверки
8 из 9

Instruct потратила в 8,6 раза меньше токенов и обошлась в 15,6 раза дешевле. Забавно, но ждала она дольше: 60,81 секунды против 28,95. На этом месте бухгалтер уже закрыл вкладку с Thinking. Пришлось открыть обратно.

03

Потом в тест пришёл часовой пояс

Мы прогнали ответы через девять независимых проверок. Thinking прошла все. Instruct прошла восемь и споткнулась о выбор самой свежей записи, когда две даты были записаны в разных часовых поясах.

10:00 с поясом −02:00 — это 12:00 по UTC.
11:30 UTC — это 11:30 по UTC.

Первая запись на полчаса новее. Но если сравнивать строки, «11:30» выглядит больше «10:00». Именно так Instruct выбрала старое состояние.

Код компилировался, обычные даты проходили, сортировка выглядела прилично. Баг жил в одном сравнении строк. В рабочей очереди он может вернуть к запуску уже закрытую задачу. А дальше всё зависит от содержимого: безобидный повтор, двойное письмо, лишний запрос или повторная операция.

04

Дороже ли значит выгоднее

В этом прогоне Thinking оказалась в 15,6 раза дороже за один ответ, но в 2,1 раза быстрее и единственная выдала решение, прошедшее весь набор проверок. Дешёвый ответ с незамеченным дефектом стоит не 21 копейку. К нему прилагаются поиск причины, второй запрос и иногда разбор того, что успело произойти между ними.

Это не коронация Thinking. На форматировании JSON, извлечении полей или маленькой правке она легко может сжечь лишние токены без заметной пользы. Цена имеет смысл только рядом с результатом: сколько стоило получить ответ, который выдержал вашу проверку.

Самая дешёвая модель — та, после которой задача закончилась. Название режима тут вторично.

05

Когда сначала брать Instruct, а когда — Thinking

Формат, классификация, извлечение

Начните с Instruct. Критерий понятен, ответ короткий, результат легко проверить схемой или тестом.

Даты, деньги, права доступа

Thinking разумнее поставить первой: один тихий промах может стоить дороже десятков правильных запросов.

Запутанные правила и несколько условий

Сравните обе версии на одном наборе скрытых примеров. Интуиция по названию модели обычно слабее теста.

Агент пишет код в цикле

Считайте все попытки до зелёной сборки. Цена красивого первого ответа для проекта почти бесполезна.

Рабочая схема простая: сначала формулируем проверку, потом сравниваем модели, затем оставляем самый дешёвый маршрут, который эту проверку стабильно проходит. Если задача меняется, старый победитель не получает пожизненную должность.

Свой тест вместо чужого рейтинга

Возьмите одну задачу, на которой ошибка правда что-то портит

В Playground можно поставить Thinking и Instruct рядом, отправить один промпт и сразу увидеть время, токены и итоговое списание. До запуска запишите несколько неприятных примеров — иначе победит ответ, который лучше выглядит.

Для эксперимента используйте отдельный ключ и лимит. Так тест не смешается с рабочим продуктом, а модель после выбора поменяется без новой интеграции.

Граница эксперимента

Тест проведён 15 сентября 2026 года в TokenTool Playground: по одному запуску каждой модели на одной задаче. Он не доказывает, что любой Thinking-маршрут всегда лучше Instruct. Суммы, время и токены взяты из карточек результата TokenTool; внутренние цены поставщиков и служебные данные не публикуются.