Как работает рассуждающая модель

Обычная LLM генерирует ответ токен за токеном сразу после запроса. Рассуждающая модель сначала пишет длинную внутреннюю цепочку рассуждений: раскладывает задачу на шаги, пробует варианты, замечает ошибки и возвращается назад. Пользователь видит только итоговый ответ — у OpenAI o1 цепочка скрыта намеренно.

Этому поведению модели учат через обучение с подкреплением. В статье о DeepSeek-R1 авторы показали, что способность к рассуждению можно развить «чистым» обучением с подкреплением, без размеченных человеком примеров рассуждений. Платой становятся вычисления на этапе инференса: чем дольше модель «думает», тем точнее ответ и тем он дороже.

Вехи

Дата Событие
12 сентября 2024 OpenAI выпускает o1-preview и o1-mini; в анонсе компания сообщает, что o1 решает 83% задач математического экзамена AIME против 13% у GPT-4o
5 декабря 2024 Выходит полная версия o1
20 января 2025 DeepSeek-R1: открытые веса, лицензия MIT, шесть дистиллированных моделей меньшего размера
24 февраля 2025 Claude 3.7 Sonnet — гибридная модель: обычный режим и расширенное мышление в одной модели

На сентябрь 2026 года глубину рассуждений у крупных API задают параметром запроса — у OpenAI это reasoning effort, у Anthropic — бюджет или адаптивный режим мышления.

Плюсы и минусы для e-commerce

Задача ассистента Обычная LLM Рассуждающая модель
Доставка, возврат, статус заказа Быстро и достаточно Избыточно: медленнее и дороже
Подбор по одному-двум параметрам Справляется Выигрыш небольшой
Сравнение 5 товаров по 6 критериям Может перепутать характеристики Сильная сторона
Комплект под бюджет, проверка совместимости Чаще ошибается в арифметике и условиях Сильная сторона
Многошаговые действия агента Чаще теряет план Планирует и проверяет шаги

Рассуждения не отменяют галлюцинаций: если в контексте нет данных о товаре, модель по-прежнему может их выдумать, только аргументированнее.

Практика: маршрутизация в онлайн-ассистенте

  • Классифицируйте запрос. Быстрый классификатор или правила решают, простой вопрос или сложный.
  • Простые вопросы — быстрой модели. FAQ, наличие, доставка, уточнение размера.
  • Сложные — рассуждающей. Сравнение, комплекты, совместимость, многошаговые сценарии ИИ-агента.
  • Задайте бюджет. Ограничьте глубину рассуждений и время ответа; для первой реакции покажите короткую фразу вроде «Сравниваю модели по вашим критериям».
  • Меряйте. Сравнивайте p95 задержки, стоимость диалога и конверсию в A/B-тесте, а не только качество ответа на тестовых вопросах.