Как работает рассуждающая модель
Обычная LLM генерирует ответ токен за токеном сразу после запроса. Рассуждающая модель сначала пишет длинную внутреннюю цепочку рассуждений: раскладывает задачу на шаги, пробует варианты, замечает ошибки и возвращается назад. Пользователь видит только итоговый ответ — у OpenAI o1 цепочка скрыта намеренно.
Этому поведению модели учат через обучение с подкреплением. В статье о DeepSeek-R1 авторы показали, что способность к рассуждению можно развить «чистым» обучением с подкреплением, без размеченных человеком примеров рассуждений. Платой становятся вычисления на этапе инференса: чем дольше модель «думает», тем точнее ответ и тем он дороже.
Вехи
| Дата | Событие |
|---|---|
| 12 сентября 2024 | OpenAI выпускает o1-preview и o1-mini; в анонсе компания сообщает, что o1 решает 83% задач математического экзамена AIME против 13% у GPT-4o |
| 5 декабря 2024 | Выходит полная версия o1 |
| 20 января 2025 | DeepSeek-R1: открытые веса, лицензия MIT, шесть дистиллированных моделей меньшего размера |
| 24 февраля 2025 | Claude 3.7 Sonnet — гибридная модель: обычный режим и расширенное мышление в одной модели |
На сентябрь 2026 года глубину рассуждений у крупных API задают параметром запроса — у OpenAI это reasoning effort, у Anthropic — бюджет или адаптивный режим мышления.
Плюсы и минусы для e-commerce
| Задача ассистента | Обычная LLM | Рассуждающая модель |
|---|---|---|
| Доставка, возврат, статус заказа | Быстро и достаточно | Избыточно: медленнее и дороже |
| Подбор по одному-двум параметрам | Справляется | Выигрыш небольшой |
| Сравнение 5 товаров по 6 критериям | Может перепутать характеристики | Сильная сторона |
| Комплект под бюджет, проверка совместимости | Чаще ошибается в арифметике и условиях | Сильная сторона |
| Многошаговые действия агента | Чаще теряет план | Планирует и проверяет шаги |
Рассуждения не отменяют галлюцинаций: если в контексте нет данных о товаре, модель по-прежнему может их выдумать, только аргументированнее.
Практика: маршрутизация в онлайн-ассистенте
- Классифицируйте запрос. Быстрый классификатор или правила решают, простой вопрос или сложный.
- Простые вопросы — быстрой модели. FAQ, наличие, доставка, уточнение размера.
- Сложные — рассуждающей. Сравнение, комплекты, совместимость, многошаговые сценарии ИИ-агента.
- Задайте бюджет. Ограничьте глубину рассуждений и время ответа; для первой реакции покажите короткую фразу вроде «Сравниваю модели по вашим критериям».
- Меряйте. Сравнивайте p95 задержки, стоимость диалога и конверсию в A/B-тесте, а не только качество ответа на тестовых вопросах.