AXON · Reasoning systems · est. 2024

Research

Что мы узнаём.

Публикации, заметки и результаты нашей работы над рассуждающим ИИ.

6 материалов
Метод 2026-06

Показываем, что явная цепочка рассуждений повышает точность и объяснимость на сложных задачах.

Явная цепочка рассуждений превращает ответ из чёрного ящика в проверяемый вывод. Мы сравнили режимы «сразу ответ» и «шаги + ответ» на 1 200 задачах: точность выросла на 16 пунктов, а ошибки стало возможно локализовать до конкретного шага. Отдельно показываем, как штраф за пропуск проверочных шагов меняет поведение модели.

Системы 2026-05

Разбор устройства модели, которая планирует и проверяет свои шаги.

AXON-R1 разделяет планирование и исполнение: планировщик строит дерево гипотез, исполнитель проверяет ветки и отбрасывает тупики. Верификатор оценивает каждый шаг до того, как он попадёт в итоговую цепочку. Разбираем, почему такая декомпозиция стабильнее монолитного вывода на задачах с длинным горизонтом.

Безопасность 2026-04

Почему вывод без объяснения нельзя доверять в ответственных задачах.

Если вывод нельзя проверить, его нельзя и доверить: в медицине, праве или финансах это не опция, а требование допуска. Мы формулируем минимальный стандарт объяснимости — воспроизводимая цепочка, ссылки на источники, явные допущения. И показываем, как встроить его в продукт, не убив скорость ответа.

Агенты 2026-03

Механизмы самопроверки и отказа от действия при неуверенности.

Автономный агент опасен не тем, что ошибается, а тем, что не замечает этого. Мы учим агентов оценивать уверенность перед каждым действием и останавливаться, когда она ниже порога. На длинных сценариях это сокращает необратимые ошибки на порядок при почти той же полноте выполнения.

Оценка 2026-02

Методология оценки способности рассуждать, а не запоминать.

Большинство бенчмарков измеряют память, а не мышление: ответы давно утекли в обучающие данные. Наш протокол генерирует свежие задачи с контролируемой сложностью и проверяет устойчивость к переформулировкам. Разрыв между «знает» и «рассуждает» виден только на таких задачах.

Исследование 2026-01

Когда архитектура важнее размера модели.

Рост параметров даёт убывающую отдачу там, где задача требует структуры, а не эрудиции. В контролируемых экспериментах модель на 70B со структурированным выводом обходит вдвое большую без него. Обсуждаем, где проходит граница и когда масштаб всё-таки выигрывает.

[ → ] Access

Готовы к раннему доступу?

Запросить доступ