Изометрическая шахматная доска лабиринт с неоновыми дорожками данных и стеклянными серверами кубами

Лаборатория Thinking Machines снизила затраты на обучение ИИ

Обучение современных моделей искусственного интеллекта — это невероятно дорогой процесс. До сих пор инженеры использовали два основных подхода, и у каждого были свои минусы. Первый — это обучение с подкреплением (RL), когда модель учится на своих ошибках, но получает оценку только в самом конце (как в шахматах: победа или поражение). Второй — контролируемая настройка (SFT), когда ИИ просто зубрит примеры экспертов, но не умеет исправлять собственные баги. Оба метода работают, но они экономически неэффективны.

Исследовательская лаборатория Thinking Machines представила гибридный метод под названием on-policy distillation (дистилляция политик). Новая технология позволяет добиться точности лучших алгоритмов, затрачивая всего 10% от прежней мощности видеокарт. В ходе тестов математическая модель достигла 70% точности на сложнейшем экзамене AIME’24, потратив всего 1800 часов работы GPU вместо прежних 17 920 часов.

В чём суть прорыва?

Идея метода напоминает парную игру в шахматы. Модель-«ученик» генерирует свои ответы, а более крупная и умная модель-«учитель» (в тестах использовали Qwen3-32B для обучения Qwen3-8B) оценивает каждое отдельное слово (токен) в режиме реального времени. Программа сразу подсвечивает ученику, где произошла «грубая ошибка», а где был сделан «блестящий ход».

Основные преимущества технологии:

  • Оценка каждого шага: ИИ анализирует весь процесс мышления по каждому токену, а не только финальный результат.
  • Колоссальная экономия: Метод повышает эффективность вычислений в логических задачах в 9–30 раз.
  • Решение проблемы «забывчивости»: При обычной донастройке на узкие данные ИИ часто глупеет и забывает, как общаться в чате. Новый метод позволяет внедрять в нейросеть корпоративные знания без потери качества общения.

Главная загвоздка и применение

Технологию уже тестируют ученые из Стэнфорда, Принстона и Беркли на платформе Tinker для доказательства сложных теорем и вывода химических формул.

Однако у метода есть практическое ограничение: для обучения маленького ИИ всегда нужен очень мощный и дорогой ИИ-«учитель». Пока неясно, насколько выгодно будет использовать эту схему коммерческим компаниям, если закрытые топ-модели окажутся слишком дорогими по API. Тем не менее, если технология масштабируется на юриспруденцию и программирование, она может в корне изменить экономику всей индустрии искусственного интеллекта.


Прокрутить вверх