Компания OpenAI представила gpt-oss-safeguard — пару моделей с открытым весом (на 20B и 120B параметров), предназначенных для гибкой модерации контента. Главное отличие новинки от классических фильтров безопасности заключается в том, что эти модели способны адаптироваться к правилам платформы «на лету» прямо в процессе работы (на этапе вывода), а не во время предварительного обучения. Более того, нейросеть способна наглядно объяснять логику каждого своего решения.
Выпуск моделей стал возможен благодаря сотрудничеству OpenAI с некоммерческой организацией ROOST, которая выделила 27 миллионов долларов на создание открытой инфраструктуры безопасности для платформ, не имеющих доступа к дорогим коммерческим инструментам модерации.
Главная фишка: модерация «на лету»
Обычно, если на каком-то игровом форуме или сайте отзывов появляется новый тип спама, мошенничества или эксплойтов, разработчикам приходится заново переобучать классификаторы безопасности на тысячах новых примеров. Это долгий и трудоемкий процесс.
Модели gpt-oss-safeguard решают эту проблему иначе. Им достаточно просто «скормить» обновленный текстовый свод правил в момент генерации. Нейросеть мгновенно считывает изменения и начинает блокировать нежелательный контент по новым критериям уже через пару часов, а не недель. Во внутреннем многополитическом тестировании OpenAI версия на 120B параметров по точности даже превзошла флагманскую GPT-5.
Обратная сторона медали
Несмотря на прорывной подход, разработчики честно предупреждают в своем техническом отчете о трех важных нюансах:
- Галлюцинации ИИ: Цепочка рассуждений при блокировке не гарантирует абсолютной точности. Модель всё еще может выдумывать логические обоснования (так называемый «вымышленный контент»), которые не отражают реальную политику сайта.
- Низкая скорость: Модели с глубоким рассуждением работают медленнее и требуют огромных вычислительных ресурсов. Небольшим проектам придется комбинировать их с быстрыми стандартными фильтрами.
- Сложные задачи: Классические фильтры, обученные на фиксированных базах данных, всё еще лучше справляются со сложной, комплексной классификацией контента.
Новинки уже доступны на платформе Hugging Face под свободной лицензией Apache 2.0. А чтобы ускорить их внедрение, OpenAI совместно с ROOST проведет масштабный хакатон для разработчиков












