Безопасность · 26 сентября 2026 г.

Также опубликовано на Italiano, Français, Norsk

Billennium представила Baszta-1 для обнаружения рискованного контента в системах искусственного интеллекта

person using macbook pro on white table
Dan Nelson / Unsplash

Компания Billennium разработала Baszta-1, специализированную модель безопасности, которая работает на польском языке. Данное решение является частью AI Governance Suite, набора инструментов, предназначенного для помощи организациям в контроле за использованием искусственного интеллекта.

Модель Baszta-1 представляет собой классификатор на базе архитектуры HerBERT и содержит около 124 миллионов параметров. Она была создана польской командой Billennium для распознавания пяти категорий рискованного контента: ненависть, вульгарность, секс, преступность и причинение вреда себе. Компания предоставила модель для публичного тестирования и опубликовала документацию, в которой описаны ее создание, калибровка и ограничения.

В ходе сравнительного тестирования в бенчмарке Out-of-Distribution Gadzi Język лучшая конфигурация Baszta-1 показала результат 0,927 micro-F1, в то время как для модели Sójka, также известной как Bielik Guard, этот показатель составил 0,582. В категории macro-F1 результаты составили 0,699 и 0,619 соответственно, однако компания отметила, что преимущество во втором показателе носит ориентировочный характер и не является статистически однозначным.

При тестировании после калибровки на сбалансированном наборе данных, включающем рискованный и безопасный контент, Baszta-1 достигла показателя 0,952 macro-F1. При этом доля ложных срабатываний для безопасных текстов составила 5,5 процента. Представители компании подчеркнули, что результаты бенчмарков сами по себе не определяют готовность модели к внедрению, так как ключевое значение имеют качество обучающих данных и соответствие реальным запросам пользователей.

Baszta-1 позиционируется как первый инструмент из планируемой группы специализированных моделей. Она призвана помочь организациям в соблюдении регуляторных требований, таких как AI Act, позволяя отслеживать используемые модели, доступ к данным, затраты и правила безопасности. Модель позволяет проводить калибровку на данных, отражающих реальную среду организации, что помогает эффективнее выявлять риски и сокращать количество ложных тревог.