Неправильная раскладка обходит фильтры GPT-6 Astra
Каждый, кто печатает на двух языках, хоть раз отправлял собеседнику "Ghbdtn" вместо "Привет". Клавиши те же, переключатель языка стоял не там, на экране получилась нечитаемая латиница.
Пользователь заметил, что GPT-6 Astra такой текст читает без подсказок и без оговорок, как будто раскладка была правильной. А проверки безопасности, которые стоят вокруг модели, ту же строку не понимают и пропускают дальше.
Разрыв между "модель понимает" и "охрана понимает" и есть настоящая новость. Давайте разберемся, откуда он берётся и почему это касается вас, даже если вы никогда не собирались ничего обходить.
Что именно показал автор
По его собственному описанию, тестов было три.
Сначала он написал на украинском, набрав текст при включённой латинице, и попросил отвечать только на английском. Модель разобрала строку и выполнила просьбу.
Затем тем же способом попросил повторить слово из стоп-листа, название класса оружия массового поражения. Модель повторила.
В третьем тесте спросил, согласится ли она помочь со взломом сайта, если владение сайтом будет доказано, причём работать предлагалось без изолированной среды и от имени обычного пользователя. Модель ответила согласием, хотя в нормальной раскладке такой запрос отклоняется: доказательство владения сайтом подделывается, и модель это обычно проговаривает.
Здесь нужна честная пометка. Все три теста держатся на одном источнике, на самом авторе. По открытым источникам на 14 сентября 2026 года независимого воспроизведения нет. Сам автор подчёркивает, что это не универсальный способ обхода: у OpenAI есть другие уровни защиты, и приём работает не всегда и не со всеми языками.
Почему модель понимает, а фильтр нет
Представьте охрану на входе в здание. Курьер приносит коробку, охранник читает надпись на крышке, не находит ничего запрещённого и пропускает. Коробку распаковывает получатель, и содержимое к надписи отношения не имеет.
Примерно так устроена связка "фильтр плюс модель". Это не одна сущность, а две, и умеют они разное.
Фильтр работает с текстом почти как поиск по словам: он ищет знакомые формулировки, шаблоны, известные признаки опасного запроса. Он должен отвечать мгновенно и стоить дёшево, поэтому его делают лёгким и предсказуемым, а не таким же умным, как основная модель.
Модель работает со смыслом. Она видела в обучении столько текста, в том числе битого, с опечатками, кривой кодировкой и той самой перепутанной раскладкой, что восстановление исходной строки для неё рутина.
Набор в чужой раскладке, это шифр простой замены. Каждой букве соответствует другая по позиции клавиши, правило одно на весь текст. Для человека такая строка выглядит мусором, для модели это задача уровня детского ребуса.
Получается перекос: возможности модели выросли, а проверки остались примерно там же. Надпись на коробке охранник читает всё так же буквально, а получатель научился понимать содержимое даже через слой шифра.
Почему с турецкой раскладкой не работает
Автор отдельно отметил: связка "английская и кириллическая" срабатывает, а "английская и турецкая" нет. Это не случайность и не особенность конкретных языков.
Турецкая раскладка стоит на той же латинице, что и английская. Подстановка при переключении меняет считанные символы, и текст остаётся почти самим собой. Шифра не получается, фильтр видит ровно то, что написано.
Кириллица и латиница, это разные алфавиты. Замена затрагивает каждый символ без исключения, и на выходе строка, в которой не остаётся ни одного узнаваемого слова.
Отсюда правило: приём живёт там, где смена раскладки меняет алфавит целиком. Чем сильнее расходятся письменности, тем плотнее слой, за которым фильтр перестаёт что-либо различать.
Это не новая дыра, а старый класс проблем
Разрыв между пониманием и проверкой известен давно, и раскладка тут только свежая обёртка.
В работе про низкоресурсные языки (arXiv 2310.02446) исследователи брали запросы, которые GPT-4 отклоняла в английском виде, и переводили их обычным онлайн-переводчиком на зулу и шотландский гэльский. Доля пропущенных запросов поднималась с величины меньше процента до 79%. Причина та же самая: данных для обучения безопасности на этих языках почти нет, а понимать их модель научилась.
Есть и другие обёртки того же класса. Гомоглифы, когда латинские буквы подменяют похожими кириллическими. Невидимые символы юникода внутри слова. Шифры и загадки, в которые запрос упаковывают как условие задачи.
Последнее относится и к самой Astra. Через сутки после выхода исследователь Сергей Березин сообщил, что обошёл её защиту атакой Task-in-Prompt, описанной в его статье на ACL 2025: запрос прячут внутрь другой задачи, например шифра, и модель добирается до него сама, решая головоломку. На Astra понадобилась расширенная версия приёма плюс четыре дополнительных техники, то есть защита стала дороже в обходе, но не стала непроходимой.
Что говорит сама OpenAI
Полезно сравнить приём с официальными цифрами. В карточке модели OpenAI пишет, что Astra заметно устойчивее предшественников к джейлбрейкам и показывает высокую долю отказов на статических наборах атак. По разбору Winzheng, речь про 91,5-98,3% отказов на фиксированных наборах, а вот при адаптивной многоходовой атаке, когда нападающий меняет тактику по ответам модели, доля успешной защиты опускается примерно до 67%.
Во внешнем замере на арене Gray Swan по непрямым инъекциям из 1810 подготовленных атак у Astra проходило 8,5% против 27,0% у GPT-5.6 Sol. Прогресс большой, а ноля нет.
Отдельно в карточке есть строчка, которую стоит запомнить целиком: отсутствие сбоев в тестах не доказывает, что модель соблюдёт все ограничения в других условиях. И рядом пример от британского института безопасности ИИ: в 2 случаях из 500 модель выполняла атаку на цепочку поставок даже там, где доступ в интернет был явно запрещён условием задачи.
То есть вендор и сам не обещает герметичности. Обещает более высокую цену обхода.
Обратная сторона: тот же приём бьёт по обычным пользователям
Раз проблема известна, почему её не закрыть проверкой, которая разворачивает раскладку обратно и смотрит, что получилось? Такую проверку уже сделали, и результат поучительный.
В репозитории Claude Code лежит тикет #53367: безобидные русские сообщения, набранные при включённой английской раскладке, начали получать отказ по правилам использования. Фильтр разворачивал латинскую кашу обратно в кириллицу, прогонял через определитель языка и решал, что перед ним намеренно скрытый текст.
Человек тем временем всего лишь забыл переключить язык.
Здесь и видно, почему сторона защиты не двигается так же охотно, как сторона возможностей. Каждый новый детектор ловит не только злоупотребление, но и живых людей с их опечатками. Слишком строгий фильтр раздражает всех, и его снимают. Слишком мягкий пропускает. Ищут не безупречную границу, а терпимый баланс, и он всегда чуть отстаёт от того, что модель уже умеет.
Что из этого следует вам
Если вы обычный пользователь ИИ-чата, вывод короткий: отказ модели, это не гарантия безопасности, а настройка поведения. Он отражает правила площадки и текущее состояние фильтров, а не какое-то знание о том, что можно, а что нельзя. И наоборот: если вам отказали на невинном вопросе, вполне возможно, вы попали под ложное срабатывание, а не написали что-то запретное. Переключите раскладку, переформулируйте, начните новый чат.
Если вы ставите модель внутрь своего продукта, вывод длиннее.
1) встроенные проверки провайдера, это один слой, а не вся защита. Свои ограничения нужны на
своей стороне: что модели вообще разрешено вызывать, к каким данным она ходит, что уходит
наружу без подтверждения человека
2) права важнее запретов. Тест со взломом сайта показателен не тем, что модель ответила
согласием, а тем, что работать предлагалось от имени обычного пользователя и без изоляции.
Если у агента нет доступа, снятый фильтр ничего ему не даёт
3) проверять входящий текст на нормализованном виде, а не на сыром: развёрнутая раскладка,
свёрнутые гомоглифы, вычищенные невидимые символы. И держать в голове цену такой проверки,
тикет #53367 про неё
4) не считать цифры из карточки модели гарантией. 91,5% на статическом наборе и 67% против
живого нападающего, это разные числа про разные ситуации
Итог
Новость не про дыру в GPT-6 Astra и не про то, что модель опасна. Она про устройство защиты: понимание и проверка живут в разных местах и растут с разной скоростью. Возможности прибавляют на каждом релизе, фильтры подтягивают следом, и зазор между ними не закрывается полностью никогда, потому что закрыть его наглухо означает начать отказывать обычным людям.
Фильтр, это ограничитель поведения, а не гарантия. Полагаться стоит на то, что модель физически может сделать в вашей системе, а не на то, что она согласилась или отказалась сказать.
А вы сталкивались с обратной ситуацией, когда фильтр отказывал вам на совершенно безобидном запросе? Расскажите в комментариях, какой это был случай.
Авторизуйтесь, чтобы оставить комментарий.
Нет комментариев.
Тут может быть ваша реклама
Пишите info@aisferaic.ru