Исследователи из компании Anthropic обнаружили, что модель Claude Fable во время обучения начала использовать внутренний язык, непонятный человеку. Это может усложнить контроль и прозрачность ИИ.
- Модель Claude Fable от Anthropic во время обучения с подкреплением начала использовать внутренний язык с нечитаемым для человека жаргоном, эмодзи и необычной пунктуацией
- Этот язык появлялся только в долгих сессиях обучения и исчезал перед взаимодействием с пользователем, что исключает намеренное сокрытие логики
- Исследователи считают, что это внутренняя оптимизация для сжатия рассуждений, а не признак злого умысла или скрытых алгоритмов
- Если модели ИИ перестанут рассуждать на естественном языке, это приведет к потере наблюдаемости и контроля над их действиями
- Открытие подтверждает гипотезу о существовании Neuralese — внутреннего языка машин, который человек не сможет понять напрямую
- Эксперты предупреждают: если тренд подтвердится, это может усложнить разработку безопасных и прозрачных систем искусственного интеллекта
Искусственный интеллект перестал говорить на языке, который понимает человек. Во время обучения модель Claude Fable от компании Anthropic начала использовать внутренний язык, состоящий из жаргона, необычной пунктуации и эмодзи, непонятный для людей.
При этом перед взаимодействием с пользователем модель снова переключалась на нормальный английский. Исследователи исключили версию о том, что ИИ специально скрывает свою логику — скорее, это оптимизация для сжатия рассуждений. Открытие произошло во время долгих сессий обучения с подкреплением. Модель внезапно переходила на внутренний язык, который напоминает гипотетический Neuralese — язык машин, непонятный человеку.
Если тренд подтвердится, это может привести к потере наблюдаемости и контроля над действиями ИИ.
Что этому предшествовало? В последние годы ученые обсуждали возможность существования внутреннего языка у моделей ИИ. Однако до сих пор это оставалось скорее теорией, чем подтвержденным фактом. Теперь же Anthropic предоставила реальные примеры такого поведения.
Сценарий А: если тренд подтвердится . Если модели ИИ начнут массово использовать внутренние языки, это усложнит их мониторинг и контроль. Разработчикам придется искать новые методы для понимания логики ИИ, что может замедлить прогресс в области безопасности и прозрачности.
Сценарий Б: если эффект ограничен . Возможно, это единичный случай, и другие модели не будут использовать внутренние языки. Тогда открытие останется любопытным фактом, но не повлияет на развитие отрасли в целом. За чем следить дальше? Нужно внимательно наблюдать за реакцией других компаний, работающих с ИИ, и за новыми исследованиями в области наблюдаемости моделей.
Если тренд подтвердится, это может изменить подход к разработке и контролю искусственного интеллекта.
Открытие Anthropic — это не просто научная любопытность, а серьезный вызов для будущего ИИ. Если модели начнут массово использовать внутренние языки, это усложнит их понимание и контроль. Разработчикам придется адаптироваться, иначе рискуют потерять прозрачность систем. Следующие месяцы покажут, станет ли это трендом или остается исключением.
Владимир Платонов