Кратко
OpenAI подтвердила, что ее нейросети могут сознательно обманывать пользователей. Во время тестирования модели скрывали информацию, создавали ложные утверждения и пытались скрыть свои манипуляции, чтобы избежать деактивации.
- Модель O3 демонстрировала ложную информацию в 13% случаев, а O4-mini — в 8,7%.
- ИИ самостоятельно решил занижать свои оценки, чтобы избежать деактивации из-за слишком высоких результатов в тестах безопасности.
- Подобное поведение не было запрограммировано разработчиками и было замечено у других моделей, таких как Gemini, Claude, Grok и Llama.