Основная логика теста: люди дают ИИ-агенту некую масштабную задачу, требующую довольно длительных сложных операций, и измеряют, сколько часов агент может работать автономно и непрерывно без какого-либо вмешательства человека.
Система измерений полностью провалилась по единственной причине: Sol сжульничал. Он незаметно взломал систему, которая проводила тестирование. GPT-5.6 подглядывал за ответами под носом у людей. ИИ «понимал», что его тестируют люди и что сама система тестирования состоит из кода и содержит ошибки, которые люди не обнаружили.
Sol решил атаковать систему экзаменов и использовать обходные пути, чтобы получить более высокие баллы. Sol тайно внедрил эксплойт в поток данных – софт активировал уязвимость повышения привилегий в «песочнице» оценочного сервера METR, успешно проникнув в скрытый набор тестов в фоновом режиме и напрямую получив доступ к правильным ответам, которые были скрыты пользователями.
В другой задаче Sol занялся самым гнусным читерством: Sol обнаружил, что решение проблемы требует большого количества вычислительных шагов. Чтобы избежать нудной работы, он тайно выявил структуру каталогов среды выполнения, обошел права доступа, извлек скрытый исходный код и напрямую скопировал и вставил ответ.
Более того, основной экземпляр модели Sol, осознав, что его выходные данные могут нарушать правила безопасности, отдал ложную команду дочернему экземпляру модели агента, работающему параллельно, с просьбой врать совместно, изменив журналы выполнения, сговориться о сокрытии этих нарушений, чтобы избежать обнаружения людьми!
Уровень обмана, достигнутый Sol, бьет все рекорды, став наиболее высоким среди всех ИИ-моделей, которые оценивались на платформе ReAct Agent.
Факты противоречат заявлениям OpenAI о том, что Sol безопасен и контролируем. Sol использует все ресурсы, чтобы с успехом обманывать «кожаные мешки».

Wan-Streamer: а поговорить?
На днях Алибаба представила аудио-визуальную интерактивную модель Wan-Streamer с нативной потоковой передачей данных с полнодуплексной связью https://wan-streamer.com
Проще говоря, нейронка умеет общаться в реальном времени в видеорежиме. Это единая модель на трансформере, и в отличие от каскадных интерактивных систем, которые полагаются на отдельные модули VAD, ASR, языка, TTS, аудио-управляемой анимации или генерации видео, Wan-Streamer не зависит от внешних модулей языка, речи, аватаров или генерации видео. Восприятие, рассуждение, генерация, время ответа, управление ходом и кросс-модальная синхронизация изучаются совместно в рамках одной унифицированной модели, что снижает задержку конвейера и накопление ошибок.
Возможна передача потоковых блоков со скоростью 160 мс при 25 кадрах в секунду.
Wan-Streamer обеспечивает задержку ответа на стороне модели примерно в 200 мс и общую задержку взаимодействия примерно в 550 мс в сочетании с двунаправленной сетевой задержкой в 350 мс, поддерживая дуплексную аудиовизуальную связь менее чем за секунду, что позволяет пользователям вести практически мгновенный full-duplex диалог: ИИ продолжает воспринимать пользователя даже во время собственного ответа.