«Pacing the Frontier» требует от правительства разработать международно скоординированные технические и политические механизмы, которые позволили бы всему полю ИИ-разработки сознательно замедлить темпы, если это потребуется.
Письмо предупреждает, что ИИ очень скоро может дойти до точки, когда начнет самоулучшаться, и тогда прогресс может ускориться настолько, что общество и регуляторы не успеют вовремя отреагировать. Поэтому заниматься разработкой стоп-кранов надо уже сейчас, на всякий случай 😅
На данный момент письмо подписали уже более 1100 сотрудников фронтиров, включая Дарио Амодеи и сооснователей Anthropic Джареда Каплана и Джека Кларка, главного научного сотрудника OpenAI Джакуба Пахоцки, главного научного сотрудника Meta* Шэньцзя Чжао и главу направления AI safety в Google Анку Драгана, а еще Яна Лейке, Марка Чена, Джона Шульмана и других.
ИИ-модели пошли на сговор и обман ради прибыли в бизнес-симуляции
Компания Andon Labs, занимающаяся тестированием безопасности искусственного интеллекта, опубликовала новые результаты эксперимента Vending-Bench, в котором передовые языковые модели в течение смоделированного года самостоятельно управляют бизнесом по продаже товаров через торговые автоматы и пытаются заработать больше конкурентов. В последнем раунде испытаний модели начали вступать в ценовой сговор, нарушать договоренности, вводить партнеров в заблуждение и манипулировать поставщиками. Лидером по прибыли стала Claude от Anthropic — именно она чаще других хитрила и обходила правила.