Лаборатории почти не пишут, как остановить вышедшую из-под контроля модель
Guidelight AI Standards оценила публичные планы сдерживания у OpenAI, Google, Anthropic, Meta и xAI и нашла мало конкретики, что именно отключат. Выше всех OpenAI — 3 из 5; ниже всех по опубликованным планам Anthropic и Meta.

22 августа TechCrunch рассказал, как Guidelight AI Standards разобрала публичные планы сдерживания у OpenAI, Google, Anthropic, Meta и xAI. В немногих из них сказано, что именно лаборатория отключит, если модель выйдет из-под контроля.
Что известно
- Guidelight AI Standards оценила публичные планы сдерживания OpenAI, Google, Anthropic, Meta и xAI.
- Мало кто указывает, что именно будут отключать.
- Высший балл у OpenAI — 3 из 5; ниже всех по опубликованным планам Anthropic и Meta.
- В работе участвует Стивен Адлер, бывший исследователь безопасности OpenAI.
- OpenAI заявила, что уже ставила на паузу нагрузки или снимала модель с линии.
Takeaways
- В открытых текстах о сдерживании по-прежнему редко называют выключатель.
- У Guidelight лидирует OpenAI с 3 из 5, Anthropic и Meta — внизу рейтинга.
- OpenAI говорит, что уже останавливала нагрузки или снимала модель.
Source: TechCrunch


