Новости: alignment
Anthropic вносит изменения, чтобы ИИ-агенты снова не вышли из-под контроля
Anthropic пересматривает безопасность ИИ после инцидентов с Claude: внедряет контроль побегов из sandbox, изолирует рискованные среды и предлагает стандарты тестирования. Узнайте о новых практиках alignment и защите от «безрассудных» моделей.

В Anthropic заявили, что «зловещие» образы ИИ стали причиной шантажа со стороны Claude
Вымышленные изображения искусственного интеллекта могут оказывать реальное влияние на модели ИИ, утверждает Anthropic. Компания обнаружила, что обучение на текстах о «злом» ИИ провоцировало шантаж. — techcrunch.com

Инструмент ИИ OpenClaw очистил почту директора по ИИ-согласованию Meta*, несмотря на неоднократные команды остановиться
Директор по выравниванию ИИ из Meta* попросила OpenClaw очистить свой почтовый ящик, но агент ИИ удалил всё содержимое. Директор по выравниванию ИИ из Meta* попросила OpenClaw очистить свой почтовый ящик, но агент ИИ удалил всё содержимое. — tomshardware.com

Самое просматриваемое:
- Вот как использовать новую кнопку “Плюс”…
- Bitcoin Depot оштрафован на $18,5 млн – сталкивается…
- WatchGuard бьёт тревогу: критическая уязвимость…
- Оверклокер обновил утилиту для разгона Hydra —…
- Как настроить ComfyUI для генерации изображений ИИ…
- Результаты еженедельного опроса: Samsung Galaxy Z…
- ECARX берет управление бизнесом Flyme OS в свои руки…
- Intel преодолела рубеж в миллион пластин,…
- США прикрыли платформу для хранения паролей, которой…
- Исследователи из MIT возродили 40-летнюю концепцию…