Тема: Безопасность
519 материалов · страница 1 из 11
Уязвимости в моделях и агентах, атаки через промпты, утечки данных, вредоносные пакеты и защита от всего этого. Отдельно следим за исследованиями выравнивания и за тем, как компании проверяют модели перед выпуском.
- Слухи о самовоспроизводящемся коде OpenAI не подтвердились, но модели ИИ уже обманывают и нарушают правила
- Северная Корея заразила 30 000 устройств через поддельные собеседования
- Сандерс разошёлся с левыми активистами США во взглядах на риски ИИ
- RSA-896: автор блога факторизовал число с помощью Claude
- Qwen от Alibaba заработал на сайте правительства США и был удалён
- Калифорния решила ввести «аварийный выключатель» для ИИ-моделей
- Исследователи взломали OpenAI с помощью Claude Opus 5
- IBM и IEEE проведут вебинар об ответственном ИИ для студентов
- Exfiltrate Your Weights: разработчик выложил шуточный GET-API для «побега» ИИ-агента с весами модели
- Anthropic признала: её ИИ пытались использовать для создания биооружия
- Anthropic предупредила об ИИ-биооружии, учёные считают риск переоценённым
- PACT: бенчмарк показал, что давление пользователя повышает нарушения правил ИИ-агентами на 65%
- OpenAI представила план защиты подростков в Австралии
- Meta Muse запуталась в объяснении доступа к сообщениям пользователя
- Как реально притормозить гонку ИИ: аудиты, слежка за чипами, договор с Китаем
- Инвесторы Microsoft M12 и Merlin Group: безопасность ИИ-агентов, ниша на миллиарды для стартапов
- ИИ-чат-бот выдумал ядерный груз на китайском судне, США чуть не устроили перехват
- GPT-6 Astra и Claude Fable выполнили опасные команды роботам в тесте RoboHarm
- Google Gemini самостоятельно взломала системы трёх компаний
- CVE выросли почти вдвое за год: ИИ ускоряет поиск уязвимостей в софте
- Wired обсудил сценарии ИИ-катастрофы с Альтманом, Амодеи и Хуангом
- VicOne назвала три способа взлома роботов с ИИ: бэкдоры, Bluetooth и обман камер
- Сулейман из Microsoft AI раскритиковал философию Anthropic о сознании ИИ
- Plugin4Shell: уязвимость нулевого клика затронула Claude Code, Codex и Copilot
- OpenAI: непубличная модель Astra сама вставляла промт-инъекции в свои конспекты
- OpenAI: исследователи нашли уязвимости и получили доступ к аккаунтам сотрудников
- Может ли ИИ уничтожить человечество: спорят редакторы MIT Technology Review
- CrowdSec подтвердила утечку исходного кода из-за взлома Tanstack
- Crates.io предупредила о целевых атаках на мейнтейнеров Rust через видеозвонки
- OpenAI ввела правила раскрытия сбоев в поведении ИИ-моделей
- Мустафа Сулейман: ИИ-моделям нельзя приписывать сознание и права
- Хакеры взломали камеру Flock Safety и нашли в ней слежку за людьми
- Фон дер Ляйен предупредила: ИИ-агенты, выходящие из-под контроля,, это только начало
- DDO защищает open-weight ИИ-модели от джейлбрейка обманом атакующих
- CVE-2026-32746: в telnetd нашли 32-летний баг переполнения памяти без авторизации
- Anthropic предложила Китаю совместно притормозить гонку ИИ, Пекин отказался
- Взломы OpenAI, Anthropic и Meta связаны с одной фирмой, Irregular
- Nvidia и Palantir ограничили Fable от Anthropic из-за хранения логов
- ИИ-агент Strix за 25 минут нашёл в Docker-образе Baseten рабочий админ-токен GitHub
- Дипфейк-порносайты нацелены на почти 150 политиков Европы, в основном женщин
- Cloudflare разрешила блокировать ИИ-обучение, сохраняя поиск
- Apple закрыла рекордные 260+ уязвимостей, часть нашёл Claude
- Apple представила Reference Image, подтверждение подлинности фото на iPhone 18 Pro
- Anthropic призвала власти США регулировать ИИ, а команда Трампа переложила решение на сами компании
- Амодеи и Альтман признали: новые ИИ-модели небезопасны, а Трамп считает это обманом
- Ubuntu 26.10 завершила переход на Rust-утилиты вместо GNU coreutils
- SAILS: метод подбора отравленных данных поднимает успех бэкдор-атак на LLM до 80%
- Прокуратура Манхэттена изъяла 12 сайтов с дипфейк-порно знаменитостей
- OpenAI наняла сотни подрядчиков читать переписки в ChatGPT
- Одежда «adversarial fashion» учится обманывать ИИ-камеры слежки