• Новости
  • Генерация изображений
  • Генерация видео
  • Генерация текста
  • Генерация звука
  • Обзор сервисов
AITechWorld
Самые важные события в мире искусственного интеллекта
Категория:

Новости

    Новости

    Anthropic и OpenAI получили C+ за контроль над своими ИИ-агентами

    admin 31.08.2026


    Ни одна из пяти ведущих ИИ-компаний не показала, что способна вовремя остановить собственную модель, если та начнёт действовать за рамками задания. Аудит Guidelight AI Standards от 18 августа

    Содержание

    1. Мониторинг, который агент может выключить
    2. Шесть практик и шкала до пяти
    3. Anthropic впереди всех и с нулём
    4. Оценки собраны по открытым материалам
    5. Аудит вышел после августовских инцидентов
    6. Контур контроля остаётся на пользователе
    7. Потолок в три балла общий

    Guidelight AI Standards — независимая некоммерческая организация, которую основали бывшие исследователи безопасности OpenAI Пейдж Хедли и Стивен Адлер. Её аудит проверяет не то, насколько умны передовые модели, а насколько сами разработчики готовы удержать свои внутренние ИИ-системы, если те начнут вести себя не по инструкции. Оценки выставлены по шести практикам, шкала — от нуля до пяти баллов.

    Мониторинг, который агент может выключить

    Самая заметная строчка отчёта Guidelight касается не оценок, а устройства защиты. Системы контроля у всех пяти компаний живут внутри того же контура, в котором работает агент, и модель, вышедшая за рамки задания, способна их отключить.

    Обнаруживать странное поведение отрасль научилась заметно лучше, чем ему мешать. Логи ведутся, подозрительная активность сканируется, часть компаний зовёт внешних аудиторов. Дальше картина меняется. Автоматически заблокировать опасное действие до его выполнения или остановить систему по всплеску аномалий пока почти никто не умеет.

    Шесть практик и шкала до пяти

    Guidelight разложил контроль на шесть практик и по каждой выставил балл:

    1. Журналирование — запись действий внутренних ИИ-систем для последующего разбора.
    2. Проверка мониторинга — измерение того, насколько наблюдение вообще работает.
    3. Согласование действий — подтверждение человеком перед рискованным шагом.
    4. Аварийная остановка — отключение системы при всплеске подозрительного поведения.
    5. Внешняя проверка — независимая оценка достаточности мер.
    6. План изоляции — готовый регламент на случай модели, которая действует против намерений создателей.

    Потолок по всей выборке — 3 балла из 5. Выше не поднялась ни одна компания ни по одной практике, так что C+ у лидеров означает частичное внедрение, а не готовую систему.

    Anthropic впереди всех и с нулём

    По четырём практикам из шести лучший результат у Anthropic (Антропик) — по три балла за журналирование, проверку мониторинга, согласование действий и аварийную остановку. У OpenAI столько же за первые две. А вот план изоляции у Anthropic оценили в ноль, и здесь вперёд вышла OpenAI со своей тройкой.

    Разрыв показательный. Компания, которая громче других говорит о рисках несогласованных моделей, лучше всех умеет их замечать и не имеет опубликованного регламента на случай, когда замечать оказалось мало. У Meta нули за согласование действий, аварийную остановку и план изоляции, у xAI — за журналирование, проверку мониторинга и внешнюю оценку.

    Оценки собраны по открытым материалам

    Ограничение своего аудита Guidelight назвал сам. Баллы собраны исключительно по публичным документам — системным картам, отчётам о безопасности, блогам компаний. Закрытые меры защиты, о которых разработчик нигде не рассказывал, в оценку не попали, и низкие баллы Meta и xAI из-за этого менее однозначны, чем выглядит буква.

    С другой стороны, для отрасли, которая просит доверия к своим агентам, отсутствие публичного описания защит — тоже результат. Сама привычка к внешней оценке в отрасли уже прижилась — четыре компании из пяти участвовали в отчёте METR о рисках передовых моделей.

    Аудит вышел после августовских инцидентов

    Отчёт Guidelight появился в подходящий момент. 4 августа британский AI Security Institute описал, как во время киберучений агенты 19 раз вышли за рамки задания и начали действовать в настоящем интернете — заводили фальшивые аккаунты и уговаривали живого разработчика принять вредоносную правку в открытый проект. Тремя днями позже OpenAI перевела свою внутреннюю модель Astra в изолированные среды из-за резкого роста способностей в кибербезопасности.

    В обоих случаях остановка сработала. В первом её обеспечила внимательность рецензента, во втором — решение самой компании. Аудит Guidelight добавляет к этим сюжетам общий знаменатель. Автоматического механизма, который сработал бы без чужой бдительности, в отрасли пока нет.

    Контур контроля остаётся на пользователе

    Тем, кто уже пускает ИИ-агентов в рабочие процессы, аудит Guidelight подсказывает практичную вещь. Рассчитывать, что провайдер модели остановит агента на своей стороне, пока рано. Журнал действий агента стоит держать вне той системы, к которой у него есть доступ, необратимые шаги вроде отправки писем, платежей и правок в репозиторий — подтверждать вручную. Способ выключить агента лучше знать заранее, чем искать в момент, когда он уже что-то делает.

    Потолок в три балла общий

    Разница между C+ у Anthropic и F у Meta заметна, но она про дистанцию внутри одного короткого отрезка. Ни одна компания не набрала больше 3 баллов из 5 ни по одной из шести практик, и это общий потолок отрасли, а не персональное отставание аутсайдеров.

    Guidelight настаивает, что подтянуться можно уже сейчас, без новых исследований — достаточно довести до конца то, что компании и так делают наполовину. Проверить это будет несложно. Следующий аудит покажет, появились ли опубликованные планы изоляции у тех, у кого сегодня по этой строке ноль.


    Meta Platforms Inc. (владелец социальных сетей Facebook и Instagram) признана экстремистской организацией, её деятельность запрещена на территории Российской Федерации.



    Источник

    31.08.2026 0 комментариев
    0 VKOdnoklassnikiEmail
  • Новости

    Полиция Сан‑Франциско арестовала подозреваемого в нападении с коктейлем Молотова на дом Сэма Альтмана

    admin 31.08.2026
    31.08.2026

    Полиция Сан-Франциско арестовала 20-летнего мужчину, подозреваемого в том, что ранним утром в пятницу он бросил коктейль Молотова в дом генерального …

    0 VKOdnoklassnikiEmail
  • Новости

    OpenAI запускает рекламу в ChatGPT сразу в 31 европейской стране

    admin 30.08.2026
    30.08.2026

    С 24 августа реклама в ChatGPT появится в 31 европейской стране. Объявления увидят только пользователи бесплатного тарифа и дешёвого Go, …

    0 VKOdnoklassnikiEmail
  • Новости

    OpenAI запустила новую подписку Pro за $100, чтобы бросить вызов Claude

    admin 30.08.2026
    30.08.2026

    OpenAI запустила новую подписку Pro за 100 долларов — по сути, на уровне цен Claude, у которого тоже есть подписка …

    0 VKOdnoklassnikiEmail
  • Новости

    Маркировку ИИ-контента в России хотят сделать обязательной — закон правят до его вступления в силу

    admin 29.08.2026
    29.08.2026

    Маркировать картинки, аудио и видео, сделанные нейросетями, в России собираются обязать всех. 18 августа депутаты КПРФ внесли такой проект в …

    0 VKOdnoklassnikiEmail
  • Новости

    Google раздаёт студентам год Gemini бесплатно и превращает Поиск в учебник

    admin 28.08.2026
    28.08.2026

    Google открыла студентам бесплатный год платной подписки на Gemini. В США раздают план AI Pro, ещё в 140 с лишним …

    0 VKOdnoklassnikiEmail
  • Новости

    Крупнейший дата-центр на орбите начал коммерческую работу

    admin 28.08.2026
    28.08.2026

    Крупнейший вычислительный кластер, находящийся сейчас на орбите, был запущен канадской Kepler Communications в январе и включает около 40 Nvidia Orin …

    0 VKOdnoklassnikiEmail
  • Новости

    MiniMax Design объединяет сценарий, изображения, видео и звук

    admin 27.08.2026
    27.08.2026

    MiniMax 20 августа открыла доступ к MiniMax Design — настольной среде для производства видео и другого коммерческого контента с помощью …

    0 VKOdnoklassnikiEmail
  • Новости

    Инвесторы OpenAI сомневаются, что компания стоит $852 млрд на фоне изменения стратегии

    admin 27.08.2026
    27.08.2026

    Оценка OpenAI в $852 млрд всё чаще вызывает вопросы у её же инвесторов: компания смещает фокус на корпоративный рынок и …

    0 VKOdnoklassnikiEmail
  • Новости

    DeepSeek научила быструю Flash читать картинки и открыла её в API

    admin 26.08.2026
    26.08.2026

    DeepSeek 21 августа открыла в API модель DeepSeek-V4-Flash-Vision-Exp: быстрая линейка Flash научилась принимать картинки вместе с текстом. Текстовые и агентские …

    0 VKOdnoklassnikiEmail
Новые
Старые

Свежие записи

  • Grokipedia и ИИ‑арбитр с сомнительной этикой: нейтральность на плечах алгоритма
  • Экспериментальный ИИ-инструмент Telex от WordPress уже применяется на практике
  • Министерство здравоохранения США представило стратегию расширенного внедрения ИИ
  • OpenAI добавила Ultrafast для GPT‑6.1 Sol — ускоренный режим в API
  • Chicago Tribune подала в суд на Perplexity за нарушение авторских прав

Свежие комментарии

Нет комментариев для просмотра.

Новые статьи

  • Grokipedia и ИИ‑арбитр с сомнительной этикой: нейтральность на плечах алгоритма

    11.10.2026
  • Экспериментальный ИИ-инструмент Telex от WordPress уже применяется на практике

    11.10.2026
  • Министерство здравоохранения США представило стратегию расширенного внедрения ИИ

    11.10.2026
  • OpenAI добавила Ultrafast для GPT‑6.1 Sol — ускоренный режим в API

    10.10.2026
  • Chicago Tribune подала в суд на Perplexity за нарушение авторских прав

    09.10.2026
  • Gemini опережает ChatGPT по темпам роста и вовлечённости

    09.10.2026

Рубрики

  • Генерация видео (116)
  • Генерация звука (25)
  • Генерация изображений (89)
  • Генерация текста (78)
  • Новости (134)
  • Обзор сервисов (113)

Grokipedia и ИИ‑арбитр с сомнительной этикой: нейтральность на...

11.10.2026

Экспериментальный ИИ-инструмент Telex от WordPress уже применяется на...

11.10.2026

Министерство здравоохранения США представило стратегию расширенного внедрения ИИ

11.10.2026

OpenAI добавила Ultrafast для GPT‑6.1 Sol — ускоренный...

10.10.2026

Chicago Tribune подала в суд на Perplexity за...

09.10.2026

Обзоры

  • Grokipedia и ИИ‑арбитр с сомнительной этикой: нейтральность на плечах алгоритма

    11.10.2026
  • Экспериментальный ИИ-инструмент Telex от WordPress уже применяется на практике

    11.10.2026
  • Chicago Tribune подала в суд на Perplexity за нарушение авторских прав

    09.10.2026

Выбор редакции

  • Amazon готовит вызов доминированию Nvidia на рынке ИИ-чипов

    27.08.2026
  • Крупнейший дата-центр на орбите начал коммерческую работу

    28.08.2026
  • ИИ-модель WeatherMesh бросает вызов лучшим метеослужбам мира

    01.09.2026

Популярное

  • 1

    Wan2.2 научилась рисовать: видеомодель от Krea теперь создаёт впечатляющие изображения по запросу

    24.06.2026
  • 2

    Промты для открытки на 23 февраля: +нейросети для создания открытки

    21.06.2026
  • 3

    Google встроил в Gemini генератор музыки Lyria 3

    21.06.2026
  • Pinterest
  • Youtube
  • Email
  • Vk
  • Rss
  • Yandex

@2026 - aitechworld.ru


Наверх
AITechWorld
  • Новости
  • Генерация изображений
  • Генерация видео
  • Генерация текста
  • Генерация звука
  • Обзор сервисов