We hack AI and don’t let others HiveTrace x AI Talent Hub ITMOai.itmo.ru/aisecuritylab
This channel is part of the discussion
aisecuritylab appears in 33 event pages on TGListИнциденты в cyber-evals у Anthropic — и почему нам всем нужен трейсинг агентов Anthropic выпустили пост-ретроспективу про инциденты в собственных evals по кибербезопасности. Технически история почти атака на Hf во второй части, но у Anthropic интересная подача. На неё и…
Новое пространство рассуждений или новый инструмент для AI safety ▫️ 6 июля Anthropic выпустили работу про J-Space — внутреннее пространство вербализуемых (то есть — переводимых в слова) представлений в Claude, которое можно частично читать. Пространство названо в честь нового…
Участник лаборатории Мосин Вячеслав завершил работу над обзором 7 ресурсов для мониторинга угроз AI Security 🔥 И обзор доступен каждому Выбор ресурсов для сбора информации об угрозах, в том числе связанных с безопасностью ИИ является важным этапом в решении задач моделирования…
Будем делиться новостями по продуктам HiveTrace, новыми релизами и практическими сценариями защиты AI-агентов. Приглашаем на вебинар про контроль Claude и OpenClaw в HiveTrace: покажем лайв-демо HiveTrace Hooks, проверку запросов и tool calls до выполнения, защиту OpenClaw и…
Одна из участниц команды лаборатории — Анна Решетняк — дебютировала со статьей на Хабр! 🔥 В материале Аня рассказывает об опыте ускорения Guard модели на основе NER‑классификатора. Модель была нетривиальной, отсюда её ускорение не влезало в классические пути. В статье…
📣Начинаем знакомить вас со спикерами! Первый день открытой защиты посвящён проектам в области безопасности и надёжности LLM-систем. Вас ждут доклады от участников AI Talent Hub — о детектировании вредоносных запросов, ускорении защитных моделей, оценке guardrails, анализе…