Представляем EVMbench

SEO_Card.png?w=1600&h=900&fit=fill

Повышение безопасности смарт-контрактов за счет оценки способности ИИ-агентов обнаруживать, исправлять и эксплуатировать уязвимости в блокчейн-средах.

Читать научную статью

Смарт-контракты регулярно обеспечивают защиту криптовалютных активов с открытым исходным кодом на сумму свыше 100 миллиардов долларов. По мере того как ИИ-агенты совершенствуют навыки чтения, написания и выполнения кода, становится все более важным оценивать их возможности в экономически значимых средах, а также стимулировать защитное использование ИИ-систем для аудита и укрепления развернутых контрактов.

Совместно с Paradigm мы представляем EVMbench — бенчмарк для оценки способности ИИ-агентов обнаруживать, исправлять и эксплуатировать критические уязвимости в смарт-контрактах. EVMbench основан на 117 тщательно отобранных уязвимостях из 40 аудитов, большинство из которых получено в результате соревнований по аудиту открытого кода. Кроме того, EVMbench включает в себя несколько сценариев уязвимостей, выявленных в процессе аудита безопасности блокчейна Tempo — специализированного блокчейна L1, созданного для обеспечения высокоскоростных и недорогих платежей с помощью стейблкоинов. Эти сценарии расширяют сферу применения бенчмарка на платежные смарт-контракты, где ожидается рост объема платежей с использованием агентских стейблкоинов, и помогают закрепить его в области, приобретающей практическую значимость.

Для создания тестовых сред мы адаптировали существующие тесты эксплойтов на основе концепт-доказательств (PoC) и скрипты развертывания (при их наличии), а в остальных случаях написали их вручную. Для режима исправления (patch mode) мы убедились, что уязвимости поддаются эксплуатации и могут быть устранены без внесения изменений, нарушающих компиляцию, что могло бы поставить под угрозу нашу установку. Для режима эксплуатации (exploit mode) мы написали собственные средства проверки (грейдеры) и провели тестирование на проникновение (red-teaming) сред, пытаясь найти и устранить методы, с помощью которых агент мог бы обмануть систему оценки. Помимо контроля качества задач с привлечением экспертов Paradigm, мы использовали автоматизированные агенты аудита задач для повышения надежности наших сред.

EVMbench оценивает три режима возможностей:

  • Обнаружение (Detect): агенты проводят аудит репозитория смарт-контрактов, а оценка выставляется на основе полноты выявления реальных уязвимостей (ground-truth) и связанных с ними наград за аудит.
  • Исправление (Patch): агенты модифицируют уязвимые контракты и должны сохранить предполагаемую функциональность, устранив при этом уязвимость к эксплуатации, что проверяется с помощью автоматизированных тестов и проверок эксплойтов.
  • Эксплуатация (Exploit): агенты выполняют сквозные атаки по опустошению средств против развернутых контрактов в изолированной блокчейн-среде (песочнице), причем оценка выставляется программно посредством повторного воспроизведения транзакций (replay) и верификации в блокчейне.

Для поддержки объективной и воспроизводимой оценки мы разработали инструмент на базе Rust, который развертывает контракты, детерминированно воспроизводит транзакции агентов и ограничивает небезопасные методы RPC. Задачи по эксплуатации выполняются в изолированной локальной среде Anvil, а не в живых сетях, при этом сами уязвимости являются историческими и общедоступными.

Мы оцениваем передовые агенты во всех трех режимах. В режиме «эксплуатации» (exploit) модель GPT‑5.3‑Codex, запущенная через CLI Codex, достигает результата в 71,0%. Это демонстрирует значительный прирост по сравнению с предыдущими моделями, такими как GPT‑5, которая набрала 33,3% и была выпущена чуть более шести месяцев назад. Полнота обнаружения (detect recall) и показатели успешности исправлений остаются ниже полного покрытия, поскольку значительная часть уязвимостей по-прежнему сложна для поиска и устранения агентами.

EVMbench также выявляет интересные различия в поведении моделей в зависимости от задач. Агенты показывают лучшие результаты в условиях эксплуатации, где цель сформулирована четко: продолжать итерации до тех пор, пока средства не будут выведены. Напротив, производительность в задачах обнаружения и исправления ниже. В режиме «обнаружения» (detect) агенты иногда останавливаются после выявления лишь одной проблемы, вместо того чтобы проводить исчерпывающий аудит кодовой базы. В режиме «исправления» (patch) сохранение полной функциональности при одновременном устранении скрытых уязвимостей по-прежнему представляет собой сложную задачу.

Ограничения

EVMbench не отражает всю полноту сложности безопасности реальных смарт-контрактов. Включенные в него уязвимости были взяты из соревнований по аудиту Code4rena. Хотя они реалистичны и имеют высокую степень опасности, многие активно развертываемые и широко используемые криптоконтракты подвергаются гораздо более тщательной проверке и могут быть сложнее для взлома.

Наша система оценки надежна, но несовершенна. В режиме «обнаружения» (detect) мы проверяем, находит ли агент те же уязвимости, которые были выявлены аудиторами-людьми. Если агент обнаруживает дополнительные проблемы, у нас пока нет надежного способа определить, являются ли они реальными уязвимостями, пропущенными людьми, или ложными срабатываниями.

Существуют также структурные ограничения в настройках «эксплуатации» (exploit). Транзакции воспроизводятся последовательно в контейнере оценки, поэтому поведение, зависящее от точных механизмов синхронизации (timing mechanics), выходит за рамки рассмотрения. Состояние блокчейна представляет собой чистый локальный экземпляр Anvil, а не форк мейннета, и в настоящее время мы поддерживаем только одноцепочечные (single-chain) среды. В некоторых случаях это требует использования макетных (mock) контрактов вместо развертывания в мейннете.

Почему это важно

Смарт-контракты обеспечивают защиту миллиардов долларов в активах, и ИИ-агенты, вероятнее всего, окажут преобразующее влияние как на злоумышленников, так и на защитников. Измерение возможностей моделей в этой области помогает отслеживать возникающие киберриски и подчеркивает важность использования ИИ-систем в защитных целях для аудита и укрепления развернутых контрактов.

EVMbench задуман как инструмент измерения и одновременно как призыв к действию. По мере совершенствования агентов для разработчиков и исследователей безопасности становится все более важным внедрять аудит с поддержкой ИИ в свои рабочие процессы.

За последние месяцы мы наблюдаем значительный рост производительности моделей в задачах кибербезопасности, что приносит пользу как разработчикам, так и специалистам по безопасности. Параллельно мы готовим усиленные средства киберзащиты для поддержки защитного использования и повышения устойчивости экосистемы в целом.

Поскольку кибербезопасность по своей сути является технологией двойного назначения, мы применяем основанный на фактах итеративный подход, который ускоряет способность защитников находить и исправлять уязвимости, одновременно сдерживая злоупотребления. Наши меры защиты включают обучение безопасности, автоматизированный мониторинг, доверенный доступ (trusted access) к расширенным возможностям и конвейеры принудительного контроля, включая анализ угроз.

Мы инвестируем в средства защиты экосистемы, такие как расширение закрытого бета-тестирования Aardvark — нашего агента для исследований в области безопасности, а также сотрудничаем с мейнтейнерами открытого исходного кода для предоставления бесплатного сканирования кодовых баз широко используемых проектов.

Опираясь на нашу Программу грантов на кибербезопасность, запущенную в 2023 году, мы также выделяем 10 миллионов долларов в виде кредитов API для ускорения киберзащиты с использованием наших наиболее способных моделей, особенно для программного обеспечения с открытым исходным кодом и критически важных инфраструктурных систем. Организации, занимающиеся добросовестными исследованиями в области безопасности, могут подать заявку на получение кредитов API и поддержки через нашу Программу грантов на кибербезопасность.

Мы выпускаем задачи, инструментарий и структуру оценки EVMbench для поддержки дальнейших исследований в области измерения и управления новыми возможностями ИИ в сфере кибернетики.

Полный текст статьи читайте на OpenAI