AI 리더들, 사이버보안 투명성을 위한 SAFE 가이드라인 제안

Linux Foundation이 에이전틱 사이버보안 사고를 더 나은 보호 체계로 전환하기 위한 SAFE(Shared AI Findings Exchange) 가이드라인의 의견 수렴 요청서(RFC)를 공개합니다.
by

라스베이거스에서 연례 Black Hat 콘퍼런스가 개막한 가운데, 이제 120개가 넘는 조직이 참여하는 Open Secure AI Alliance 회원사들이 에이전틱 AI 사이버보안을 강화하기 위한 새로운 가이드라인을 개발하고 있습니다.

Linux Foundation은 SAFE(Shared AI Findings Exchange)에 대한 의견 수렴 요청서(RFC)를 공개했는데요, SAFE는 에이전틱 사이버보안 사고를 생태계 전체가 공유하는 방어 자산으로 전환하기 위해 제안된 가이드라인입니다.

SAFE 가이드라인은 Open Secure AI Alliance 워킹 그룹이 작성하고 있습니다. NVIDIA와 Cisco, CrowdStrike, Hugging Face, Red Hat 등 Open Secure AI Alliance 회원사들이 Linux Foundation과 협력해 초기 제안 내용을 만들고 있습니다.

SAFE 가이드라인에는 AI 관련 사고와 아차 사고(near miss)를 기밀로 수집·분석하고, 영향을 받은 대상에 이를 알리며, 반복적으로 실패하는 통제 지점을 식별하고, 시스템 전반의 위험을 낮추는 근거 기반 운영 권고안을 발표하는 방안이 담겼습니다.

사이버보안은 결승선이 없는 경주입니다. 주요 기술 전환기마다 새로운 잠재적 공격 표면이 생겨났는데요, 방어자는 인프라와 지식 재산을 보호하기 위해 지금 에이전트의 속도로 움직여 신속하게 대응해야 하며, 그 최선의 방법은 함께하는 것입니다. 신뢰할 수 있는 생태계가 위협 인텔리전스를 공개적으로 공유할 때 집단 방어는 전력 승수(force multiplier)가 됩니다.

Open Secure AI Alliance, AI 사이버보안 도구를 확대하다

SAFE 프레임워크는 AI 보안 스택 전반에 걸쳐 누구나 들여다볼 수 있는 개방형 도구를 만들고 공유한다는 공동의 약속에 따라 Open Secure AI Alliance 회원사들이 이어온 기술 기여에 더해지는 것입니다.

AI 에이전트는 단순한 모델이 아닙니다. 아이덴티티 제어와 하네스, 가드레일, 로그, 평가로 이뤄진 하나의 시스템이며, 이를 보호하려면 취약점 스캐닝 이상의 접근이 필요합니다.

보안은 언제나 여러 겹의 계층에서, 그리고 커뮤니티가 아는 것을 기꺼이 공유할 때 가장 강력했습니다. 가장 어려운 문제는 방어자들이 서로에게서 공개적으로, 그리고 빠르게 배울 때 해결됩니다.

NVIDIA의 개방형 사이버보안 소프트웨어·모델 풀스택

NVIDIA의 지원은 기술 스택 전 계층에 걸쳐 있습니다. 그 출발점은 NVIDIA Labs Object-Oriented Agent(NOOA) 리서치 하네스로, GitHub에 공개돼 있으며 에이전트의 동작을 더 쉽게 테스트하고 추적하고 감사하고 관리할 수 있게 해줍니다.

NVIDIA OpenShell 런타임은 에이전트가 무엇을 보고, 건드리고, 실행할 수 있는지를 제한합니다. 에이전트 수준에서 보안·프라이버시 통제를 적용해 에이전트가 접근해서는 안 되는 영역에 닿지 못하도록 합니다.

NVIDIA의 개방형 모델 제품군은 개방형 가중치와 데이터세트, 학습 기법과 함께 제공됩니다. 에이전틱 AI를 위한 NVIDIA Nemotron, 피지컬 AI를 위한 NVIDIA Cosmos, 로보틱스를 위한 NVIDIA Isaac GR00T, 헬스케어·생명과학을 위한 NVIDIA BioNeMo, 그리고 상업적 사용이 허가된 자율주행 자동차 모델 중 세계 최대 규모인 NVIDIA Alpamayo가 여기에 포함됩니다.

또한 NVIDIA의 검증된 오픈 소스 에이전트 스킬은 이러한 신뢰를 기능 계층까지 확장합니다.

각 스킬은 이식 가능한 명령어 세트로 제공되며, 카탈로그화되고, 프롬프트 인젝션이나 툴 포이즈닝 같은 위험 요소에 대해 스캔되며, 암호학적으로 서명되고 스킬 카드로 문서화됩니다. 덕분에 방어자는 특정 에이전트 스킬이 정확히 무엇을 하는지, 어디에서 왔는지, 배포 이후 변조된 적이 있는지를 명확히 알 수 있습니다.

NeMo Guardrails와 NeMo Anonymizer, NeMo Safe Synthesizer는 안전 정책을 시행하고 민감 데이터를 보호하며 프라이버시가 보장된 합성 데이터를 생성하는 데 도움을 줍니다.

또한 NVIDIA의 오픈 소스 LLM 취약점 스캐너인 Garak은 보안팀이 모델을 출시하기 전에 데이터 유출과 프롬프트 인젝션, 탈옥(jailbreak) 시나리오를 점검할 수 있게 해줍니다.

얼라이언스 회원사, 개방형 생태계 개발 도구 확대

Open Secure AI Alliance의 다른 회원사들도 아이덴티티와 권한, 하네스, 런타임 가드레일, 보안 AI 모델, 관측성과 평가, 데이터 보안과 프라이버시, 가용성과 복원력 등 방어 스택 전반에 걸쳐 개발을 이어왔습니다.

아래에서는 스택의 각 계층에서 최근에 나온 기여 사례를 소개합니다. 앞으로도 더 많은 기여가 이어질 예정입니다.

아이덴티티와 권한 — 누가 행동할 수 있는가

식별할 수 없는 것은 보호할 수 없습니다.

Okta는 에이전트 아이덴티티와 접근에 대한 레퍼런스 구현을 개발하고 있습니다. 개방형 프로토콜인 Cross App Access(XAA)를 통해 OpenShell 샌드박스 환경에서 동작하는 AI 에이전트가 엔터프라이즈 애플리케이션에 안전하게 연결되는 방식을 보여줍니다.

Palo Alto Networks는 차세대 아이덴티티 보안 플랫폼 Idira의 오픈 소스 도구인 Agent GuardAgent Watch를 기여했습니다. 이들 도구는 개발자와 에이전트 빌더가 아이덴티티 보안 모범 사례와 안전장치를 적용하도록 돕습니다. 에이전틱 워크플로우에 필요한 시크릿을 안전하게 가져오는 기능이 그 예입니다.

Red Hat이 새로 시작한 오픈 소스 프로젝트 asago는 NIST와 OWASP, EU AI Act 등에서 참조하는 조직별 맞춤 거버넌스 요구사항을 런타임에서 에이전트가 수행할 수 있는 동작에 직접 매핑합니다. 정책 조항부터 실제 적용된 통제까지 하나의 감사 추적으로 연결됩니다.

하네스와 툴링 — 보안 업무는 어떻게 오케스트레이션되는가

AI 에이전트는 모델 그 이상입니다. 작업을 수행하기 위해 개방형·비개방형 모델과 하네스, 도구, 런타임으로 이뤄진 시스템을 활용합니다.

모델이 에이전트의 두뇌라면, 하네스는 도구를 사용해 실제로 행동하는 몸입니다. 모델을 감싸는 하네스는 에이전트가 어떻게 배포되고 조율되고 제한되는지를 결정하는 오케스트레이터 역할을 합니다.

얼라이언스 회원사들은 AI 보안 스택에서 새롭게 부상하는 이 계층 전반에 걸쳐 툴링과 하네스, 지원 기술을 기여하고 있습니다.

Open Secure AI Alliance의 새 회원사로 합류한 Amazon은 Strands Agents를 기여합니다. 모든 계층이 개방된 AI 에이전트 구축용 오픈 소스 툴킷으로, 개발자에게 에이전트 동작에 대한 완전한 가시성과 프로덕션 환경에서 에이전틱 시스템을 평가할 수 있는 역량을 제공합니다. Amazon은 Cedar도 함께 기여합니다. AI 에이전트에 허용된 동작에 결정론적이고 검증 가능한 경계를 적용하는 오픈 소스 인가(authorization) 언어로, 세분화되고 분석 가능한 접근 제어를 통해 승인된 동작만 엔터프라이즈 리소스에 도달하도록 돕습니다.

Capital One은 에이전틱 AI 코드 보안을 위한 VulnHunter를 오픈 소스로 공개했습니다.

Cloudflare는 에이전트 시스템에 보안을 더하는 오픈 소스 스킬로 Vulnerability Discovery Harness를 제공하고 있습니다.

Microsoft AI Red Team은 여러 도구와 하네스를 오픈 소스로 공개했습니다. PyRIT(Python Risk Identification toolkit)은 AI 레드팀이 자동화된 레드팀 활동을 수행할 수 있게 해주며, 메모리 기능을 내장하고 일반적인 타깃은 물론 커스텀 엔드포인트도 지원합니다.

RAMPART는 레드팀이 찾아낸 결과와 실제 사고를 소프트웨어 변경 시점마다 실행되는 반복 가능한 테스트로 전환합니다. Clarity는 코드를 작성하기 전에 설계 가정을 검토하고 잠재적 실패 지점을 파악하도록 돕습니다.

Microsoft는 Assert도 오픈 소스로 공개했습니다. 자연어 요구사항과 기대되는 AI 안전·보안 동작을 실행 가능한 평가로 변환하는 도구입니다.

Atlas는 Wiz의 자율 취약점 연구 엔진으로, 특화된 AI 에이전트들을 오케스트레이션해 코드와 오픈 소스 패키지 전반의 보안 결함을 발견하고 검증합니다.

Visa도 Open Secure AI Alliance에 합류해, 각 팀이 문제를 신속하고 안전하게 식별하고 개선과 검증을 진행할 수 있도록 오픈 소스로 공개한 Visa Vulnerability Agentic Harness를 기여했습니다.

모델 — AI 안전과 방어를 위해 설계된 지능

모든 보안·안전 과제에 범용 모델이 필요한 것은 아닙니다. 특화된 보안·안전 모델은 방어를 목적으로 설계됩니다. 코드를 이해하고 취약점을 찾아내며 대규모로 위협을 추론하도록 학습됩니다. 이들 모델은 여러 모델로 이뤄진 시스템의 일부로서 에이전틱 워크플로우를 뒷받침할 수 있으며, 개방형 모델과 비개방형 모델이 함께 작동해 업무를 효율적으로 처리합니다.

Cisco DefenseClaw는 NVIDIA OpenShell 위에서 동작하는 오픈 소스 에이전틱 거버넌스 계층으로, 에이전틱 워크포스를 확장할 때 런타임 수준에서 견고하고 자동화된 보안을 제공합니다. Cisco는 코드베이스 내에 알려진 취약점이 어디에 있는지 정확히 짚어내는 Antares 보안 소형 언어 모델 2종과, 안전을 기본값으로 삼는 관행을 AI 코딩 워크플로우에 직접 이식하는 Project CodeGuard도 공개했습니다.

CrowdStrike는 사이버 방어를 위해 NVIDIA Nemotron Nano 모델을 파인 튜닝하고 있습니다. 내부 테스트에서 Falcon LogScale 내 조사 쿼리 생성 정확도 96%를 달성해, 에이전트의 조사 효율을 높이는 자연어 인터페이스를 제공합니다. 또한 CrowdStrike는 특화된 NVIDIA Nemotron Nano 추론 모델이 보안 관제 센터(SOC)의 탐지 선별(트리아지)에서 훨씬 큰 모델들을 능가한다는 연구도 발표했습니다. 이 연구는 로짓 기반의 보정된 신뢰도를 도입해 측정하고 조정하고 감사할 수 있는 자율 보안 의사결정을 가능하게 합니다.

에이전트가 무엇을 했는지 보는 것만으로는 전체 그림을 알 수 없습니다. 방어자는 에이전트가 왜 그렇게 행동했는지, 시스템이 안전하게 동작하는지, 그리고 실제 환경에서 공격이 어떻게 진화하는지도 이해해야 합니다.

AkamaiState of the Internet 보고서Security Intelligence Group 연구에서 얻은 인사이트를 제공합니다. 실제 데이터를 바탕으로 AI 시대의 위협을 조명하고 새롭게 등장하는 익스플로잇의 작동 방식을 설명해, 방어자가 배우고 적응하고 대응할 수 있도록 돕습니다. Cognition은 오픈 소스 기반 모델의 정렬(alignment)과 보안 위험을 측정하는 신뢰성 평가를 공개했습니다. 이 평가는 해당 위험이 포스트 트레이닝으로 완화될 수 있음을 보여줍니다.

Numbat은 Perplexity의 클라이언트 엔드포인트용 오픈 소스 에이전트 보안 스위트입니다. macOS와 Linux, Windows 전반에서 에이전트 활동을 탐지하고 조사하고 차단하며, 방어자에게 에이전트가 실제로 무엇을 했는지에 대한 구조화된 기록을 제공합니다.

Uber는 ADR(Agentic AI Detection and Response)의 핵심 구성 요소를 오픈 소스로 공개했습니다. ADR은 프롬프트에서 추론, 도구 호출, 결과에 이르기까지 AI 에이전트 활동의 전체 인과 사슬을 재구성해 보안팀의 위협 탐지를 돕는 프로덕션 시스템입니다. 현재 ADR은 3만 개 엔드포인트에서 하루 20만 건 이상의 에이전트 세션을 지원하며, 효율적인 탐지와 고신뢰 위협에 대한 심층 조사를 결합한 2단계 분석 방식을 사용합니다.

가용성과 복원력 — 결정적 순간의 신속한 복구

에이전트 시스템은 장애 상황에서도 신뢰할 수 있어야 하고, 실패를 격리하며, 중요한 상태를 잃거나 주변 환경을 노출하지 않고 안전하게 복구할 수 있어야 합니다.

LangChain은 자사 오픈 소스 프레임워크인 Deep Agents와 LangGraph, LangChain에 복원력 기능을 추가하고 있습니다. 이를 통해 에이전트는 중단된 작업을 재시도하고, 안전한 복구 경로를 따르며, 처음부터 다시 시작하는 대신 저장된 상태에서 재개하고, 기본 모델에 장애가 발생하면 대체 모델로 자동 전환할 수 있습니다.

Veeam은 AI를 뒷받침하는 데이터와 인프라의 복원력과 복구 가능성을 유지하도록 돕습니다. Kubernetes 환경의 데이터 보호를 위한 오픈 소스 프레임워크 Kanister가 그 예입니다. 이를 통해 각 팀은 AI 워크로드와 벡터 데이터베이스, 데이터를 보호하고 검증된 정상 상태로 복구할 수 있습니다.

Open Secure AI Alliance 회원사 로고

더 많은 기여들이 이어질 예정입니다. 회원사들이 재사용 가능한 완화 방안을 공개하면 생태계 전반의 방어자들이 이를 직접 들여다보고 자신에게 맞게 조정하고 개선할 수 있습니다. 이는 AI가 발전하는 속도에 맞춰 보안 관행도 함께 진화하도록 도울 것입니다.

Open Secure AI Alliance 가입에 대해 자세히 알아보세요.