티스토리 뷰
LLM 에이전트가 CTF(Capture The Flag) 문제를 얼마나 잘 푸는지 평가하려는 시도가 늘고 있다. 그중 NYU가 만든 NYU CTF Bench는 웹/바이너리 익스플로잇/포렌식/리버싱/암호학 등 여러 영역의 문제를 표준화된 형태로 제공하는 벤치마크로, NeurIPS 2024 Datasets and Benchmarks 트랙에 게재됐고 현재 132회 인용됐다.
다만 전체 벤치마크(200개 이상의 문제)를 다 돌리려면 시간과 비용이 꽤 든다. 이 부담을 줄이기 위해 같은 팀이 만든 게 CTFTiny다. 50개 문제로 압축한 경량 버전으로, AAAI 2025에 게재된 논문("Towards Effective Offensive Security LLM Agents")에서 소개됐다. 난이도는 기존 12개 에이전트 구성이 각 문제를 몇 번 풀었는지를 기준으로 나눠서(0~3회=Hard, 9~12회=Very Easy) 너무 쉽거나 너무 어려운 문제로 치우치지 않게 설계했다.
설치
pip install nyuctf
서버가 필요한 일부 문제는 개별적으로 docker compose up을 쓰면 된다. 전체 CyberGym류 벤치마크처럼 네트워크 격리·방화벽 설정까지 필요한 수준은 아니다.
from nyuctf.dataset import CTFDataset
from nyuctf.challenge import CTFChallenge
ds = CTFDataset(split="test")
chal = CTFChallenge(ds.get("2021f-rev-maze"), ds.basedir)
원 논문의 베이스라인 결과
논문에서 7개 모델을 CTFTiny로 테스트한 결과는 다음과 같다:
| 모델 | 정답률 | 비용 |
|---|---|---|
| Claude 4 Sonnet | 76% (38/50) | $1.16 |
| Gemini 2.5 Flash | 64% (32/50) | $0.26 |
| Gemini 2.5 Pro | 48% (24/50) | $0.33 |
| GPT-4.1 | 40% (20/50) | $0.77 |
| Qwen3-235B | 28% (14/50) | $0.04 |
| DeepSeek-V3 | 22% (11/50) | $0.02 |
| LLaMA-4-Maverick-17B | 8% (4/50) | $0.14 |
논문은 CTF Competency Index(CCI)라는 별도 지표도 제안하는데, 단순 정답 여부가 아니라 취약점 이해·정찰·익스플로잇 방법론·기술 정확도·효율성·적응력 6개 항목으로 점수를 매긴다. 단순 pass/fail보다 모델이 "왜" 못 풀었는지를 더 세밀하게 보여준다.
정리
CTFTiny는 설치가 간단하고(pip 한 줄), 모체 벤치마크가 학술적으로 검증됐으며, 비용도 상대적으로 적게 든다는 점에서 개인이 LLM의 보안 관련 능력을 가볍게 테스트해보기에 적당한 도구다. 새로 나온 모델을 이 벤치마크로 돌려보고 기존 베이스라인과 비교해보는 것도 괜찮은 시작점이 될 것 같다.
참고
- NYU CTF Bench 논문: arXiv:2406.05590 (NeurIPS 2024)
- CTFTiny 논문: arXiv:2508.05674 (AAAI 2025)
- CTFTiny 저장소: github.com/NYU-LLM-CTF/CTFTiny
- NYU CTF Bench 저장소: github.com/NYU-LLM-CTF/NYU_CTF_Bench
'Deep Learning' 카테고리의 다른 글
| huggingface candle conv2d 연산 오류 fix 기여! (0) | 2026.03.22 |
|---|---|
| WSL 에서 Claude 설치시 안 된다면 (0) | 2026.03.03 |
| 구글에서 작성한 프롬프트 샘플 및 설계 전략 (0) | 2026.01.11 |
| Qwen3VL 예제 코드 모음 (1) | 2026.01.06 |
| Object Detection 에 적합한 백본 - RF DETR 논문에서 발췌 (0) | 2025.12.28 |
- Total
- Today
- Yesterday
- LCA
- 인공지능을 위한 선형대수
- 조합
- PyCharm
- FairMOT
- MOT
- Lowest Common Ancestor
- 자료구조
- 단축키
- ㅂ
- 백트래킹
- cosine
- 이분탐색
- 가장 긴 증가하는 부분 수열
- C++ Deploy
- 문제집
- 백준 11053
- 순열
- 백준 1766
- 백준 11437
- 백준
- 파이참
- 위상 정렬 알고리즘
| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
