검색 결과
"benchmark" · 2개 기사 · Security
12
해커뉴스Security120372026-06-28
GLM 5.2가 자체 벤치마크에서 Claude를 앞섰다
GLM 5.2 beats Claude in our benchmarks
Semgrep가 자사 cyber 벤치마크에서 GLM 5.2가 Claude보다 좋은 성능을 냈다고 소개. 보안 코드 분석과 에이전트 작업에서 모델 비교가 다시 부각됨.
GeekNewsSecurity2026-05-17
프런티어 AI가 공개 CTF 형식을 깨뜨렸다
프런티어 AI가 공개 CTF 형식을 깨뜨렸다
프런티어 AI가 공개 CTF의 쉬운·중간 문제를 자동화해 점수판이 인간 보안 실력을 제대로 반영하지 못하게 됨. 모델이 추론과 풀이 코드 작성까지 맡으면서 인간은 플래그 복사만 남는 구조가 됐다.