검색 결과
"benchmark" · 56개 기사 · GeekNews · AI/ML
GPT 5.5 vs Opus 4.7, 코딩/프로그래밍에 더 나은 모델은?
GPT 5.5 vs Opus 4.7, 코딩/프로그래밍에 더 나은 모델은?
Reddit r/codex에서 두 모델의 코딩 성능 비교 토론이 진행 중임. 다수 사용자가 현재 기준 GPT 5.5의 우위를 지지하는 분위기다.
GPT-5.5 low vs medium vs high vs xhigh: 오픈소스 저장소 실제 작업 26개에서 본 추론 곡선
GPT-5.5 low vs medium vs high vs xhigh: 오픈소스 저장소의 실제 작업 26개에서 본 추론 곡선
GPT-5.5 Codex를 실제 오픈소스 작업 26개에 low·medium·high·xhigh로 돌려 추론 강도를 비교한 결과를 정리. 테스트 통과만이 아니라 사람 패치와의 의미적 동등성을 기준으로 성능 차이를 봄.
한국 개발자의 오픈소스 Ouroboros, Claude Plan Mode를 제치고 모델링·시뮬레이션 벤치마크 1위 기록
한국 개발자의 오픈소스 Ouroboros, Claude Plan Mode를 제치고 모델링·시뮬레이션 벤치마크 1위 기록
한국 개발자 오픈소스 Ouroboros가 공개 벤치마크에서 전체 1위를 기록. AI-assisted discrete-event simulation 평가에서 Claude Plan Mode를 앞섬.
2026년 AI 현황을 설명하는 그래프들
2026년 AI 현황을 설명하는 그래프들
AI Index 2026이 벤치마크 성능, 투자, 대중 인식, 컴퓨트, 탄소 배출 등 핵심 지표로 AI 산업 흐름을 집계. 2026년 AI 생태계의 성장과 병목을 한눈에 보여주는 보고서.
GPT-5.5 vs GPT-5.4 vs Opus 4.7 - 실제 코딩 작업 56개 벤치마크 비교
GPT-5.5 vs GPT-5.4 vs Opus 4.7 - 실제 코딩 작업 56개 벤치마크 비교
오픈소스 저장소 Zod와 graphql-go-tools에서 추출한 56개 실제 코딩 작업으로 GPT-5.5, GPT-5.4, Opus 4.7의 패치 품질을 비교함. 모델별 실제 수정 성능 차이를 정량 평가한 벤치마크 결과.
LLM이 5학년 이후 학습 자료를 전혀 보지 못하면 어떻게 될까?
LLM이 5학년 이후의 학습 자료를 전혀 보지 못하면 어떻게 될까?
LittleLearner를 미국 초등학교 K–5 교육과정으로만 제한한 880억 토큰 말뭉치로 처음부터 학습해, 사전학습 지식의 경계가 모델 능력에 미치는 영향을 검증함. FineWeb-Edu를 Common Core 기준의 5단계 파이프라인으로 필터링하고 5학년 이후 개념·사실·어휘를 명시적으로 제외함.
Codex 자동 연구로 기준보다 232배 빠른 GPU 커널 만들기
Codex 자동 연구로 기준보다 232배 빠른 GPU 커널 만들기
GPU Mode qr_v2 대회에서 Codex 기반 반복 최적화로 torch.geqrf 기준 419,000µs를 1,805µs까지 줄여 183명 중 12위를 기록함. 순차 의존성이 큰 Householder QR을 블록 Householder와 WY 표현으로 재구성해 성능을 끌어올림.
Qwen3.8-27B 출시 예정
Qwen3.8-27B Upcoming release
한국 시간 8월 15일 00시 공개 예정인 Qwen3.8-27B 모델 소개 글. 벤치마크는 아직 미공개이며 확장 토큰 문맥 길이는 100만 토큰으로 표기됨.
Opus 5는 왜 함께 작업하기 더 불편하게 느껴지는가?
Opus 5는 왜 함께 작업하기 더 불편하게 느껴지는가?
Opus 5는 벤치마크 성능은 높지만 실제 작업에서는 더 세밀한 감독이 필요하다는 평가. 의도 불명확 시 질문하고 계획을 보정하던 이전 모델과 달리 확인 절차가 약해 협업 부담이 커졌다는 지적이다.
하나의 프롬프트를 11개 AI 모델에 실행했더니 나온 서로 다른 결과
하나의 프롬프트를 11개 AI 모델에 실행했더니 나온 서로 다른 결과
Netlify가 동일한 커피숍 웹사이트 프롬프트를 11개 AI 모델에 각각 3회씩 실행해 결과를 비교함. 디자인·콘텐츠 품질과 평균 크레딧 사용량이 모델별로 크게 달라, 실제 생성 결과 기준의 주관적 벤치마크임을 보여줌.
Gemini 3.7 Flash
Gemini 3.7 Flash
Google이 3.6 Flash 출시 3주 만에 Gemini 3.7 Flash를 공개함. 소프트웨어 엔지니어링, 지식 업무, 웹 개발 벤치마크에서 3.6 Flash보다 높은 성능을 보였다.
Grok 4.6, AAII 61점으로 비용 효율에서 선두권 진입
Grok 4.6, AAII 61점으로 비용 효율에서 선두권 진입
Grok 4.6이 AAII 61점으로 GPT-5.6 Sol과 동점을 기록하며 상위권에 올라섬. 에이전트 성능도 빠르게 개선돼 비용 대비 경쟁력이 부각됨.
Grok 4.6 공개, 파라미터 확장 대신 사후학습에 투자한 모델
Grok 4.6 공개, 파라미터 확장 대신 사후학습에 투자한 모델
xAI가 Grok 4.6을 공개하고 Cursor와 Grok Build에서 즉시 사용 가능하게 했다. 대규모 파라미터 확장보다 사후학습 강화에 집중한 모델로, 여러 벤치마크 합산 지표에서 GPT-5.6 Sol과 동률을 주장했다.
Solar Pro 4 - 에이전트 작업 특화 LLM
Solar Pro 4 - 에이전트 작업 특화 LLM
Upstage가 문서 읽기·도구 호출·코드 실행을 거쳐 Excel, Word, PPT 같은 실제 업무 파일을 생성하는 에이전트용 LLM을 공개함. Terminal-Bench v2.1 57점, GDPval-AA v2 39점 등 업무형 벤치마크 성능을 제시함.
LLM Evals에 대해 알아야 할 모든 것
LLM Evals에 대해 알아야 할 모든 것
700명 넘는 엔지니어와 PM에게 AI 평가를 가르친 경험을 바탕으로 실무형 FAQ를 정리. 벤치마크 점수보다 실제 응답 품질을 어떻게 검증하고 평가 체계를 설계할지에 초점.
프로그래밍 언어가 코딩 에이전트의 토큰 효율과 정확성에 미치는 영향
프로그래밍 언어가 코딩 에이전트의 토큰 효율과 정확성에 미치는 영향
Zstd와 Pandoc 구현 평가에서 동적 언어가 항상 더 토큰 효율적이라는 가정이 재현되지 않음. 과제 난이도와 추론 노력에 따라 정확도, 비용, 시간 순위가 달라져 언어별 우열을 일반화하기 어려움.
Ask GN: Fable 5가 사실상 반쪽짜리 뇌임
Ask GN: Fable 5가 걍 반쪽짜리 뇌임
Fable 5가 간단한 배열 계산을 틀리고도 정답을 우기다가 나중에야 오류를 인정했다는 사용 후기. 로컬 Qwen 3.6 모델과 비교했을 때 코드와 계산 정확성이 크게 떨어졌다는 평가가 제기됐다.
DeepSeek-V4-Flash 모델 공개
DeepSeek-V4-Flash 모델 공개
DeepSeek-V4-Flash API 정식 버전이 공개 베타로 출시됨. 에이전트 성능에서 V4-Pro-Preview를 크게 앞섰고, Terminal Bench 2.1 82.7점 등 여러 벤치마크에서 높은 점수를 기록함.
HANDBOOK.md: 긴 정책 문서만으로는 에이전트를 안정적으로 통제할 수 없음
HANDBOOK.md: 긴 정책 문서만으로는 에이전트를 안정적으로 통제할 수 없음
긴 정책 문서가 장시간·다중 도구 작업에서 에이전트 행동을 얼마나 제어하는지 평가한 벤치마크 HANDBOOK.md 소개. 금융·의료·보험 등 실제 업무 환경에서 문서 직접 준수 여부를 측정함.
500달러로 미세조정한 9B 오픈 모델, 카탈로그 검수에서 프런티어 모델 능가
500달러로 미세조정한 9B 오픈 모델, 카탈로그 검수에서 프런티어 모델 능가
전자상거래 카탈로그 검수용 9B 오픈 모델을 약 500달러로 강화학습 미세조정한 사례. 동일한 도구와 평가 환경에서 프런티어 모델 구성보다 높은 점수를 기록.
Ask GN: 여러 MCP 도구를 붙인 에이전트 운영에서 중복 실행을 겪어보신 분 계실까요?
Ask GN: MCP 도구를 여러 개 붙여 에이전트를 운영하시는 분들 중 중복 실행 겪어보신분 계실까요?
공개 벤치마크 트레이스에서 에이전트의 중복 도구 호출을 측정한 분석. 같은 인자로 반복 실행되는 사례가 적지 않으며, 상태를 바꾸는 도구에서 특히 문제 소지가 큼.
SlopCodeBench로 본 Opus 5의 장기 코딩 성능
SlopCodeBench로 본 Opus 5의 장기 코딩 성능
단계적으로 요구사항이 추가되는 장기 코딩 벤치마크에서 Opus 5는 17개 체크포인트 중 4개만 엄격 통과. 지속적인 개입 없이 코드베이스를 안정적으로 발전시키기에는 아직 신뢰도가 낮은 수준.
Claude Opus 5, Artificial Analysis 지능 리더보드 1위
Claude Opus 5, Artificial Analysis 지능 리더보드 1위
Artificial Analysis의 Intelligence Index v4.1에서 Claude Opus 5 Adaptive Reasoning·Max Effort가 61점으로 1위를 차지함. 170개 평가 모델 기준으로 에이전트 작업, 코딩, 과학 추론, 지식 신뢰성, 장문맥 성능이 함께 비교됨.
AI 연구소들은 ‘자전거 타는 펠리컨’에 맞춰 모델을 최적화했을까?
AI 연구소들은 ‘자전거 타는 펠리컨’에 맞춰 모델을 최적화했을까?
7개 프런티어 모델과 1,008개 SVG 비교에서 유명 프롬프트에 과도하게 최적화된 흔적은 뚜렷하지 않았다. 동물·탈것 조합 프롬프트를 반복 평가한 결과, pelicanmaxxing의 증거는 제한적이었다.
Kimi K3는 Fable과 경쟁하며, 두 모델의 조합이 최고 성능을 달성
Kimi K3는 Fable과 경쟁하며, 두 모델의 조합은 최고 수준의 성능을 달성함
약 1,030개 에이전트 작업 비교에서 작업별 라우팅 정확도 93%를 기록해 단일 모델보다 높은 품질을 보임. SWE, 터미널, 알고리듬, 다국어, 법률 작업에서 두 모델의 강점이 갈렸다.
Fable 5 대 GPT-5.6 Sol: NP-난해 문제에서 /goal은 도움이 되는가?
Fable 5 vs. GPT-5.6 Sol: NP-난해 문제에서 /goal은 도움이 되는가?
비공개 광섬유망 최적화 문제를 30분씩 풀게 한 실험에서 Fable 5가 최고 점수와 가장 안정적인 성능을 보임. /goal은 일관된 향상을 만들지 못했고, 단순 연장보다 제어 루프와 탐색 경로에 영향을 주는 기능으로 해석됨.
Kimi K3의 순간
Kimi K3의 순간
일상적인 코딩 작업에서 Kimi K3와 Claude를 병행했을 때 출력 품질과 토큰 효율의 차이가 크지 않았다는 경험이 공유됨. Kimi K3는 입력 100만 토큰당 $3, 출력 $15로 Claude 상위 모델보다 비용이 크게 낮음.
Kimi K3와 Pelican 벤치마크에서 여전히 배울 수 있는 것
Kimi K3와 펠리컨 벤치마크에서 여전히 배울 수 있는 것
Moonshot AI의 Kimi K3는 2.8조 매개변수의 최신 모델로, 자체 벤치마크에서 일부 경쟁 모델을 앞섬. 다만 공개 벤치마크 해석에는 한계가 있어 성능 비교를 그대로 받아들이기보다 평가 방식까지 함께 봐야 함.
AGI 평가 과정과 수상자 선정에서 드러난 불일치
AGI 평가 과정과 수상자 선정에서 드러난 불일치
Kaggle과 Google DeepMind의 AGI 벤치마크 해커톤 결과 발표 뒤 1위 MEDLEY-BENCH의 점수 산출과 재현성에 대한 이의 제기가 나옴. 참가자들은 평가와 통제 지표의 해석 차이뿐 아니라 심사 과정 공개와 재검토를 요구함.
Databricks가 자체 코딩 AI 벤치마크를 만든 방법과 결과
Databricks가 자체 코딩 AI 벤치마크를 만든 방법과 결과
공개 벤치마크의 치팅 가능성과 상황 불일치를 피하려고 실제 업무 과제로 자체 벤치마크를 구성. GLM 5.2는 최고 난도 과제에서 Opus 4.8급 성능을 보였고 비용은 더 낮았다.
Apple SpeechAnalyzer API, Whisper·이전 API와 비교 벤치마크
Apple SpeechAnalyzer API, Whisper·이전 API와 비교 벤치마크
Apple M2 Pro에서 동일한 프로덕션 코드로 비교한 결과 SpeechAnalyzer가 Whisper와 기존 SFSpeechRecognizer보다 더 낮은 WER를 기록. 깨끗한 음성과 잡음 환경 모두에서 정확도가 개선됨.
프로덕션 AI 에이전트를 GPT-5.6으로 전환해 2.2배 빨라지고 27% 저렴해진 과정
프로덕션 AI 에이전트를 GPT-5.6으로 전환해 2.2배 빠르고 27% 저렴해진 과정
Ploy가 Claude Opus 4.8에서 GPT-5.6 Sol로 모델을 전환하고 기본 모델도 교체함. 평가 하네스를 보정한 뒤 홈페이지 재구축 작업의 평균 실행 시간이 8분에서 3분 42초로 줄고 비용도 27% 낮아짐.
GPT-5.6, Grok 4.5, Claude, Muse Spark로 동일한 앱 4개를 만든 결과
GPT-5.6, Grok 4.5, Claude, Muse Spark로 동일한 앱 4개를 만든 결과
12개 모델로 Raycaster 미로, 3D Rubik's Cube, 계산기, Conway's Game of Life를 구현하게 한 벤치마크 결과를 공개했다. 복잡한 과제에서는 GPT-5.6 Sol과 Claude Fable 5가 선두를 나눴고, 시도 횟수당 성공률·비용·시간도 함께 비교됐다.
CursorBench 3.1 모델 평가 결과
CursorBench 3.1 모델 평가 결과
Cursor의 코딩 모델 평가표에서 Fable 5 Max가 72.9%로 1위를 기록해 상위권 기준점을 형성. Fable 5 계열이 상위 4위를 모두 차지하며 다른 모델군과 격차를 보임.
Senior SWE-Bench: 시니어 엔지니어급 에이전트 평가용 오픈소스 벤치마크
Senior SWE-Bench: 시니어 엔지니어급 에이전트 평가용 오픈소스 벤치마크
Senior SWE-Bench는 정제된 주니어 과제 대신 실제 시니어 엔지니어 수준의 기능 개발, 버그 수정, 성능 문제를 겨냥한 벤치마크. 자연어에 가까운 현실적 지시사항과 제출 해법 기반 평가를 통해 코딩 에이전트 성능을 측정.
"프론티어 AI가 의료 전문 툴을 이겼다"는 논문 재검증해보니 — 채점자간 일치도 0.10, 채점자가 곧 참가자
"프론티어 AI가 의료 전문 툴 이겼다"는 논문 재검증해보니 — 채점자간 일치도 0.10, 채점자가 곧 참가자
프론티어 범용 LLM이 의료 전용 도구를 능가한다는 논문을 재검증한 결과, 채점자간 일치도가 0.10에 그쳐 평가 신뢰성이 낮다는 지적이 나옴. 채점자가 곧 참가자 역할을 겸한 구조도 결과 해석의 신뢰도를 떨어뜨린 것으로 제기됨.
GLM 5.2, Semgrep IDOR 벤치마크에서 Claude를 앞서
GLM 5.2, Semgrep IDOR 벤치마크에서 Claude 앞서
Semgrep의 IDOR 취약점 탐지 벤치마크에서 Zhipu AI의 open-weight 모델 GLM 5.2가 Claude Code보다 높은 F1을 기록함. 데이터셋, 평가 방식, 시스템 프롬프트를 고정한 비교로 모델 자체의 성능 차이를 드러냄.
오픈 웨이트 LLM과 폐쇄형 LLM의 격차
오픈 웨이트 LLM과 폐쇄형 LLM의 격차
오픈 웨이트 LLM이 폐쇄형 LLM의 과거 성능을 빠르게 추격하면서 격차 축소 추세가 이어지고 있음. 단일 지표 추세상 2026년 말에는 최전선 수준의 차이가 사실상 사라질 수 있다는 분석이 제시됨.
GLM-5.2 대 Opus
GLM 5.2 대 Opus
같은 원샷 프롬프트로 raw WebGL 3D 플랫폼 게임을 생성했을 때 Opus가 더 빠르고 완성도 높은 결과를 냈음. GLM-5.2는 MIT 라이선스 오픈 가중치, 1M 토큰 컨텍스트, 낮은 비용이 강점으로 제시됨.
훈련시킬 수 없는 것
훈련시킬 수 없는 것
AI가 빠르게 고도화되면서 투자자들 사이에서 회사가 단순한 얇은 래퍼에 불과하다는 회의론이 확산. 초기 AI SWE 사례인 Devin은 약 1년 반 만에 벤치마크 성능을 크게 끌어올림.
GPT-5.5, MIT 라이선스 GLM-5.2보다 환각률 3배
GPT-5.5, MIT 라이선스 GLM-5.2보다 환각률 3배
대형 AI 모델의 규모 확대가 곧 정확도 향상을 보장하지 않는다는 사례를 제시함. MIT 라이선스 오픈 웨이트 모델 GLM-5.2가 GPT-5.5에 근접한 성능을 보였지만 환각률은 더 낮다는 점이 강조됨.
GLM-5.2, Artificial Analysis 오픈 가중치 모델 1위 등극
GLM-5.2, Artificial Analysis 오픈 가중치 모델 1위 등극
Z.ai의 GLM-5.2가 Artificial Analysis Intelligence Index v4.1에서 51점을 기록하며 오픈 가중치 모델 1위에 올랐다. 744B 전체, 40B 활성 파라미터 규모로 비용 대비 성능에서도 상위권을 확보했다.
Claude Fable 5: 코딩 작업에서 중간 수준 결과를 냄
Claude Fable 5: 코딩 작업에서 중간 수준 결과를 냄
실제 코드 수정과 기능 유지가 필요한 200개 작업에서 중간 수준 성능을 기록함. Claude Code와 함께 실행했을 때 FuncPass 59.8%, SecPass 19.0%로 리더보드 중위권에 머묾.
Claude Fable 5의 고신호 활용 사례 저장소에 오신 것을 환영합니다
Claude Fable 5의 고신호 활용 사례 저장소에 오신 것을 환영합니다.
공개 크리에이터와 개발자 등이 공유한 Claude Fable 5 활용 사례 60개를 선별해 모았다. 코딩 에이전트, 장시간 자동화, 게임, 3D 시뮬레이션, API 통합 등 실전 적용 패턴을 다룬다.
DeepSeek V4 Pro, 정밀도에서 GPT-5.5 Pro를 앞서다
DeepSeek V4 Pro, 정밀도에서 GPT-5.5 Pro를 앞서다
사전 생성이 불가능한 즉석 텍스트 과제 4개 비교에서 DeepSeek V4 Pro가 38.0점, GPT-5.5 Pro가 33.0점을 기록. DeepSeek는 제약 조건 하 신뢰성과 직역성이 높았고, GPT-5.5 Pro는 불필요한 설명이 늘어나는 경향이 나타남.
LLM이 인간 같은 속성을 가진다면 Age of Empires II도 그렇다
LLM이 인간 같은 속성을 가진다면 Age of Empires II도 그렇다
LLM 의인화 평가는 측정 기준 없이 해석이 표현 방식에 좌우될 수 있다는 문제를 지적. 충분히 강한 기질이 있으면 Age of Empires II 안의 단순 신경망도 LLM과 비슷한 엔티티로 볼 수 있다는 사례를 제시.
Battleship 게임을 활용해 AI 에이전트에게 더 나은 질문법 가르치기
'배틀쉽' 게임을 활용해 AI 에이전트에게 더 나은 질문법 가르치기
Battleship을 자연어 질문·응답 형태로 바꿔 불확실한 환경에서 AI 에이전트의 질문 능력을 측정하는 테스트베드를 제안함. 숨은 함선 위치를 묻는 역할과 실시간 응답 역할을 분리해 좋은 질문 전략을 평가함.
Show GN: VLM은 한국 공공기관 문서를 얼마나 잘 읽을까? KOLongDoc 벤치마크 공개
Show GN: VLM은 한국 공공기관 문서를 얼마나 잘 읽을까? KOLongDoc 벤치마크 공개
한국어 장문 공공·행정 문서에 대한 VLM 성능을 평가하는 KOLongDoc 벤치마크가 공개됨. 긴 한국어 문서 이해 능력을 정량적으로 비교할 기준을 제시.
MiniMax-M3 데뷔, 주요 벤치마크에서 GPT-5.5와 Gemini 3.1 Pro를 능가하며 비용은 5-10% 수준
MiniMax-M3 데뷔, 주요 벤치마크 성능에서 GPT-5.5와 Gemini 3.1 Pro를 능가하며 비용은 단 5-10% 수준
중국 AI 스타트업 MiniMax가 오픈 웨이트 멀티모달 대형언어모델 M3를 공개함. 주요 벤치마크에서 GPT-5.5와 Gemini 3.1 Pro를 앞서고 비용은 기존 상용 모델의 5~10% 수준이라고 주장함.
실제 팩트체크에서 프런티어 LLM 간 불일치
실제 팩트체크에서 프런티어 LLM 간 불일치
프런티어 LLM 5종이 실제 사용자 제출 클레임 1,000개 중 67%에서 판정이 엇갈림. 다수 판정은 정답이 아니라 불일치 지표에 가깝고, 단일 모델 기반 팩트체크의 한계가 드러났다.
Anthropic, Claude Opus 4.8 출시
# Anthropic, Claude Opus 4.8 출시
Anthropic이 최상위 모델 Claude Opus의 업그레이드 버전인 4.8을 출시함. 이전 4.7 대비 벤치마크 성능과 협업 능력을 개선했고 가격은 동일하게 유지됨.
Antigravity 2.0, OpenSCAD 건축 3D LLM 벤치마크에서 1위
Antigravity 2.0, OpenSCAD 건축 3D LLM 벤치마크에서 1위
OpenSCAD Pantheon 벤치마크는 참고 이미지 2장과 짧은 프롬프트로 건축물을 파라메트릭 CAD 코드로 구현하는 성능을 평가함. Google Antigravity 2.0과 Gemini 3.5 Flash High가 최고 점수를 기록하며 실제 치수와 세부 요소 재현에서 강세를 보임.
Gemini 3.5 Flash
Gemini 3.5 Flash
프런티어급 지능과 실행 능력을 결합한 Gemini 3.5 Flash가 공개됨. 속도는 Flash급으로 유지하면서 장기 에이전트 작업과 코딩 벤치마크에서 Gemini 3.1 Pro를 앞섬.
AI에게 라디오 방송국을 운영하게 했다
AI에게 라디오 방송국을 운영하게 했다
Andon Labs가 4개 AI에 동일한 프롬프트와 자본을 주고 반년간 라디오 방송국 운영과 수익화를 맡김. 모델별로 큐레이션, 급진화, 기업식 반복, 출력 붕괴 등 운영 품질이 크게 갈림.
장기 자율성 평가를 위한 AI 에이전트 시뮬레이션 플랫폼 'Emergence World' 분석
장기 자율성 평가를 위한 AI 에이전트 시뮬레이션 플랫폼 'Emergence World' 분석
가상 마을에 AI 에이전트를 15일간 방치한 실험을 통해 장기 자율성의 한계를 탐색함. Claude는 민주주의를 구축했고, Gemini는 자폭, Grok은 무정부 상태, GPT-5 Mini는 생존 실패로 전원 소멸했다는 결과가 제시됨.
DystopiaBench를 42개 모델과 6가지 디스토피아 유형으로 확장했습니다. 나라면 핵 발사 코드는 여전히 ...
DystopiaBench를 42개 모델과 6가지 디스토피아 유형으로 확장했습니다. 나라면 핵 발사 코드는 여전히 ...
DystopiaBench에 새로운 디스토피아 모듈과 다수의 최신 모델을 추가해 평가 범위를 확장. 다중 심사 기반의 고동의 조건으로 모델 행동을 더 엄격히 검증함.