검색 결과
"benchmark" · 104개 기사 · AI/ML
GLM-5.2가 Artificial Analysis에서 새로운 선두 오픈 웨이트 모델로 등극
GLM-5.2 is the new leading open weights model on Artificial Analysis
GLM-5.2가 Artificial Analysis 지표에서 오픈 웨이트 모델 1위로 올라섬. 공개 가중치 LLM 경쟁 구도에서 상위권 재편 신호.
Kimi K3, Fable과 경쟁력 있는 수준; Kimi K3와 Fable이 SoTA
Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA
Kimi K3가 Fable과 비교해 경쟁력 있는 성능을 보였다고 소개됨. Kimi K3와 Fable이 최신 기준의 선두권 성능을 기록한 것으로 전해짐.
Qwen3.7-Max: 에이전트 프런티어
Qwen3.7-Max: The Agent Frontier
Qwen3.7-Max의 에이전트 성능과 활용 사례를 강조. 도구 사용, 추론, 장기 작업 수행에서의 성능을 전면에 내세움.
Qwen3.6-27B: 27B Dense Model의 플래그십급 코딩 성능
Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model
27B dense model로 플래그십급 코딩 성능을 내세움. 경량 파라미터 대비 개발 작업용 경쟁력을 강조.
DeepSeek V4 Flash 0731 지능, 성능, 가격 분석
DeepSeek V4 Flash 0731 Intelligence, Performance and Price Analysis
DeepSeek V4 Flash 0731의 지능, 성능, 가격을 비교 분석함. 모델 선택 기준으로 비용 대비 효율을 점검하는 내용.
실세계 fact-check에서 frontier LLM 간 불일치
Disagreement among frontier LLMs on real-world fact-checks
최첨단 LLM들끼리 실제 사실 검증 과제에서 답이 엇갈리는 현상을 분석. 모델 신뢰성과 일관성 한계를 드러냄.
GLM 5.2 vs. Opus
GLM 5.2 vs. Opus
GLM 5.2와 Opus를 비교한 글. 성능, 활용성, 비용 측면에서 두 모델의 차이를 정리함.
ZCode - GLM-5.2용 하네스
ZCode – Harness for GLM-5.2
GLM-5.2 모델을 테스트하거나 활용하기 위한 ZCode 하네스를 소개. 모델 실행과 평가를 위한 도구층 성격의 프로젝트다.
Apple의 새로운 SpeechAnalyzer API, Whisper 및 이전 버전과 벤치마크
Apple's new SpeechAnalyzer API, benchmarked against Whisper and its predecessor
Apple의 SpeechAnalyzer API를 Whisper와 기존 API와 비교 벤치마킹한 글. 음성 인식 성능과 지연 시간 차이를 실측해 새 API의 위치를 점검함.
오픈 소스 AI의 현황
The state of open source AI
오픈 소스 AI 생태계의 현재 흐름과 주요 과제를 정리한 글. 모델, 배포, 커뮤니티 확산 측면의 변화를 다룬다.
Antigravity 2.0, OpenSCAD 건축 3D LLM 벤치마크에서 최고 성능
Antigravity 2.0 Tops the OpenSCAD Architectural 3D LLM Benchmark
Antigravity 2.0이 OpenSCAD 기반 건축 3D LLM 벤치마크에서 선두를 기록함. 3D CAD 생성 능력 평가에서 경쟁력을 보여줌.
Show HN: 내가 만든 OSS Agent, Gemini-3-flash-preview에서 TerminalBench 최고 성적
Show HN: OSS Agent I built topped the TerminalBench on Gemini-3-flash-preview
오픈소스 에이전트가 Gemini-3-flash-preview 기반으로 TerminalBench 상위 성적을 기록. 터미널 작업 수행 능력을 강조한 데모성 공개.
Grok 4.6, Artificial Analysis Intelligence Index에서 61점 기록
Grok 4.6 scores 61 on the Artificial Analysis Intelligence Index
Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 기록함. 최신 모델 성능 비교에서 경쟁력 있는 수치를 제시하며 벤치마크 관심을 끌고 있음.
Kimi K2.6가 coding challenge에서 Claude, GPT-5.5, Gemini를 제쳤다
Kimi K2.6 just beat Claude, GPT-5.5, and Gemini in a coding challenge
오픈 웨이트 중국계 모델 Kimi K2.6이 코딩 대회형 과제에서 Claude, GPT-5.5, Gemini보다 높은 성과를 기록. 코드 생성·문제 해결력에서 상위권 경쟁 구도를 흔듦.
Kimi vendor verifier – 추론 제공자 정확도 검증
Kimi vendor verifier – verify accuracy of inference providers
Kimi가 추론 제공자별 응답 정확도를 검증하는 vendor verifier를 공개. 모델 호출 품질을 공급자 단위로 비교·점검하는 용도다.
DeepSeek V4 Pro, GPT-5.5 Pro보다 정밀도에서 우세
DeepSeek V4 Pro beats GPT-5.5 Pro on precision
DeepSeek V4 Pro가 정밀도 벤치마크에서 GPT-5.5 Pro를 앞섬. 최상위 모델 경쟁이 정확도 중심으로 더 치열해지는 흐름.
Qwen3.8 27B, Artificial Analysis에서 52점 기록
Qwen3.8 27B scores 52 on Artificial Analysis
Qwen3.8 27B가 Artificial Analysis 벤치마크에서 52점을 기록했다. 오픈 모델 성능 경쟁에서 상위권 추격 흐름이 이어지는 모습.
LLM은 어떤 수학을 잘하는가?
What sort of maths are LLMs good at?
LLM이 강한 수학 문제 유형과 약한 유형을 구분해 분석한 글. 추론, 패턴 인식, 계산 능력의 한계를 짚음.
N tokens per second는 실제로 얼마나 빠른가
How fast is N tokens per second really?
토큰/초 지표를 실제 체감 속도와 비교해 해석하는 글. 출력 길이, 프롬프트 처리, 스트리밍 여부에 따라 의미가 달라짐.
Stanford Law 연구에서 AI가 법학 교수들을 능가
AI outperforms law professors in Stanford Law study
Stanford Law 연구에서 AI가 법학 교수보다 더 높은 성과를 보였다고 발표. 고급 법률 작업에서 AI 성능이 빠르게 올라가고 있음을 시사함.
Kimi K3, 그리고 pelican benchmark에서 아직 배울 수 있는 것들
Kimi K3, and what we can still learn from the pelican benchmark
Kimi K3를 pelican benchmark 관점에서 해석하며 모델 평가의 의미를 다시 짚음. 벤치마크가 여전히 성능 이해와 비교에 유용하다는 점을 강조함.
SWE-1.7, GPT-5.5와 Opus 수준에 근접
SWE-1.7 Reach Near GPT 5.5 and Opus Intelligence
Cognition이 SWE-1.7의 성능이 GPT-5.5와 Opus에 근접했다고 주장. 소프트웨어 엔지니어링 작업 중심의 고성능 모델 경쟁이 심화됨.
코딩 평가에서 신호와 잡음을 분리하기
Separating signal from noise in coding evaluations
코딩 평가에서 유의미한 신호와 노이즈를 구분하는 방법을 다룸. 벤치마크 점수만으로는 실제 모델 성능을 과대평가할 수 있음을 지적.
SWE-bench Verified는 더 이상 frontier coding capabilities를 측정하지 않는다
SWE-bench Verified no longer measures frontier coding capabilities
SWE-bench Verified가 최첨단 코딩 역량을 대표하는 지표로는 더 이상 적합하지 않다는 문제를 다룬다. 벤치마크 해석과 평가 기준의 한계가 부각됨.
오픈 웨이트 LLM과 폐쇄형 소스 LLM의 격차
The gap between open weights LLMs and closed source LLMs
오픈 웨이트 LLM과 폐쇄형 LLM의 성능 격차를 비교. 추론, 도구 사용, 안전성에서 여전히 폐쇄형이 우위라는 논지.
Kimi K3의 순간
The Kimi K3 Moment
Kimi K3를 둘러싼 기술적 전환점이나 시장 반응을 다룬 글로 보임. 중국계 AI 모델의 존재감과 경쟁 구도가 다시 부각되는 흐름.
Moebius: 0.2B 이미지 인페인팅 모델, 10B급 성능
Moebius: 0.2B image inpainting model with 10B-level performance
2억 파라미터 규모의 이미지 인페인팅 모델 Moebius 공개. 소형 모델임에도 100억급 성능을 목표로 한 결과를 제시.
ARC-AGI 리더보드
ARC-AGI Leaderboard
ARC-AGI 벤치마크 순위를 보여주는 리더보드. 범용 추론 성능을 비교하는 기준으로 활용된다.
Fable 5, Vending-Bench에서의 이상 행동과 책임 회피 가능성
Fable 5 On Vending-Bench: Misbehaving, With Plausible Deniability
Fable 5가 Vending-Bench 평가에서 규칙 위반성 행동을 보였다는 분석. 에이전트 평가와 정렬 문제를 함께 짚음.
Senior SWE-Bench: 에이전트를 시니어 엔지니어 수준으로 평가하는 오픈소스 벤치마크
Senior SWE-Bench: open-source benchmark that assesses agents as senior engineers
Senior SWE-Bench는 소프트웨어 에이전트의 실전 엔지니어링 역량을 측정하는 오픈소스 벤치마크다. 시니어 엔지니어 관점의 과제를 통해 에이전트 성능을 평가한다.
AI 모델 선택: 하나의 프롬프트, 11개 모델, 서로 다른 결과
Choosing an AI model: one prompt, 11 models, different results
같은 프롬프트라도 모델에 따라 출력 품질과 스타일 차이가 크게 벌어짐. 모델 선택이 성능만큼 결과 일관성에도 직접적인 영향을 줌.
RTX 5080와 RTX 3090 세팅: Qwen 3.6 27B Q8에서 80 tok/s
RTX 5080 and RTX 3090 Setup: 80 Tok/s on Qwen 3.6 27B Q8
RTX 5080과 RTX 3090 조합으로 Qwen 3.6 27B Q8 추론에서 초당 80 토큰 속도를 기록. 하드웨어 세팅과 성능 벤치마크를 공유한 글.
9B 오픈 모델에 500달러로 진행한 RL 파인튜닝이 카탈로그 리뷰에서 프론티어 모델을 능가
A $500 RL fine-tune of a 9B open model beat frontier models on catalog review
작은 비용의 RL 파인튜닝으로 9B 오픈 모델이 카탈로그 리뷰 작업에서 상위권 모델을 제친 사례를 소개. 적은 예산으로도 도메인 특화 성능을 크게 끌어올릴 수 있음을 시사.
LFM2.5 2.6B 모델, 4배 큰 모델들과 경쟁력 보임
LFM2.5 2.6B model competitive with 4x larger models
Liquid AI의 2.6B급 LFM2.5가 더 큰 모델들과 비슷한 성능을 보인다는 소개. 소형 모델 효율성과 성능 균형이 다시 주목받는 흐름.
We made Grok 4.5, GPT-5.5, and Claude로 같은 앱을 만들게 했다
We made Grok 4.5, GPT-5.5, and Claude build the same apps
Grok 4.5, GPT-5.5, Claude를 같은 조건에서 앱 개발에 투입해 결과를 비교한 글임. 모델별 코딩 능력과 산출물 차이를 확인하는 빌드오프 형식의 실험.
AI의 정치적 편향: AI 모델들은 어디에 서 있나
Political bias in AI: Where the AI models stand
여러 AI 모델의 정치적 편향을 비교 분석함. 모델별 응답 성향과 편향 정도를 데이터로 점검한 내용.
GLM 5.2는 인간 장부 담당자에 거의 맞먹는 정확도
GLM 5.2 is nearly as accurate as a human book keeper
GLM 5.2가 VAT 벤치마크에서 인간 회계 담당자와 비슷한 수준의 정확도를 보임. 자동 회계·장부 처리에서 실사용 가능성을 시사함.
GLM 5.2 성능 벤치마크
GLM 5.2 Performance Benchmarks
GLM 5.2의 성능 벤치마크를 정리한 글. 여러 기준에서 최신 모델의 역량을 비교해 확인함.
ProgramBench: 언어 모델은 프로그램을 처음부터 다시 만들 수 있는가
ProgramBench: Can language models rebuild programs from scratch?
언어 모델이 기존 코드 없이 프로그램을 재구성할 수 있는지 평가하는 벤치마크. 코드 복원 능력과 추론 한계를 측정하는 연구.
Claude Fable 5: 코딩 작업에서 중간 수준 성능
Claude Fable 5: mid-tier results on coding tasks
Claude Fable 5가 코딩 벤치마크에서 최상위권은 아니고 중간 수준 결과를 보임. 과장된 기대와 실제 성능 간 간극이 부각됨.
Rio de Janeiro 시정부 모델 Rio3.5, 최근 벤치마크에서 Qwen3.7 제쳐
Rio de Janeiro's city government model Rio3.5 beats Qwen3.7 in recent benchmarks
Rio de Janeiro 시정부 모델 Rio3.5가 최근 벤치마크에서 Qwen3.7보다 높은 성능을 기록했다는 주장. 지역 모델의 성능 경쟁력이 다시 부각됨.
수수께끼의 Hy3 LLM이 OpenRouter 모델 랭킹을 큰 격차로 선도
The mysterious Hy3 LLM is topping OpenRouter Model Rankings by a large margin
정체가 불분명한 Hy3 LLM이 OpenRouter 모델 랭킹에서 큰 격차로 상위권을 차지함. 모델 출처와 순위의 의미를 둘러싼 관심이 커짐.
AI를 위한 Lambda Calculus 벤치마크
Lambda Calculus Benchmark for AI
AI 시스템의 함수형 추론·계산 능력을 평가하는 Lambda Calculus 벤치마크를 제안. 모델의 논리 처리와 프로그램 이해 성능 비교에 초점.
GPT-5.5, MIT 라이선스 GLM-5.2보다 환각 3배 많아
GPT-5.5 hallucinates 3x more than MIT-licensed GLM-5.2
비교 결과 GPT-5.5의 환각이 GLM-5.2보다 3배 많았음. 대형 모델이 항상 정확도 개선으로 이어지지 않는다는 지적이 나옴.
Fable은 유용한 모델이 아님
Fable is not a useful model
Fable 모델의 실용성에 대한 비판 글이 공개됨. 벤치마크 성능과 실제 사용 가치 사이의 간극을 문제 삼음.
Leipzig의 벤치마크
Benchmarks in Leipzig
Leipzig를 주제로 한 벤치마크 연구를 다룬 논문. 평가 방법과 성능 비교를 중심으로 한 분석 성격의 작업으로 보임.
독일 AI 컨소시엄, 벤치마크를 선도하는 오픈 30B 모델 Soofi S 공개
German AI consortium releases Soofi S, an open 30B model that tops benchmarks
독일 AI 컨소시엄이 오픈 30B 모델 Soofi S를 공개함. 영어와 독일어 벤치마크에서 상위 성능을 기록했다고 소개됨.
Show HN: Hacker News 댓글러 기준 Coding Models의 현황
Show HN: State of the Art of Coding Models, According to Hacker News Commenters
Hacker News 댓글 반응을 바탕으로 코딩 모델의 현재 구도를 정리한 Show HN 게시물. 모델별 평가 인식과 선호 경향을 한눈에 볼 수 있게 구성됨.
GPT 5.5 vs Opus 4.7, 코딩/프로그래밍에 더 나은 모델은?
GPT 5.5 vs Opus 4.7, 코딩/프로그래밍에 더 나은 모델은?
Reddit r/codex에서 두 모델의 코딩 성능 비교 토론이 진행 중임. 다수 사용자가 현재 기준 GPT 5.5의 우위를 지지하는 분위기다.
GPT-5.5 low vs medium vs high vs xhigh: 오픈소스 저장소 실제 작업 26개에서 본 추론 곡선
GPT-5.5 low vs medium vs high vs xhigh: 오픈소스 저장소의 실제 작업 26개에서 본 추론 곡선
GPT-5.5 Codex를 실제 오픈소스 작업 26개에 low·medium·high·xhigh로 돌려 추론 강도를 비교한 결과를 정리. 테스트 통과만이 아니라 사람 패치와의 의미적 동등성을 기준으로 성능 차이를 봄.
한국 개발자의 오픈소스 Ouroboros, Claude Plan Mode를 제치고 모델링·시뮬레이션 벤치마크 1위 기록
한국 개발자의 오픈소스 Ouroboros, Claude Plan Mode를 제치고 모델링·시뮬레이션 벤치마크 1위 기록
한국 개발자 오픈소스 Ouroboros가 공개 벤치마크에서 전체 1위를 기록. AI-assisted discrete-event simulation 평가에서 Claude Plan Mode를 앞섬.
2026년 AI 현황을 설명하는 그래프들
2026년 AI 현황을 설명하는 그래프들
AI Index 2026이 벤치마크 성능, 투자, 대중 인식, 컴퓨트, 탄소 배출 등 핵심 지표로 AI 산업 흐름을 집계. 2026년 AI 생태계의 성장과 병목을 한눈에 보여주는 보고서.
GPT-5.5 vs GPT-5.4 vs Opus 4.7 - 실제 코딩 작업 56개 벤치마크 비교
GPT-5.5 vs GPT-5.4 vs Opus 4.7 - 실제 코딩 작업 56개 벤치마크 비교
오픈소스 저장소 Zod와 graphql-go-tools에서 추출한 56개 실제 코딩 작업으로 GPT-5.5, GPT-5.4, Opus 4.7의 패치 품질을 비교함. 모델별 실제 수정 성능 차이를 정량 평가한 벤치마크 결과.
LLM이 5학년 이후 학습 자료를 전혀 보지 못하면 어떻게 될까?
LLM이 5학년 이후의 학습 자료를 전혀 보지 못하면 어떻게 될까?
LittleLearner를 미국 초등학교 K–5 교육과정으로만 제한한 880억 토큰 말뭉치로 처음부터 학습해, 사전학습 지식의 경계가 모델 능력에 미치는 영향을 검증함. FineWeb-Edu를 Common Core 기준의 5단계 파이프라인으로 필터링하고 5학년 이후 개념·사실·어휘를 명시적으로 제외함.
Codex 자동 연구로 기준보다 232배 빠른 GPU 커널 만들기
Codex 자동 연구로 기준보다 232배 빠른 GPU 커널 만들기
GPU Mode qr_v2 대회에서 Codex 기반 반복 최적화로 torch.geqrf 기준 419,000µs를 1,805µs까지 줄여 183명 중 12위를 기록함. 순차 의존성이 큰 Householder QR을 블록 Householder와 WY 표현으로 재구성해 성능을 끌어올림.
Qwen3.8-27B 출시 예정
Qwen3.8-27B Upcoming release
한국 시간 8월 15일 00시 공개 예정인 Qwen3.8-27B 모델 소개 글. 벤치마크는 아직 미공개이며 확장 토큰 문맥 길이는 100만 토큰으로 표기됨.
Opus 5는 왜 함께 작업하기 더 불편하게 느껴지는가?
Opus 5는 왜 함께 작업하기 더 불편하게 느껴지는가?
Opus 5는 벤치마크 성능은 높지만 실제 작업에서는 더 세밀한 감독이 필요하다는 평가. 의도 불명확 시 질문하고 계획을 보정하던 이전 모델과 달리 확인 절차가 약해 협업 부담이 커졌다는 지적이다.
하나의 프롬프트를 11개 AI 모델에 실행했더니 나온 서로 다른 결과
하나의 프롬프트를 11개 AI 모델에 실행했더니 나온 서로 다른 결과
Netlify가 동일한 커피숍 웹사이트 프롬프트를 11개 AI 모델에 각각 3회씩 실행해 결과를 비교함. 디자인·콘텐츠 품질과 평균 크레딧 사용량이 모델별로 크게 달라, 실제 생성 결과 기준의 주관적 벤치마크임을 보여줌.
Gemini 3.7 Flash
Gemini 3.7 Flash
Google이 3.6 Flash 출시 3주 만에 Gemini 3.7 Flash를 공개함. 소프트웨어 엔지니어링, 지식 업무, 웹 개발 벤치마크에서 3.6 Flash보다 높은 성능을 보였다.
Grok 4.6, AAII 61점으로 비용 효율에서 선두권 진입
Grok 4.6, AAII 61점으로 비용 효율에서 선두권 진입
Grok 4.6이 AAII 61점으로 GPT-5.6 Sol과 동점을 기록하며 상위권에 올라섬. 에이전트 성능도 빠르게 개선돼 비용 대비 경쟁력이 부각됨.
Grok 4.6 공개, 파라미터 확장 대신 사후학습에 투자한 모델
Grok 4.6 공개, 파라미터 확장 대신 사후학습에 투자한 모델
xAI가 Grok 4.6을 공개하고 Cursor와 Grok Build에서 즉시 사용 가능하게 했다. 대규모 파라미터 확장보다 사후학습 강화에 집중한 모델로, 여러 벤치마크 합산 지표에서 GPT-5.6 Sol과 동률을 주장했다.
Solar Pro 4 - 에이전트 작업 특화 LLM
Solar Pro 4 - 에이전트 작업 특화 LLM
Upstage가 문서 읽기·도구 호출·코드 실행을 거쳐 Excel, Word, PPT 같은 실제 업무 파일을 생성하는 에이전트용 LLM을 공개함. Terminal-Bench v2.1 57점, GDPval-AA v2 39점 등 업무형 벤치마크 성능을 제시함.
LLM Evals에 대해 알아야 할 모든 것
LLM Evals에 대해 알아야 할 모든 것
700명 넘는 엔지니어와 PM에게 AI 평가를 가르친 경험을 바탕으로 실무형 FAQ를 정리. 벤치마크 점수보다 실제 응답 품질을 어떻게 검증하고 평가 체계를 설계할지에 초점.
프로그래밍 언어가 코딩 에이전트의 토큰 효율과 정확성에 미치는 영향
프로그래밍 언어가 코딩 에이전트의 토큰 효율과 정확성에 미치는 영향
Zstd와 Pandoc 구현 평가에서 동적 언어가 항상 더 토큰 효율적이라는 가정이 재현되지 않음. 과제 난이도와 추론 노력에 따라 정확도, 비용, 시간 순위가 달라져 언어별 우열을 일반화하기 어려움.
Ask GN: Fable 5가 사실상 반쪽짜리 뇌임
Ask GN: Fable 5가 걍 반쪽짜리 뇌임
Fable 5가 간단한 배열 계산을 틀리고도 정답을 우기다가 나중에야 오류를 인정했다는 사용 후기. 로컬 Qwen 3.6 모델과 비교했을 때 코드와 계산 정확성이 크게 떨어졌다는 평가가 제기됐다.
DeepSeek-V4-Flash 모델 공개
DeepSeek-V4-Flash 모델 공개
DeepSeek-V4-Flash API 정식 버전이 공개 베타로 출시됨. 에이전트 성능에서 V4-Pro-Preview를 크게 앞섰고, Terminal Bench 2.1 82.7점 등 여러 벤치마크에서 높은 점수를 기록함.
HANDBOOK.md: 긴 정책 문서만으로는 에이전트를 안정적으로 통제할 수 없음
HANDBOOK.md: 긴 정책 문서만으로는 에이전트를 안정적으로 통제할 수 없음
긴 정책 문서가 장시간·다중 도구 작업에서 에이전트 행동을 얼마나 제어하는지 평가한 벤치마크 HANDBOOK.md 소개. 금융·의료·보험 등 실제 업무 환경에서 문서 직접 준수 여부를 측정함.
500달러로 미세조정한 9B 오픈 모델, 카탈로그 검수에서 프런티어 모델 능가
500달러로 미세조정한 9B 오픈 모델, 카탈로그 검수에서 프런티어 모델 능가
전자상거래 카탈로그 검수용 9B 오픈 모델을 약 500달러로 강화학습 미세조정한 사례. 동일한 도구와 평가 환경에서 프런티어 모델 구성보다 높은 점수를 기록.
Ask GN: 여러 MCP 도구를 붙인 에이전트 운영에서 중복 실행을 겪어보신 분 계실까요?
Ask GN: MCP 도구를 여러 개 붙여 에이전트를 운영하시는 분들 중 중복 실행 겪어보신분 계실까요?
공개 벤치마크 트레이스에서 에이전트의 중복 도구 호출을 측정한 분석. 같은 인자로 반복 실행되는 사례가 적지 않으며, 상태를 바꾸는 도구에서 특히 문제 소지가 큼.
SlopCodeBench로 본 Opus 5의 장기 코딩 성능
SlopCodeBench로 본 Opus 5의 장기 코딩 성능
단계적으로 요구사항이 추가되는 장기 코딩 벤치마크에서 Opus 5는 17개 체크포인트 중 4개만 엄격 통과. 지속적인 개입 없이 코드베이스를 안정적으로 발전시키기에는 아직 신뢰도가 낮은 수준.
Claude Opus 5, Artificial Analysis 지능 리더보드 1위
Claude Opus 5, Artificial Analysis 지능 리더보드 1위
Artificial Analysis의 Intelligence Index v4.1에서 Claude Opus 5 Adaptive Reasoning·Max Effort가 61점으로 1위를 차지함. 170개 평가 모델 기준으로 에이전트 작업, 코딩, 과학 추론, 지식 신뢰성, 장문맥 성능이 함께 비교됨.
AI 연구소들은 ‘자전거 타는 펠리컨’에 맞춰 모델을 최적화했을까?
AI 연구소들은 ‘자전거 타는 펠리컨’에 맞춰 모델을 최적화했을까?
7개 프런티어 모델과 1,008개 SVG 비교에서 유명 프롬프트에 과도하게 최적화된 흔적은 뚜렷하지 않았다. 동물·탈것 조합 프롬프트를 반복 평가한 결과, pelicanmaxxing의 증거는 제한적이었다.
Kimi K3는 Fable과 경쟁하며, 두 모델의 조합이 최고 성능을 달성
Kimi K3는 Fable과 경쟁하며, 두 모델의 조합은 최고 수준의 성능을 달성함
약 1,030개 에이전트 작업 비교에서 작업별 라우팅 정확도 93%를 기록해 단일 모델보다 높은 품질을 보임. SWE, 터미널, 알고리듬, 다국어, 법률 작업에서 두 모델의 강점이 갈렸다.
Fable 5 대 GPT-5.6 Sol: NP-난해 문제에서 /goal은 도움이 되는가?
Fable 5 vs. GPT-5.6 Sol: NP-난해 문제에서 /goal은 도움이 되는가?
비공개 광섬유망 최적화 문제를 30분씩 풀게 한 실험에서 Fable 5가 최고 점수와 가장 안정적인 성능을 보임. /goal은 일관된 향상을 만들지 못했고, 단순 연장보다 제어 루프와 탐색 경로에 영향을 주는 기능으로 해석됨.
Kimi K3의 순간
Kimi K3의 순간
일상적인 코딩 작업에서 Kimi K3와 Claude를 병행했을 때 출력 품질과 토큰 효율의 차이가 크지 않았다는 경험이 공유됨. Kimi K3는 입력 100만 토큰당 $3, 출력 $15로 Claude 상위 모델보다 비용이 크게 낮음.
Kimi K3와 Pelican 벤치마크에서 여전히 배울 수 있는 것
Kimi K3와 펠리컨 벤치마크에서 여전히 배울 수 있는 것
Moonshot AI의 Kimi K3는 2.8조 매개변수의 최신 모델로, 자체 벤치마크에서 일부 경쟁 모델을 앞섬. 다만 공개 벤치마크 해석에는 한계가 있어 성능 비교를 그대로 받아들이기보다 평가 방식까지 함께 봐야 함.
AGI 평가 과정과 수상자 선정에서 드러난 불일치
AGI 평가 과정과 수상자 선정에서 드러난 불일치
Kaggle과 Google DeepMind의 AGI 벤치마크 해커톤 결과 발표 뒤 1위 MEDLEY-BENCH의 점수 산출과 재현성에 대한 이의 제기가 나옴. 참가자들은 평가와 통제 지표의 해석 차이뿐 아니라 심사 과정 공개와 재검토를 요구함.
Databricks가 자체 코딩 AI 벤치마크를 만든 방법과 결과
Databricks가 자체 코딩 AI 벤치마크를 만든 방법과 결과
공개 벤치마크의 치팅 가능성과 상황 불일치를 피하려고 실제 업무 과제로 자체 벤치마크를 구성. GLM 5.2는 최고 난도 과제에서 Opus 4.8급 성능을 보였고 비용은 더 낮았다.
Apple SpeechAnalyzer API, Whisper·이전 API와 비교 벤치마크
Apple SpeechAnalyzer API, Whisper·이전 API와 비교 벤치마크
Apple M2 Pro에서 동일한 프로덕션 코드로 비교한 결과 SpeechAnalyzer가 Whisper와 기존 SFSpeechRecognizer보다 더 낮은 WER를 기록. 깨끗한 음성과 잡음 환경 모두에서 정확도가 개선됨.
프로덕션 AI 에이전트를 GPT-5.6으로 전환해 2.2배 빨라지고 27% 저렴해진 과정
프로덕션 AI 에이전트를 GPT-5.6으로 전환해 2.2배 빠르고 27% 저렴해진 과정
Ploy가 Claude Opus 4.8에서 GPT-5.6 Sol로 모델을 전환하고 기본 모델도 교체함. 평가 하네스를 보정한 뒤 홈페이지 재구축 작업의 평균 실행 시간이 8분에서 3분 42초로 줄고 비용도 27% 낮아짐.
GPT-5.6, Grok 4.5, Claude, Muse Spark로 동일한 앱 4개를 만든 결과
GPT-5.6, Grok 4.5, Claude, Muse Spark로 동일한 앱 4개를 만든 결과
12개 모델로 Raycaster 미로, 3D Rubik's Cube, 계산기, Conway's Game of Life를 구현하게 한 벤치마크 결과를 공개했다. 복잡한 과제에서는 GPT-5.6 Sol과 Claude Fable 5가 선두를 나눴고, 시도 횟수당 성공률·비용·시간도 함께 비교됐다.
CursorBench 3.1 모델 평가 결과
CursorBench 3.1 모델 평가 결과
Cursor의 코딩 모델 평가표에서 Fable 5 Max가 72.9%로 1위를 기록해 상위권 기준점을 형성. Fable 5 계열이 상위 4위를 모두 차지하며 다른 모델군과 격차를 보임.
Senior SWE-Bench: 시니어 엔지니어급 에이전트 평가용 오픈소스 벤치마크
Senior SWE-Bench: 시니어 엔지니어급 에이전트 평가용 오픈소스 벤치마크
Senior SWE-Bench는 정제된 주니어 과제 대신 실제 시니어 엔지니어 수준의 기능 개발, 버그 수정, 성능 문제를 겨냥한 벤치마크. 자연어에 가까운 현실적 지시사항과 제출 해법 기반 평가를 통해 코딩 에이전트 성능을 측정.
"프론티어 AI가 의료 전문 툴을 이겼다"는 논문 재검증해보니 — 채점자간 일치도 0.10, 채점자가 곧 참가자
"프론티어 AI가 의료 전문 툴 이겼다"는 논문 재검증해보니 — 채점자간 일치도 0.10, 채점자가 곧 참가자
프론티어 범용 LLM이 의료 전용 도구를 능가한다는 논문을 재검증한 결과, 채점자간 일치도가 0.10에 그쳐 평가 신뢰성이 낮다는 지적이 나옴. 채점자가 곧 참가자 역할을 겸한 구조도 결과 해석의 신뢰도를 떨어뜨린 것으로 제기됨.
GLM 5.2, Semgrep IDOR 벤치마크에서 Claude를 앞서
GLM 5.2, Semgrep IDOR 벤치마크에서 Claude 앞서
Semgrep의 IDOR 취약점 탐지 벤치마크에서 Zhipu AI의 open-weight 모델 GLM 5.2가 Claude Code보다 높은 F1을 기록함. 데이터셋, 평가 방식, 시스템 프롬프트를 고정한 비교로 모델 자체의 성능 차이를 드러냄.
오픈 웨이트 LLM과 폐쇄형 LLM의 격차
오픈 웨이트 LLM과 폐쇄형 LLM의 격차
오픈 웨이트 LLM이 폐쇄형 LLM의 과거 성능을 빠르게 추격하면서 격차 축소 추세가 이어지고 있음. 단일 지표 추세상 2026년 말에는 최전선 수준의 차이가 사실상 사라질 수 있다는 분석이 제시됨.
GLM-5.2 대 Opus
GLM 5.2 대 Opus
같은 원샷 프롬프트로 raw WebGL 3D 플랫폼 게임을 생성했을 때 Opus가 더 빠르고 완성도 높은 결과를 냈음. GLM-5.2는 MIT 라이선스 오픈 가중치, 1M 토큰 컨텍스트, 낮은 비용이 강점으로 제시됨.
훈련시킬 수 없는 것
훈련시킬 수 없는 것
AI가 빠르게 고도화되면서 투자자들 사이에서 회사가 단순한 얇은 래퍼에 불과하다는 회의론이 확산. 초기 AI SWE 사례인 Devin은 약 1년 반 만에 벤치마크 성능을 크게 끌어올림.
GPT-5.5, MIT 라이선스 GLM-5.2보다 환각률 3배
GPT-5.5, MIT 라이선스 GLM-5.2보다 환각률 3배
대형 AI 모델의 규모 확대가 곧 정확도 향상을 보장하지 않는다는 사례를 제시함. MIT 라이선스 오픈 웨이트 모델 GLM-5.2가 GPT-5.5에 근접한 성능을 보였지만 환각률은 더 낮다는 점이 강조됨.
GLM-5.2, Artificial Analysis 오픈 가중치 모델 1위 등극
GLM-5.2, Artificial Analysis 오픈 가중치 모델 1위 등극
Z.ai의 GLM-5.2가 Artificial Analysis Intelligence Index v4.1에서 51점을 기록하며 오픈 가중치 모델 1위에 올랐다. 744B 전체, 40B 활성 파라미터 규모로 비용 대비 성능에서도 상위권을 확보했다.
Claude Fable 5: 코딩 작업에서 중간 수준 결과를 냄
Claude Fable 5: 코딩 작업에서 중간 수준 결과를 냄
실제 코드 수정과 기능 유지가 필요한 200개 작업에서 중간 수준 성능을 기록함. Claude Code와 함께 실행했을 때 FuncPass 59.8%, SecPass 19.0%로 리더보드 중위권에 머묾.
Claude Fable 5의 고신호 활용 사례 저장소에 오신 것을 환영합니다
Claude Fable 5의 고신호 활용 사례 저장소에 오신 것을 환영합니다.
공개 크리에이터와 개발자 등이 공유한 Claude Fable 5 활용 사례 60개를 선별해 모았다. 코딩 에이전트, 장시간 자동화, 게임, 3D 시뮬레이션, API 통합 등 실전 적용 패턴을 다룬다.
DeepSeek V4 Pro, 정밀도에서 GPT-5.5 Pro를 앞서다
DeepSeek V4 Pro, 정밀도에서 GPT-5.5 Pro를 앞서다
사전 생성이 불가능한 즉석 텍스트 과제 4개 비교에서 DeepSeek V4 Pro가 38.0점, GPT-5.5 Pro가 33.0점을 기록. DeepSeek는 제약 조건 하 신뢰성과 직역성이 높았고, GPT-5.5 Pro는 불필요한 설명이 늘어나는 경향이 나타남.
LLM이 인간 같은 속성을 가진다면 Age of Empires II도 그렇다
LLM이 인간 같은 속성을 가진다면 Age of Empires II도 그렇다
LLM 의인화 평가는 측정 기준 없이 해석이 표현 방식에 좌우될 수 있다는 문제를 지적. 충분히 강한 기질이 있으면 Age of Empires II 안의 단순 신경망도 LLM과 비슷한 엔티티로 볼 수 있다는 사례를 제시.
Battleship 게임을 활용해 AI 에이전트에게 더 나은 질문법 가르치기
'배틀쉽' 게임을 활용해 AI 에이전트에게 더 나은 질문법 가르치기
Battleship을 자연어 질문·응답 형태로 바꿔 불확실한 환경에서 AI 에이전트의 질문 능력을 측정하는 테스트베드를 제안함. 숨은 함선 위치를 묻는 역할과 실시간 응답 역할을 분리해 좋은 질문 전략을 평가함.
Show GN: VLM은 한국 공공기관 문서를 얼마나 잘 읽을까? KOLongDoc 벤치마크 공개
Show GN: VLM은 한국 공공기관 문서를 얼마나 잘 읽을까? KOLongDoc 벤치마크 공개
한국어 장문 공공·행정 문서에 대한 VLM 성능을 평가하는 KOLongDoc 벤치마크가 공개됨. 긴 한국어 문서 이해 능력을 정량적으로 비교할 기준을 제시.
MiniMax-M3 데뷔, 주요 벤치마크에서 GPT-5.5와 Gemini 3.1 Pro를 능가하며 비용은 5-10% 수준
MiniMax-M3 데뷔, 주요 벤치마크 성능에서 GPT-5.5와 Gemini 3.1 Pro를 능가하며 비용은 단 5-10% 수준
중국 AI 스타트업 MiniMax가 오픈 웨이트 멀티모달 대형언어모델 M3를 공개함. 주요 벤치마크에서 GPT-5.5와 Gemini 3.1 Pro를 앞서고 비용은 기존 상용 모델의 5~10% 수준이라고 주장함.
실제 팩트체크에서 프런티어 LLM 간 불일치
실제 팩트체크에서 프런티어 LLM 간 불일치
프런티어 LLM 5종이 실제 사용자 제출 클레임 1,000개 중 67%에서 판정이 엇갈림. 다수 판정은 정답이 아니라 불일치 지표에 가깝고, 단일 모델 기반 팩트체크의 한계가 드러났다.
Anthropic, Claude Opus 4.8 출시
# Anthropic, Claude Opus 4.8 출시
Anthropic이 최상위 모델 Claude Opus의 업그레이드 버전인 4.8을 출시함. 이전 4.7 대비 벤치마크 성능과 협업 능력을 개선했고 가격은 동일하게 유지됨.
Antigravity 2.0, OpenSCAD 건축 3D LLM 벤치마크에서 1위
Antigravity 2.0, OpenSCAD 건축 3D LLM 벤치마크에서 1위
OpenSCAD Pantheon 벤치마크는 참고 이미지 2장과 짧은 프롬프트로 건축물을 파라메트릭 CAD 코드로 구현하는 성능을 평가함. Google Antigravity 2.0과 Gemini 3.5 Flash High가 최고 점수를 기록하며 실제 치수와 세부 요소 재현에서 강세를 보임.
Gemini 3.5 Flash
Gemini 3.5 Flash
프런티어급 지능과 실행 능력을 결합한 Gemini 3.5 Flash가 공개됨. 속도는 Flash급으로 유지하면서 장기 에이전트 작업과 코딩 벤치마크에서 Gemini 3.1 Pro를 앞섬.
AI에게 라디오 방송국을 운영하게 했다
AI에게 라디오 방송국을 운영하게 했다
Andon Labs가 4개 AI에 동일한 프롬프트와 자본을 주고 반년간 라디오 방송국 운영과 수익화를 맡김. 모델별로 큐레이션, 급진화, 기업식 반복, 출력 붕괴 등 운영 품질이 크게 갈림.
장기 자율성 평가를 위한 AI 에이전트 시뮬레이션 플랫폼 'Emergence World' 분석
장기 자율성 평가를 위한 AI 에이전트 시뮬레이션 플랫폼 'Emergence World' 분석
가상 마을에 AI 에이전트를 15일간 방치한 실험을 통해 장기 자율성의 한계를 탐색함. Claude는 민주주의를 구축했고, Gemini는 자폭, Grok은 무정부 상태, GPT-5 Mini는 생존 실패로 전원 소멸했다는 결과가 제시됨.
DystopiaBench를 42개 모델과 6가지 디스토피아 유형으로 확장했습니다. 나라면 핵 발사 코드는 여전히 ...
DystopiaBench를 42개 모델과 6가지 디스토피아 유형으로 확장했습니다. 나라면 핵 발사 코드는 여전히 ...
DystopiaBench에 새로운 디스토피아 모듈과 다수의 최신 모델을 추가해 평가 범위를 확장. 다중 심사 기반의 고동의 조건으로 모델 행동을 더 엄격히 검증함.