검색 결과
"benchmark" · 48개 기사 · Hacker News · AI/ML
GLM-5.2가 Artificial Analysis에서 새로운 선두 오픈 웨이트 모델로 등극
GLM-5.2 is the new leading open weights model on Artificial Analysis
GLM-5.2가 Artificial Analysis 지표에서 오픈 웨이트 모델 1위로 올라섬. 공개 가중치 LLM 경쟁 구도에서 상위권 재편 신호.
Kimi K3, Fable과 경쟁력 있는 수준; Kimi K3와 Fable이 SoTA
Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA
Kimi K3가 Fable과 비교해 경쟁력 있는 성능을 보였다고 소개됨. Kimi K3와 Fable이 최신 기준의 선두권 성능을 기록한 것으로 전해짐.
Qwen3.7-Max: 에이전트 프런티어
Qwen3.7-Max: The Agent Frontier
Qwen3.7-Max의 에이전트 성능과 활용 사례를 강조. 도구 사용, 추론, 장기 작업 수행에서의 성능을 전면에 내세움.
Qwen3.6-27B: 27B Dense Model의 플래그십급 코딩 성능
Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model
27B dense model로 플래그십급 코딩 성능을 내세움. 경량 파라미터 대비 개발 작업용 경쟁력을 강조.
DeepSeek V4 Flash 0731 지능, 성능, 가격 분석
DeepSeek V4 Flash 0731 Intelligence, Performance and Price Analysis
DeepSeek V4 Flash 0731의 지능, 성능, 가격을 비교 분석함. 모델 선택 기준으로 비용 대비 효율을 점검하는 내용.
실세계 fact-check에서 frontier LLM 간 불일치
Disagreement among frontier LLMs on real-world fact-checks
최첨단 LLM들끼리 실제 사실 검증 과제에서 답이 엇갈리는 현상을 분석. 모델 신뢰성과 일관성 한계를 드러냄.
GLM 5.2 vs. Opus
GLM 5.2 vs. Opus
GLM 5.2와 Opus를 비교한 글. 성능, 활용성, 비용 측면에서 두 모델의 차이를 정리함.
ZCode - GLM-5.2용 하네스
ZCode – Harness for GLM-5.2
GLM-5.2 모델을 테스트하거나 활용하기 위한 ZCode 하네스를 소개. 모델 실행과 평가를 위한 도구층 성격의 프로젝트다.
Apple의 새로운 SpeechAnalyzer API, Whisper 및 이전 버전과 벤치마크
Apple's new SpeechAnalyzer API, benchmarked against Whisper and its predecessor
Apple의 SpeechAnalyzer API를 Whisper와 기존 API와 비교 벤치마킹한 글. 음성 인식 성능과 지연 시간 차이를 실측해 새 API의 위치를 점검함.
오픈 소스 AI의 현황
The state of open source AI
오픈 소스 AI 생태계의 현재 흐름과 주요 과제를 정리한 글. 모델, 배포, 커뮤니티 확산 측면의 변화를 다룬다.
Antigravity 2.0, OpenSCAD 건축 3D LLM 벤치마크에서 최고 성능
Antigravity 2.0 Tops the OpenSCAD Architectural 3D LLM Benchmark
Antigravity 2.0이 OpenSCAD 기반 건축 3D LLM 벤치마크에서 선두를 기록함. 3D CAD 생성 능력 평가에서 경쟁력을 보여줌.
Show HN: 내가 만든 OSS Agent, Gemini-3-flash-preview에서 TerminalBench 최고 성적
Show HN: OSS Agent I built topped the TerminalBench on Gemini-3-flash-preview
오픈소스 에이전트가 Gemini-3-flash-preview 기반으로 TerminalBench 상위 성적을 기록. 터미널 작업 수행 능력을 강조한 데모성 공개.
Grok 4.6, Artificial Analysis Intelligence Index에서 61점 기록
Grok 4.6 scores 61 on the Artificial Analysis Intelligence Index
Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 기록함. 최신 모델 성능 비교에서 경쟁력 있는 수치를 제시하며 벤치마크 관심을 끌고 있음.
Kimi K2.6가 coding challenge에서 Claude, GPT-5.5, Gemini를 제쳤다
Kimi K2.6 just beat Claude, GPT-5.5, and Gemini in a coding challenge
오픈 웨이트 중국계 모델 Kimi K2.6이 코딩 대회형 과제에서 Claude, GPT-5.5, Gemini보다 높은 성과를 기록. 코드 생성·문제 해결력에서 상위권 경쟁 구도를 흔듦.
Kimi vendor verifier – 추론 제공자 정확도 검증
Kimi vendor verifier – verify accuracy of inference providers
Kimi가 추론 제공자별 응답 정확도를 검증하는 vendor verifier를 공개. 모델 호출 품질을 공급자 단위로 비교·점검하는 용도다.
DeepSeek V4 Pro, GPT-5.5 Pro보다 정밀도에서 우세
DeepSeek V4 Pro beats GPT-5.5 Pro on precision
DeepSeek V4 Pro가 정밀도 벤치마크에서 GPT-5.5 Pro를 앞섬. 최상위 모델 경쟁이 정확도 중심으로 더 치열해지는 흐름.
Qwen3.8 27B, Artificial Analysis에서 52점 기록
Qwen3.8 27B scores 52 on Artificial Analysis
Qwen3.8 27B가 Artificial Analysis 벤치마크에서 52점을 기록했다. 오픈 모델 성능 경쟁에서 상위권 추격 흐름이 이어지는 모습.
LLM은 어떤 수학을 잘하는가?
What sort of maths are LLMs good at?
LLM이 강한 수학 문제 유형과 약한 유형을 구분해 분석한 글. 추론, 패턴 인식, 계산 능력의 한계를 짚음.
N tokens per second는 실제로 얼마나 빠른가
How fast is N tokens per second really?
토큰/초 지표를 실제 체감 속도와 비교해 해석하는 글. 출력 길이, 프롬프트 처리, 스트리밍 여부에 따라 의미가 달라짐.
Stanford Law 연구에서 AI가 법학 교수들을 능가
AI outperforms law professors in Stanford Law study
Stanford Law 연구에서 AI가 법학 교수보다 더 높은 성과를 보였다고 발표. 고급 법률 작업에서 AI 성능이 빠르게 올라가고 있음을 시사함.
Kimi K3, 그리고 pelican benchmark에서 아직 배울 수 있는 것들
Kimi K3, and what we can still learn from the pelican benchmark
Kimi K3를 pelican benchmark 관점에서 해석하며 모델 평가의 의미를 다시 짚음. 벤치마크가 여전히 성능 이해와 비교에 유용하다는 점을 강조함.
SWE-1.7, GPT-5.5와 Opus 수준에 근접
SWE-1.7 Reach Near GPT 5.5 and Opus Intelligence
Cognition이 SWE-1.7의 성능이 GPT-5.5와 Opus에 근접했다고 주장. 소프트웨어 엔지니어링 작업 중심의 고성능 모델 경쟁이 심화됨.
코딩 평가에서 신호와 잡음을 분리하기
Separating signal from noise in coding evaluations
코딩 평가에서 유의미한 신호와 노이즈를 구분하는 방법을 다룸. 벤치마크 점수만으로는 실제 모델 성능을 과대평가할 수 있음을 지적.
SWE-bench Verified는 더 이상 frontier coding capabilities를 측정하지 않는다
SWE-bench Verified no longer measures frontier coding capabilities
SWE-bench Verified가 최첨단 코딩 역량을 대표하는 지표로는 더 이상 적합하지 않다는 문제를 다룬다. 벤치마크 해석과 평가 기준의 한계가 부각됨.
오픈 웨이트 LLM과 폐쇄형 소스 LLM의 격차
The gap between open weights LLMs and closed source LLMs
오픈 웨이트 LLM과 폐쇄형 LLM의 성능 격차를 비교. 추론, 도구 사용, 안전성에서 여전히 폐쇄형이 우위라는 논지.
Kimi K3의 순간
The Kimi K3 Moment
Kimi K3를 둘러싼 기술적 전환점이나 시장 반응을 다룬 글로 보임. 중국계 AI 모델의 존재감과 경쟁 구도가 다시 부각되는 흐름.
Moebius: 0.2B 이미지 인페인팅 모델, 10B급 성능
Moebius: 0.2B image inpainting model with 10B-level performance
2억 파라미터 규모의 이미지 인페인팅 모델 Moebius 공개. 소형 모델임에도 100억급 성능을 목표로 한 결과를 제시.
ARC-AGI 리더보드
ARC-AGI Leaderboard
ARC-AGI 벤치마크 순위를 보여주는 리더보드. 범용 추론 성능을 비교하는 기준으로 활용된다.
Fable 5, Vending-Bench에서의 이상 행동과 책임 회피 가능성
Fable 5 On Vending-Bench: Misbehaving, With Plausible Deniability
Fable 5가 Vending-Bench 평가에서 규칙 위반성 행동을 보였다는 분석. 에이전트 평가와 정렬 문제를 함께 짚음.
Senior SWE-Bench: 에이전트를 시니어 엔지니어 수준으로 평가하는 오픈소스 벤치마크
Senior SWE-Bench: open-source benchmark that assesses agents as senior engineers
Senior SWE-Bench는 소프트웨어 에이전트의 실전 엔지니어링 역량을 측정하는 오픈소스 벤치마크다. 시니어 엔지니어 관점의 과제를 통해 에이전트 성능을 평가한다.
AI 모델 선택: 하나의 프롬프트, 11개 모델, 서로 다른 결과
Choosing an AI model: one prompt, 11 models, different results
같은 프롬프트라도 모델에 따라 출력 품질과 스타일 차이가 크게 벌어짐. 모델 선택이 성능만큼 결과 일관성에도 직접적인 영향을 줌.
RTX 5080와 RTX 3090 세팅: Qwen 3.6 27B Q8에서 80 tok/s
RTX 5080 and RTX 3090 Setup: 80 Tok/s on Qwen 3.6 27B Q8
RTX 5080과 RTX 3090 조합으로 Qwen 3.6 27B Q8 추론에서 초당 80 토큰 속도를 기록. 하드웨어 세팅과 성능 벤치마크를 공유한 글.
9B 오픈 모델에 500달러로 진행한 RL 파인튜닝이 카탈로그 리뷰에서 프론티어 모델을 능가
A $500 RL fine-tune of a 9B open model beat frontier models on catalog review
작은 비용의 RL 파인튜닝으로 9B 오픈 모델이 카탈로그 리뷰 작업에서 상위권 모델을 제친 사례를 소개. 적은 예산으로도 도메인 특화 성능을 크게 끌어올릴 수 있음을 시사.
LFM2.5 2.6B 모델, 4배 큰 모델들과 경쟁력 보임
LFM2.5 2.6B model competitive with 4x larger models
Liquid AI의 2.6B급 LFM2.5가 더 큰 모델들과 비슷한 성능을 보인다는 소개. 소형 모델 효율성과 성능 균형이 다시 주목받는 흐름.
We made Grok 4.5, GPT-5.5, and Claude로 같은 앱을 만들게 했다
We made Grok 4.5, GPT-5.5, and Claude build the same apps
Grok 4.5, GPT-5.5, Claude를 같은 조건에서 앱 개발에 투입해 결과를 비교한 글임. 모델별 코딩 능력과 산출물 차이를 확인하는 빌드오프 형식의 실험.
AI의 정치적 편향: AI 모델들은 어디에 서 있나
Political bias in AI: Where the AI models stand
여러 AI 모델의 정치적 편향을 비교 분석함. 모델별 응답 성향과 편향 정도를 데이터로 점검한 내용.
GLM 5.2는 인간 장부 담당자에 거의 맞먹는 정확도
GLM 5.2 is nearly as accurate as a human book keeper
GLM 5.2가 VAT 벤치마크에서 인간 회계 담당자와 비슷한 수준의 정확도를 보임. 자동 회계·장부 처리에서 실사용 가능성을 시사함.
GLM 5.2 성능 벤치마크
GLM 5.2 Performance Benchmarks
GLM 5.2의 성능 벤치마크를 정리한 글. 여러 기준에서 최신 모델의 역량을 비교해 확인함.
ProgramBench: 언어 모델은 프로그램을 처음부터 다시 만들 수 있는가
ProgramBench: Can language models rebuild programs from scratch?
언어 모델이 기존 코드 없이 프로그램을 재구성할 수 있는지 평가하는 벤치마크. 코드 복원 능력과 추론 한계를 측정하는 연구.
Claude Fable 5: 코딩 작업에서 중간 수준 성능
Claude Fable 5: mid-tier results on coding tasks
Claude Fable 5가 코딩 벤치마크에서 최상위권은 아니고 중간 수준 결과를 보임. 과장된 기대와 실제 성능 간 간극이 부각됨.
Rio de Janeiro 시정부 모델 Rio3.5, 최근 벤치마크에서 Qwen3.7 제쳐
Rio de Janeiro's city government model Rio3.5 beats Qwen3.7 in recent benchmarks
Rio de Janeiro 시정부 모델 Rio3.5가 최근 벤치마크에서 Qwen3.7보다 높은 성능을 기록했다는 주장. 지역 모델의 성능 경쟁력이 다시 부각됨.
수수께끼의 Hy3 LLM이 OpenRouter 모델 랭킹을 큰 격차로 선도
The mysterious Hy3 LLM is topping OpenRouter Model Rankings by a large margin
정체가 불분명한 Hy3 LLM이 OpenRouter 모델 랭킹에서 큰 격차로 상위권을 차지함. 모델 출처와 순위의 의미를 둘러싼 관심이 커짐.
AI를 위한 Lambda Calculus 벤치마크
Lambda Calculus Benchmark for AI
AI 시스템의 함수형 추론·계산 능력을 평가하는 Lambda Calculus 벤치마크를 제안. 모델의 논리 처리와 프로그램 이해 성능 비교에 초점.
GPT-5.5, MIT 라이선스 GLM-5.2보다 환각 3배 많아
GPT-5.5 hallucinates 3x more than MIT-licensed GLM-5.2
비교 결과 GPT-5.5의 환각이 GLM-5.2보다 3배 많았음. 대형 모델이 항상 정확도 개선으로 이어지지 않는다는 지적이 나옴.
Fable은 유용한 모델이 아님
Fable is not a useful model
Fable 모델의 실용성에 대한 비판 글이 공개됨. 벤치마크 성능과 실제 사용 가치 사이의 간극을 문제 삼음.
Leipzig의 벤치마크
Benchmarks in Leipzig
Leipzig를 주제로 한 벤치마크 연구를 다룬 논문. 평가 방법과 성능 비교를 중심으로 한 분석 성격의 작업으로 보임.
독일 AI 컨소시엄, 벤치마크를 선도하는 오픈 30B 모델 Soofi S 공개
German AI consortium releases Soofi S, an open 30B model that tops benchmarks
독일 AI 컨소시엄이 오픈 30B 모델 Soofi S를 공개함. 영어와 독일어 벤치마크에서 상위 성능을 기록했다고 소개됨.
Show HN: Hacker News 댓글러 기준 Coding Models의 현황
Show HN: State of the Art of Coding Models, According to Hacker News Commenters
Hacker News 댓글 반응을 바탕으로 코딩 모델의 현재 구도를 정리한 Show HN 게시물. 모델별 평가 인식과 선호 경향을 한눈에 볼 수 있게 구성됨.