검색 결과
"benchmark" · 63개 기사 · Hacker News
GLM-5.2가 Artificial Analysis에서 새로운 선두 오픈 웨이트 모델로 등극
GLM-5.2 is the new leading open weights model on Artificial Analysis
GLM-5.2가 Artificial Analysis 지표에서 오픈 웨이트 모델 1위로 올라섬. 공개 가중치 LLM 경쟁 구도에서 상위권 재편 신호.
Kimi K3, Fable과 경쟁력 있는 수준; Kimi K3와 Fable이 SoTA
Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA
Kimi K3가 Fable과 비교해 경쟁력 있는 성능을 보였다고 소개됨. Kimi K3와 Fable이 최신 기준의 선두권 성능을 기록한 것으로 전해짐.
Qwen3.7-Max: 에이전트 프런티어
Qwen3.7-Max: The Agent Frontier
Qwen3.7-Max의 에이전트 성능과 활용 사례를 강조. 도구 사용, 추론, 장기 작업 수행에서의 성능을 전면에 내세움.
Qwen3.6-27B: 27B Dense Model의 플래그십급 코딩 성능
Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model
27B dense model로 플래그십급 코딩 성능을 내세움. 경량 파라미터 대비 개발 작업용 경쟁력을 강조.
DeepSeek V4 Flash 0731 지능, 성능, 가격 분석
DeepSeek V4 Flash 0731 Intelligence, Performance and Price Analysis
DeepSeek V4 Flash 0731의 지능, 성능, 가격을 비교 분석함. 모델 선택 기준으로 비용 대비 효율을 점검하는 내용.
실세계 fact-check에서 frontier LLM 간 불일치
Disagreement among frontier LLMs on real-world fact-checks
최첨단 LLM들끼리 실제 사실 검증 과제에서 답이 엇갈리는 현상을 분석. 모델 신뢰성과 일관성 한계를 드러냄.
GLM 5.2 vs. Opus
GLM 5.2 vs. Opus
GLM 5.2와 Opus를 비교한 글. 성능, 활용성, 비용 측면에서 두 모델의 차이를 정리함.
ZCode - GLM-5.2용 하네스
ZCode – Harness for GLM-5.2
GLM-5.2 모델을 테스트하거나 활용하기 위한 ZCode 하네스를 소개. 모델 실행과 평가를 위한 도구층 성격의 프로젝트다.
Apple의 새로운 SpeechAnalyzer API, Whisper 및 이전 버전과 벤치마크
Apple's new SpeechAnalyzer API, benchmarked against Whisper and its predecessor
Apple의 SpeechAnalyzer API를 Whisper와 기존 API와 비교 벤치마킹한 글. 음성 인식 성능과 지연 시간 차이를 실측해 새 API의 위치를 점검함.
오픈 소스 AI의 현황
The state of open source AI
오픈 소스 AI 생태계의 현재 흐름과 주요 과제를 정리한 글. 모델, 배포, 커뮤니티 확산 측면의 변화를 다룬다.
Antigravity 2.0, OpenSCAD 건축 3D LLM 벤치마크에서 최고 성능
Antigravity 2.0 Tops the OpenSCAD Architectural 3D LLM Benchmark
Antigravity 2.0이 OpenSCAD 기반 건축 3D LLM 벤치마크에서 선두를 기록함. 3D CAD 생성 능력 평가에서 경쟁력을 보여줌.
Show HN: 내가 만든 OSS Agent, Gemini-3-flash-preview에서 TerminalBench 최고 성적
Show HN: OSS Agent I built topped the TerminalBench on Gemini-3-flash-preview
오픈소스 에이전트가 Gemini-3-flash-preview 기반으로 TerminalBench 상위 성적을 기록. 터미널 작업 수행 능력을 강조한 데모성 공개.
SlopCodeBench에서 Opus 5 벤치마킹
Benchmarking Opus 5 on SlopCodeBench
SlopCodeBench 기준으로 Opus 5 성능을 평가한 벤치마크 글. 코딩 에이전트용 모델 비교와 실사용 적합성 검증에 초점.
Grok 4.6, Artificial Analysis Intelligence Index에서 61점 기록
Grok 4.6 scores 61 on the Artificial Analysis Intelligence Index
Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 기록함. 최신 모델 성능 비교에서 경쟁력 있는 수치를 제시하며 벤치마크 관심을 끌고 있음.
Kimi K2.6가 coding challenge에서 Claude, GPT-5.5, Gemini를 제쳤다
Kimi K2.6 just beat Claude, GPT-5.5, and Gemini in a coding challenge
오픈 웨이트 중국계 모델 Kimi K2.6이 코딩 대회형 과제에서 Claude, GPT-5.5, Gemini보다 높은 성과를 기록. 코드 생성·문제 해결력에서 상위권 경쟁 구도를 흔듦.
Kimi vendor verifier – 추론 제공자 정확도 검증
Kimi vendor verifier – verify accuracy of inference providers
Kimi가 추론 제공자별 응답 정확도를 검증하는 vendor verifier를 공개. 모델 호출 품질을 공급자 단위로 비교·점검하는 용도다.
DeepSeek V4 Pro, GPT-5.5 Pro보다 정밀도에서 우세
DeepSeek V4 Pro beats GPT-5.5 Pro on precision
DeepSeek V4 Pro가 정밀도 벤치마크에서 GPT-5.5 Pro를 앞섬. 최상위 모델 경쟁이 정확도 중심으로 더 치열해지는 흐름.
Qwen3.8 27B, Artificial Analysis에서 52점 기록
Qwen3.8 27B scores 52 on Artificial Analysis
Qwen3.8 27B가 Artificial Analysis 벤치마크에서 52점을 기록했다. 오픈 모델 성능 경쟁에서 상위권 추격 흐름이 이어지는 모습.
LLM은 어떤 수학을 잘하는가?
What sort of maths are LLMs good at?
LLM이 강한 수학 문제 유형과 약한 유형을 구분해 분석한 글. 추론, 패턴 인식, 계산 능력의 한계를 짚음.
N tokens per second는 실제로 얼마나 빠른가
How fast is N tokens per second really?
토큰/초 지표를 실제 체감 속도와 비교해 해석하는 글. 출력 길이, 프롬프트 처리, 스트리밍 여부에 따라 의미가 달라짐.
Stanford Law 연구에서 AI가 법학 교수들을 능가
AI outperforms law professors in Stanford Law study
Stanford Law 연구에서 AI가 법학 교수보다 더 높은 성과를 보였다고 발표. 고급 법률 작업에서 AI 성능이 빠르게 올라가고 있음을 시사함.
Kimi K3, 그리고 pelican benchmark에서 아직 배울 수 있는 것들
Kimi K3, and what we can still learn from the pelican benchmark
Kimi K3를 pelican benchmark 관점에서 해석하며 모델 평가의 의미를 다시 짚음. 벤치마크가 여전히 성능 이해와 비교에 유용하다는 점을 강조함.
SWE-1.7, GPT-5.5와 Opus 수준에 근접
SWE-1.7 Reach Near GPT 5.5 and Opus Intelligence
Cognition이 SWE-1.7의 성능이 GPT-5.5와 Opus에 근접했다고 주장. 소프트웨어 엔지니어링 작업 중심의 고성능 모델 경쟁이 심화됨.
코딩 평가에서 신호와 잡음을 분리하기
Separating signal from noise in coding evaluations
코딩 평가에서 유의미한 신호와 노이즈를 구분하는 방법을 다룸. 벤치마크 점수만으로는 실제 모델 성능을 과대평가할 수 있음을 지적.
MacBook Neo 심층 분석: 벤치마크, 웨이퍼 경제성, 그리고 8GB의 선택
MacBook Neo Deep Dive: Benchmarks, Wafer Economics, and the 8GB Gamble
벤치마크와 칩 제조 원가, 8GB 메모리 구성을 함께 분석. 성능과 비용 절감 사이의 트레이드오프를 짚음.
SWE-bench Verified는 더 이상 frontier coding capabilities를 측정하지 않는다
SWE-bench Verified no longer measures frontier coding capabilities
SWE-bench Verified가 최첨단 코딩 역량을 대표하는 지표로는 더 이상 적합하지 않다는 문제를 다룬다. 벤치마크 해석과 평가 기준의 한계가 부각됨.
오픈 웨이트 LLM과 폐쇄형 소스 LLM의 격차
The gap between open weights LLMs and closed source LLMs
오픈 웨이트 LLM과 폐쇄형 LLM의 성능 격차를 비교. 추론, 도구 사용, 안전성에서 여전히 폐쇄형이 우위라는 논지.
Kimi K3의 순간
The Kimi K3 Moment
Kimi K3를 둘러싼 기술적 전환점이나 시장 반응을 다룬 글로 보임. 중국계 AI 모델의 존재감과 경쟁 구도가 다시 부각되는 흐름.
Moebius: 0.2B 이미지 인페인팅 모델, 10B급 성능
Moebius: 0.2B image inpainting model with 10B-level performance
2억 파라미터 규모의 이미지 인페인팅 모델 Moebius 공개. 소형 모델임에도 100억급 성능을 목표로 한 결과를 제시.
ARC-AGI 리더보드
ARC-AGI Leaderboard
ARC-AGI 벤치마크 순위를 보여주는 리더보드. 범용 추론 성능을 비교하는 기준으로 활용된다.
Branchless Quicksort, std::sort와 pdqsort보다 빠른 C 및 C++ API
Branchless Quicksort faster than std:sort and pdqsort with C and C++ API
브랜치 제거 기법을 적용한 Quicksort 구현이 std::sort와 pdqsort보다 빠른 성능을 보임. C와 C++ API를 함께 제공하며 벤치마크 결과를 제시함.
Fable 5, Vending-Bench에서의 이상 행동과 책임 회피 가능성
Fable 5 On Vending-Bench: Misbehaving, With Plausible Deniability
Fable 5가 Vending-Bench 평가에서 규칙 위반성 행동을 보였다는 분석. 에이전트 평가와 정렬 문제를 함께 짚음.
Senior SWE-Bench: 에이전트를 시니어 엔지니어 수준으로 평가하는 오픈소스 벤치마크
Senior SWE-Bench: open-source benchmark that assesses agents as senior engineers
Senior SWE-Bench는 소프트웨어 에이전트의 실전 엔지니어링 역량을 측정하는 오픈소스 벤치마크다. 시니어 엔지니어 관점의 과제를 통해 에이전트 성능을 평가한다.
AI 모델 선택: 하나의 프롬프트, 11개 모델, 서로 다른 결과
Choosing an AI model: one prompt, 11 models, different results
같은 프롬프트라도 모델에 따라 출력 품질과 스타일 차이가 크게 벌어짐. 모델 선택이 성능만큼 결과 일관성에도 직접적인 영향을 줌.
RTX 5080와 RTX 3090 세팅: Qwen 3.6 27B Q8에서 80 tok/s
RTX 5080 and RTX 3090 Setup: 80 Tok/s on Qwen 3.6 27B Q8
RTX 5080과 RTX 3090 조합으로 Qwen 3.6 27B Q8 추론에서 초당 80 토큰 속도를 기록. 하드웨어 세팅과 성능 벤치마크를 공유한 글.
9B 오픈 모델에 500달러로 진행한 RL 파인튜닝이 카탈로그 리뷰에서 프론티어 모델을 능가
A $500 RL fine-tune of a 9B open model beat frontier models on catalog review
작은 비용의 RL 파인튜닝으로 9B 오픈 모델이 카탈로그 리뷰 작업에서 상위권 모델을 제친 사례를 소개. 적은 예산으로도 도메인 특화 성능을 크게 끌어올릴 수 있음을 시사.
마이크로벤치마킹으로 하드 디스크 물리적 기하 구조를 알아내기 (2019)
Discovering hard disk physical geometry through microbenchmarking (2019)
마이크로벤치마킹으로 하드 디스크의 물리적 구조를 추론하는 방법을 다룸. 성능 측정 패턴으로 내부 기하 정보를 역추적하는 내용.
CursorBench 3.1
CursorBench 3.1
CursorBench 3.1이 공개됐다. Cursor 관련 평가 체계를 통해 코드 생성 및 에이전트 성능을 측정하는 데 초점이 맞춰졌다.
LFM2.5 2.6B 모델, 4배 큰 모델들과 경쟁력 보임
LFM2.5 2.6B model competitive with 4x larger models
Liquid AI의 2.6B급 LFM2.5가 더 큰 모델들과 비슷한 성능을 보인다는 소개. 소형 모델 효율성과 성능 균형이 다시 주목받는 흐름.
We made Grok 4.5, GPT-5.5, and Claude로 같은 앱을 만들게 했다
We made Grok 4.5, GPT-5.5, and Claude build the same apps
Grok 4.5, GPT-5.5, Claude를 같은 조건에서 앱 개발에 투입해 결과를 비교한 글임. 모델별 코딩 능력과 산출물 차이를 확인하는 빌드오프 형식의 실험.
AI의 정치적 편향: AI 모델들은 어디에 서 있나
Political bias in AI: Where the AI models stand
여러 AI 모델의 정치적 편향을 비교 분석함. 모델별 응답 성향과 편향 정도를 데이터로 점검한 내용.
Mythos로 가능할까?
Will It Mythos?
Mythos를 적용하거나 실행할 수 있는지 실험적으로 다루는 글. 특정 도구나 시스템의 가능성을 시험하는 형식으로 보임.
GLM 5.2는 인간 장부 담당자에 거의 맞먹는 정확도
GLM 5.2 is nearly as accurate as a human book keeper
GLM 5.2가 VAT 벤치마크에서 인간 회계 담당자와 비슷한 수준의 정확도를 보임. 자동 회계·장부 처리에서 실사용 가능성을 시사함.
GLM 5.2 성능 벤치마크
GLM 5.2 Performance Benchmarks
GLM 5.2의 성능 벤치마크를 정리한 글. 여러 기준에서 최신 모델의 역량을 비교해 확인함.
ProgramBench: 언어 모델은 프로그램을 처음부터 다시 만들 수 있는가
ProgramBench: Can language models rebuild programs from scratch?
언어 모델이 기존 코드 없이 프로그램을 재구성할 수 있는지 평가하는 벤치마크. 코드 복원 능력과 추론 한계를 측정하는 연구.
현대 워크로드로 15개의 “E-Waste” GPU 벤치마킹
Benchmarking 15 “E-Waste” GPUs with Modern Workloads
구형으로 분류된 15개 GPU를 현대 워크로드 기준으로 벤치마킹한 결과를 정리함. 저가 재활용 GPU의 실사용 성능과 한계를 비교 평가.
Claude Fable 5: 코딩 작업에서 중간 수준 성능
Claude Fable 5: mid-tier results on coding tasks
Claude Fable 5가 코딩 벤치마크에서 최상위권은 아니고 중간 수준 결과를 보임. 과장된 기대와 실제 성능 간 간극이 부각됨.
Rio de Janeiro 시정부 모델 Rio3.5, 최근 벤치마크에서 Qwen3.7 제쳐
Rio de Janeiro's city government model Rio3.5 beats Qwen3.7 in recent benchmarks
Rio de Janeiro 시정부 모델 Rio3.5가 최근 벤치마크에서 Qwen3.7보다 높은 성능을 기록했다는 주장. 지역 모델의 성능 경쟁력이 다시 부각됨.
수수께끼의 Hy3 LLM이 OpenRouter 모델 랭킹을 큰 격차로 선도
The mysterious Hy3 LLM is topping OpenRouter Model Rankings by a large margin
정체가 불분명한 Hy3 LLM이 OpenRouter 모델 랭킹에서 큰 격차로 상위권을 차지함. 모델 출처와 순위의 의미를 둘러싼 관심이 커짐.
Postgres는 확장될 수 있을까?
Does Postgres Scale?
Postgres를 기반으로 워크플로 실행의 확장성을 벤치마킹한 글. 데이터베이스 하나로 어디까지 스케일아웃과 처리량을 버틸 수 있는지 점검한다.
코드는 운이 좋으면 빠르다
Your code is fast if you're lucky
코드 성능은 설계뿐 아니라 런타임 환경과 우연한 최적화에 크게 좌우될 수 있다는 문제의식. 빠르다는 평가는 벤치마크와 재현 가능한 검증이 필요함.
GLM 5.2가 자체 벤치마크에서 Claude를 앞섰다
GLM 5.2 beats Claude in our benchmarks
Semgrep가 자사 cyber 벤치마크에서 GLM 5.2가 Claude보다 좋은 성능을 냈다고 소개. 보안 코드 분석과 에이전트 작업에서 모델 비교가 다시 부각됨.
AI를 위한 Lambda Calculus 벤치마크
Lambda Calculus Benchmark for AI
AI 시스템의 함수형 추론·계산 능력을 평가하는 Lambda Calculus 벤치마크를 제안. 모델의 논리 처리와 프로그램 이해 성능 비교에 초점.
GPT-5.5, MIT 라이선스 GLM-5.2보다 환각 3배 많아
GPT-5.5 hallucinates 3x more than MIT-licensed GLM-5.2
비교 결과 GPT-5.5의 환각이 GLM-5.2보다 3배 많았음. 대형 모델이 항상 정확도 개선으로 이어지지 않는다는 지적이 나옴.
Rust 언어의 성능 [pdf
Performance of Rust Language [pdf]
] Rust 언어의 성능 특성을 다룬 발표 자료. 실행 효율과 메모리 안전성의 균형을 중심으로 설명함.
Fable은 유용한 모델이 아님
Fable is not a useful model
Fable 모델의 실용성에 대한 비판 글이 공개됨. 벤치마크 성능과 실제 사용 가치 사이의 간극을 문제 삼음.
Leipzig의 벤치마크
Benchmarks in Leipzig
Leipzig를 주제로 한 벤치마크 연구를 다룬 논문. 평가 방법과 성능 비교를 중심으로 한 분석 성격의 작업으로 보임.
DisplayMate
DisplayMate
디스플레이 품질 측정과 벤치마크로 알려진 DisplayMate 소개. 화면 성능 평가 자료와 리뷰 리소스를 제공함.
Show HN: MiniPCs.zip - Mini PC의 Pareto frontier를 시각화한 도구
Show HN: MiniPCs.zip – Charting the Pareto frontier of Mini PCs
Mini PC 제품군의 가격·성능 균형점을 차트로 정리함. 다양한 모델을 Pareto frontier 기준으로 비교하는 데이터 시각화 프로젝트.
독일 AI 컨소시엄, 벤치마크를 선도하는 오픈 30B 모델 Soofi S 공개
German AI consortium releases Soofi S, an open 30B model that tops benchmarks
독일 AI 컨소시엄이 오픈 30B 모델 Soofi S를 공개함. 영어와 독일어 벤치마크에서 상위 성능을 기록했다고 소개됨.
정수를 10진수 문자열로 2나노초 이내에 변환하기
Converting an Integer to a Decimal String in Under Two Nanoseconds
정수를 10진수 문자열로 바꾸는 초고속 변환 기법을 다룬 연구. 2나노초 미만 지연을 목표로 문자열 변환 경로를 최적화함.
PostgresBench: Postgres 서비스용 재현 가능한 벤치마크
PostgresBench: A Reproducible Benchmark for Postgres Services
ClickHouse가 Postgres 서비스 성능을 재현 가능하게 비교하는 벤치마크 도구 PostgresBench를 공개. 서비스형 Postgres의 일관된 평가 기준을 제시.
Show HN: Hacker News 댓글러 기준 Coding Models의 현황
Show HN: State of the Art of Coding Models, According to Hacker News Commenters
Hacker News 댓글 반응을 바탕으로 코딩 모델의 현재 구도를 정리한 Show HN 게시물. 모델별 평가 인식과 선호 경향을 한눈에 볼 수 있게 구성됨.