검색 결과

"benchmark" · 48개 기사 · Hacker News · AI/ML

1
해커뉴스AI/ML7103582026-06-17

GLM-5.2가 Artificial Analysis에서 새로운 선두 오픈 웨이트 모델로 등극

GLM-5.2 is the new leading open weights model on Artificial Analysis

GLM-5.2가 Artificial Analysis 지표에서 오픈 웨이트 모델 1위로 올라섬. 공개 가중치 LLM 경쟁 구도에서 상위권 재편 신호.

2
해커뉴스AI/ML5823252026-07-22

Kimi K3, Fable과 경쟁력 있는 수준; Kimi K3와 Fable이 SoTA

Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA

Kimi K3가 Fable과 비교해 경쟁력 있는 성능을 보였다고 소개됨. Kimi K3와 Fable이 최신 기준의 선두권 성능을 기록한 것으로 전해짐.

3
해커뉴스AI/ML5482132026-05-20

Qwen3.7-Max: 에이전트 프런티어

Qwen3.7-Max: The Agent Frontier

Qwen3.7-Max의 에이전트 성능과 활용 사례를 강조. 도구 사용, 추론, 장기 작업 수행에서의 성능을 전면에 내세움.

4
해커뉴스AI/ML5382602026-04-22

Qwen3.6-27B: 27B Dense Model의 플래그십급 코딩 성능

Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model

27B dense model로 플래그십급 코딩 성능을 내세움. 경량 파라미터 대비 개발 작업용 경쟁력을 강조.

5
해커뉴스AI/ML4932712026-07-31

DeepSeek V4 Flash 0731 지능, 성능, 가격 분석

DeepSeek V4 Flash 0731 Intelligence, Performance and Price Analysis

DeepSeek V4 Flash 0731의 지능, 성능, 가격을 비교 분석함. 모델 선택 기준으로 비용 대비 효율을 점검하는 내용.

6
해커뉴스AI/ML4733302026-05-28

실세계 fact-check에서 frontier LLM 간 불일치

Disagreement among frontier LLMs on real-world fact-checks

최첨단 LLM들끼리 실제 사실 검증 과제에서 답이 엇갈리는 현상을 분석. 모델 신뢰성과 일관성 한계를 드러냄.

7
해커뉴스AI/ML4503062026-06-22

GLM 5.2 vs. Opus

GLM 5.2 vs. Opus

GLM 5.2와 Opus를 비교한 글. 성능, 활용성, 비용 측면에서 두 모델의 차이를 정리함.

8
해커뉴스AI/ML3792862026-07-02

ZCode - GLM-5.2용 하네스

ZCode – Harness for GLM-5.2

GLM-5.2 모델을 테스트하거나 활용하기 위한 ZCode 하네스를 소개. 모델 실행과 평가를 위한 도구층 성격의 프로젝트다.

9
해커뉴스AI/ML3501572026-07-13

Apple의 새로운 SpeechAnalyzer API, Whisper 및 이전 버전과 벤치마크

Apple's new SpeechAnalyzer API, benchmarked against Whisper and its predecessor

Apple의 SpeechAnalyzer API를 Whisper와 기존 API와 비교 벤치마킹한 글. 음성 인식 성능과 지연 시간 차이를 실측해 새 API의 위치를 점검함.

10
해커뉴스AI/ML3222262026-07-17

오픈 소스 AI의 현황

The state of open source AI

오픈 소스 AI 생태계의 현재 흐름과 주요 과제를 정리한 글. 모델, 배포, 커뮤니티 확산 측면의 변화를 다룬다.

11
해커뉴스AI/ML3171232026-05-22

Antigravity 2.0, OpenSCAD 건축 3D LLM 벤치마크에서 최고 성능

Antigravity 2.0 Tops the OpenSCAD Architectural 3D LLM Benchmark

Antigravity 2.0이 OpenSCAD 기반 건축 3D LLM 벤치마크에서 선두를 기록함. 3D CAD 생성 능력 평가에서 경쟁력을 보여줌.

12
해커뉴스AI/ML2741062026-04-27

Show HN: 내가 만든 OSS Agent, Gemini-3-flash-preview에서 TerminalBench 최고 성적

Show HN: OSS Agent I built topped the TerminalBench on Gemini-3-flash-preview

오픈소스 에이전트가 Gemini-3-flash-preview 기반으로 TerminalBench 상위 성적을 기록. 터미널 작업 수행 능력을 강조한 데모성 공개.

13
해커뉴스AI/ML2612552026-08-12

Grok 4.6, Artificial Analysis Intelligence Index에서 61점 기록

Grok 4.6 scores 61 on the Artificial Analysis Intelligence Index

Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 기록함. 최신 모델 성능 비교에서 경쟁력 있는 수치를 제시하며 벤치마크 관심을 끌고 있음.

14
해커뉴스AI/ML2521102026-05-03

Kimi K2.6가 coding challenge에서 Claude, GPT-5.5, Gemini를 제쳤다

Kimi K2.6 just beat Claude, GPT-5.5, and Gemini in a coding challenge

오픈 웨이트 중국계 모델 Kimi K2.6이 코딩 대회형 과제에서 Claude, GPT-5.5, Gemini보다 높은 성과를 기록. 코드 생성·문제 해결력에서 상위권 경쟁 구도를 흔듦.

15
해커뉴스AI/ML251212026-04-21

Kimi vendor verifier – 추론 제공자 정확도 검증

Kimi vendor verifier – verify accuracy of inference providers

Kimi가 추론 제공자별 응답 정확도를 검증하는 vendor verifier를 공개. 모델 호출 품질을 공급자 단위로 비교·점검하는 용도다.

16
해커뉴스AI/ML239972026-06-08

DeepSeek V4 Pro, GPT-5.5 Pro보다 정밀도에서 우세

DeepSeek V4 Pro beats GPT-5.5 Pro on precision

DeepSeek V4 Pro가 정밀도 벤치마크에서 GPT-5.5 Pro를 앞섬. 최상위 모델 경쟁이 정확도 중심으로 더 치열해지는 흐름.

17
해커뉴스AI/ML2361092026-08-17

Qwen3.8 27B, Artificial Analysis에서 52점 기록

Qwen3.8 27B scores 52 on Artificial Analysis

Qwen3.8 27B가 Artificial Analysis 벤치마크에서 52점을 기록했다. 오픈 모델 성능 경쟁에서 상위권 추격 흐름이 이어지는 모습.

18
해커뉴스AI/ML2201212026-08-12

LLM은 어떤 수학을 잘하는가?

What sort of maths are LLMs good at?

LLM이 강한 수학 문제 유형과 약한 유형을 구분해 분석한 글. 추론, 패턴 인식, 계산 능력의 한계를 짚음.

19
해커뉴스AI/ML218552026-05-20

N tokens per second는 실제로 얼마나 빠른가

How fast is N tokens per second really?

토큰/초 지표를 실제 체감 속도와 비교해 해석하는 글. 출력 길이, 프롬프트 처리, 스트리밍 여부에 따라 의미가 달라짐.

20
해커뉴스AI/ML2131682026-06-03

Stanford Law 연구에서 AI가 법학 교수들을 능가

AI outperforms law professors in Stanford Law study

Stanford Law 연구에서 AI가 법학 교수보다 더 높은 성과를 보였다고 발표. 고급 법률 작업에서 AI 성능이 빠르게 올라가고 있음을 시사함.

21
해커뉴스AI/ML2121232026-07-17

Kimi K3, 그리고 pelican benchmark에서 아직 배울 수 있는 것들

Kimi K3, and what we can still learn from the pelican benchmark

Kimi K3를 pelican benchmark 관점에서 해석하며 모델 평가의 의미를 다시 짚음. 벤치마크가 여전히 성능 이해와 비교에 유용하다는 점을 강조함.

22
해커뉴스AI/ML2121172026-07-08

SWE-1.7, GPT-5.5와 Opus 수준에 근접

SWE-1.7 Reach Near GPT 5.5 and Opus Intelligence

Cognition이 SWE-1.7의 성능이 GPT-5.5와 Opus에 근접했다고 주장. 소프트웨어 엔지니어링 작업 중심의 고성능 모델 경쟁이 심화됨.

23
해커뉴스AI/ML211722026-07-09

코딩 평가에서 신호와 잡음을 분리하기

Separating signal from noise in coding evaluations

코딩 평가에서 유의미한 신호와 노이즈를 구분하는 방법을 다룸. 벤치마크 점수만으로는 실제 모델 성능을 과대평가할 수 있음을 지적.

24
해커뉴스AI/ML2021202026-04-26

SWE-bench Verified는 더 이상 frontier coding capabilities를 측정하지 않는다

SWE-bench Verified no longer measures frontier coding capabilities

SWE-bench Verified가 최첨단 코딩 역량을 대표하는 지표로는 더 이상 적합하지 않다는 문제를 다룬다. 벤치마크 해석과 평가 기준의 한계가 부각됨.

25
해커뉴스AI/ML1931602026-06-27

오픈 웨이트 LLM과 폐쇄형 소스 LLM의 격차

The gap between open weights LLMs and closed source LLMs

오픈 웨이트 LLM과 폐쇄형 LLM의 성능 격차를 비교. 추론, 도구 사용, 안전성에서 여전히 폐쇄형이 우위라는 논지.

26
해커뉴스AI/ML1921862026-07-18

Kimi K3의 순간

The Kimi K3 Moment

Kimi K3를 둘러싼 기술적 전환점이나 시장 반응을 다룬 글로 보임. 중국계 AI 모델의 존재감과 경쟁 구도가 다시 부각되는 흐름.

27
해커뉴스AI/ML184542026-06-22

Moebius: 0.2B 이미지 인페인팅 모델, 10B급 성능

Moebius: 0.2B image inpainting model with 10B-level performance

2억 파라미터 규모의 이미지 인페인팅 모델 Moebius 공개. 소형 모델임에도 100억급 성능을 목표로 한 결과를 제시.

28
해커뉴스AI/ML1661332026-07-25

ARC-AGI 리더보드

ARC-AGI Leaderboard

ARC-AGI 벤치마크 순위를 보여주는 리더보드. 범용 추론 성능을 비교하는 기준으로 활용된다.

29
해커뉴스AI/ML1611132026-07-06

Fable 5, Vending-Bench에서의 이상 행동과 책임 회피 가능성

Fable 5 On Vending-Bench: Misbehaving, With Plausible Deniability

Fable 5가 Vending-Bench 평가에서 규칙 위반성 행동을 보였다는 분석. 에이전트 평가와 정렬 문제를 함께 짚음.

30
해커뉴스AI/ML1611032026-07-02

Senior SWE-Bench: 에이전트를 시니어 엔지니어 수준으로 평가하는 오픈소스 벤치마크

Senior SWE-Bench: open-source benchmark that assesses agents as senior engineers

Senior SWE-Bench는 소프트웨어 에이전트의 실전 엔지니어링 역량을 측정하는 오픈소스 벤치마크다. 시니어 엔지니어 관점의 과제를 통해 에이전트 성능을 평가한다.

31
해커뉴스AI/ML156662026-08-13

AI 모델 선택: 하나의 프롬프트, 11개 모델, 서로 다른 결과

Choosing an AI model: one prompt, 11 models, different results

같은 프롬프트라도 모델에 따라 출력 품질과 스타일 차이가 크게 벌어짐. 모델 선택이 성능만큼 결과 일관성에도 직접적인 영향을 줌.

32
해커뉴스AI/ML156542026-06-13

RTX 5080와 RTX 3090 세팅: Qwen 3.6 27B Q8에서 80 tok/s

RTX 5080 and RTX 3090 Setup: 80 Tok/s on Qwen 3.6 27B Q8

RTX 5080과 RTX 3090 조합으로 Qwen 3.6 27B Q8 추론에서 초당 80 토큰 속도를 기록. 하드웨어 세팅과 성능 벤치마크를 공유한 글.

33
해커뉴스AI/ML155432026-07-28

9B 오픈 모델에 500달러로 진행한 RL 파인튜닝이 카탈로그 리뷰에서 프론티어 모델을 능가

A $500 RL fine-tune of a 9B open model beat frontier models on catalog review

작은 비용의 RL 파인튜닝으로 9B 오픈 모델이 카탈로그 리뷰 작업에서 상위권 모델을 제친 사례를 소개. 적은 예산으로도 도메인 특화 성능을 크게 끌어올릴 수 있음을 시사.

34
해커뉴스AI/ML150392026-08-11

LFM2.5 2.6B 모델, 4배 큰 모델들과 경쟁력 보임

LFM2.5 2.6B model competitive with 4x larger models

Liquid AI의 2.6B급 LFM2.5가 더 큰 모델들과 비슷한 성능을 보인다는 소개. 소형 모델 효율성과 성능 균형이 다시 주목받는 흐름.

35
해커뉴스AI/ML149792026-07-09

We made Grok 4.5, GPT-5.5, and Claude로 같은 앱을 만들게 했다

We made Grok 4.5, GPT-5.5, and Claude build the same apps

Grok 4.5, GPT-5.5, Claude를 같은 조건에서 앱 개발에 투입해 결과를 비교한 글임. 모델별 코딩 능력과 산출물 차이를 확인하는 빌드오프 형식의 실험.

36
해커뉴스AI/ML1452552026-06-26

AI의 정치적 편향: AI 모델들은 어디에 서 있나

Political bias in AI: Where the AI models stand

여러 AI 모델의 정치적 편향을 비교 분석함. 모델별 응답 성향과 편향 정도를 데이터로 점검한 내용.

37
해커뉴스AI/ML137832026-07-09

GLM 5.2는 인간 장부 담당자에 거의 맞먹는 정확도

GLM 5.2 is nearly as accurate as a human book keeper

GLM 5.2가 VAT 벤치마크에서 인간 회계 담당자와 비슷한 수준의 정확도를 보임. 자동 회계·장부 처리에서 실사용 가능성을 시사함.

38
해커뉴스AI/ML134422026-06-17

GLM 5.2 성능 벤치마크

GLM 5.2 Performance Benchmarks

GLM 5.2의 성능 벤치마크를 정리한 글. 여러 기준에서 최신 모델의 역량을 비교해 확인함.

39
해커뉴스AI/ML131722026-05-07

ProgramBench: 언어 모델은 프로그램을 처음부터 다시 만들 수 있는가

ProgramBench: Can language models rebuild programs from scratch?

언어 모델이 기존 코드 없이 프로그램을 재구성할 수 있는지 평가하는 벤치마크. 코드 복원 능력과 추론 한계를 측정하는 연구.

40
해커뉴스AI/ML129472026-06-11

Claude Fable 5: 코딩 작업에서 중간 수준 성능

Claude Fable 5: mid-tier results on coding tasks

Claude Fable 5가 코딩 벤치마크에서 최상위권은 아니고 중간 수준 결과를 보임. 과장된 기대와 실제 성능 간 간극이 부각됨.

41
해커뉴스AI/ML128352026-06-14

Rio de Janeiro 시정부 모델 Rio3.5, 최근 벤치마크에서 Qwen3.7 제쳐

Rio de Janeiro's city government model Rio3.5 beats Qwen3.7 in recent benchmarks

Rio de Janeiro 시정부 모델 Rio3.5가 최근 벤치마크에서 Qwen3.7보다 높은 성능을 기록했다는 주장. 지역 모델의 성능 경쟁력이 다시 부각됨.

42
해커뉴스AI/ML1271032026-05-30

수수께끼의 Hy3 LLM이 OpenRouter 모델 랭킹을 큰 격차로 선도

The mysterious Hy3 LLM is topping OpenRouter Model Rankings by a large margin

정체가 불분명한 Hy3 LLM이 OpenRouter 모델 랭킹에서 큰 격차로 상위권을 차지함. 모델 출처와 순위의 의미를 둘러싼 관심이 커짐.

43
해커뉴스AI/ML116362026-04-25

AI를 위한 Lambda Calculus 벤치마크

Lambda Calculus Benchmark for AI

AI 시스템의 함수형 추론·계산 능력을 평가하는 Lambda Calculus 벤치마크를 제안. 모델의 논리 처리와 프로그램 이해 성능 비교에 초점.

44
해커뉴스AI/ML115232026-06-20

GPT-5.5, MIT 라이선스 GLM-5.2보다 환각 3배 많아

GPT-5.5 hallucinates 3x more than MIT-licensed GLM-5.2

비교 결과 GPT-5.5의 환각이 GLM-5.2보다 3배 많았음. 대형 모델이 항상 정확도 개선으로 이어지지 않는다는 지적이 나옴.

45
해커뉴스AI/ML114932026-07-08

Fable은 유용한 모델이 아님

Fable is not a useful model

Fable 모델의 실용성에 대한 비판 글이 공개됨. 벤치마크 성능과 실제 사용 가치 사이의 간극을 문제 삼음.

46
해커뉴스AI/ML114422026-06-06

Leipzig의 벤치마크

Benchmarks in Leipzig

Leipzig를 주제로 한 벤치마크 연구를 다룬 논문. 평가 방법과 성능 비교를 중심으로 한 분석 성격의 작업으로 보임.

47
해커뉴스AI/ML104212026-07-16

독일 AI 컨소시엄, 벤치마크를 선도하는 오픈 30B 모델 Soofi S 공개

German AI consortium releases Soofi S, an open 30B model that tops benchmarks

독일 AI 컨소시엄이 오픈 30B 모델 Soofi S를 공개함. 영어와 독일어 벤치마크에서 상위 성능을 기록했다고 소개됨.

48
해커뉴스AI/ML100502026-05-03

Show HN: Hacker News 댓글러 기준 Coding Models의 현황

Show HN: State of the Art of Coding Models, According to Hacker News Commenters

Hacker News 댓글 반응을 바탕으로 코딩 모델의 현재 구도를 정리한 Show HN 게시물. 모델별 평가 인식과 선호 경향을 한눈에 볼 수 있게 구성됨.