검색 결과
"benchmark" · 12개 기사 · Dev/Tools
SlopCodeBench에서 Opus 5 벤치마킹
Benchmarking Opus 5 on SlopCodeBench
SlopCodeBench 기준으로 Opus 5 성능을 평가한 벤치마크 글. 코딩 에이전트용 모델 비교와 실사용 적합성 검증에 초점.
Branchless Quicksort, std::sort와 pdqsort보다 빠른 C 및 C++ API
Branchless Quicksort faster than std:sort and pdqsort with C and C++ API
브랜치 제거 기법을 적용한 Quicksort 구현이 std::sort와 pdqsort보다 빠른 성능을 보임. C와 C++ API를 함께 제공하며 벤치마크 결과를 제시함.
CursorBench 3.1
CursorBench 3.1
CursorBench 3.1이 공개됐다. Cursor 관련 평가 체계를 통해 코드 생성 및 에이전트 성능을 측정하는 데 초점이 맞춰졌다.
코드는 운이 좋으면 빠르다
Your code is fast if you're lucky
코드 성능은 설계뿐 아니라 런타임 환경과 우연한 최적화에 크게 좌우될 수 있다는 문제의식. 빠르다는 평가는 벤치마크와 재현 가능한 검증이 필요함.
Rust 언어의 성능 [pdf
Performance of Rust Language [pdf]
] Rust 언어의 성능 특성을 다룬 발표 자료. 실행 효율과 메모리 안전성의 균형을 중심으로 설명함.
정수를 10진수 문자열로 2나노초 이내에 변환하기
Converting an Integer to a Decimal String in Under Two Nanoseconds
정수를 10진수 문자열로 바꾸는 초고속 변환 기법을 다룬 연구. 2나노초 미만 지연을 목표로 문자열 변환 경로를 최적화함.
Claude Code(~100시간) vs. Codex(~20시간) 비교
Claude Code(~100시간) vs. Codex(~20시간) 비교
14년 경력 시니어 엔지니어가 8만 줄 규모 Python/TypeScript 프로젝트에서 Claude Code와 Codex를 실전 비교. 장시간 작업 기준의 생산성과 사용 경험 차이를 정리한 사례.
쓸모없는 if로 코드 성능 4배 높이기
쓸모없는 if로 코드 성능 4배 높이기
도메인 특화 압축기 최적 인코딩 루프에 조건문 하나를 추가해 벤치마크 시간을 320µs에서 80µs로 단축함. 반복 간 메모리 주소 의존성을 줄여 CPU의 명령어 수준 병렬성을 더 잘 활용한 사례임.
코드 청결도는 코딩 에이전트에 영향을 미치는가? 통제된 최소쌍 연구
코드 청결도는 코딩 에이전트에 영향을 미치는가? 통제된 최소쌍 연구
아키텍처와 동작은 같고 코드 청결도만 다른 최소쌍을 만들어 자율 코딩 에이전트의 성능 차이를 측정함. 코드 품질이 탐색과 수정 비용에 영향을 주는지 분리해 평가한 연구임.
Show GN: UmLang(엄랭)으로 피카츄 배구 만들기와 엄랭 성능 공개
Show GN: Umlang(엄랭)으로 피카츄 배구 만들기 + 피카츄 배구 테스트 환경으로 엄랭 성능 공개
41시간 만에 UmLang으로 피카츄 배구를 구현한 사례를 소개함. 난해한 언어에서 Codex가 얼마나 잘 작동하는지 테스트 환경과 함께 성능을 공개함.
CPU를 정말 화나게 만드는 데이터 접근 패턴
CPU를 정말 화나게 만드는 데이터 접근 패턴
같은 합산 루프라도 데이터 접근 순서에 따라 실행 시간이 크게 달라짐. 선형 접근은 빠르지만 무작위 접근은 CPU 예측을 깨뜨려 사이클 수가 크게 늘어남.
whichllm - 내 하드웨어에서 실제로 돌아가고 최고 성능을 내는 로컬 LLM 찾기
whichllm - 내 하드웨어에서 실제로 돌아가고 최고 성능을 내는 로컬 LLM 찾기
하드웨어를 자동 감지해 실측 벤치마크 기준으로 로컬 LLM을 추천하는 CLI 도구. NVIDIA, AMD, Apple Silicon, CPU-only까지 지원해 사용 가능한 모델을 랭킹으로 제시.