검색 결과
"benchmark" · 6개 기사 · GeekNews · Dev/Tools
Claude Code(~100시간) vs. Codex(~20시간) 비교
Claude Code(~100시간) vs. Codex(~20시간) 비교
14년 경력 시니어 엔지니어가 8만 줄 규모 Python/TypeScript 프로젝트에서 Claude Code와 Codex를 실전 비교. 장시간 작업 기준의 생산성과 사용 경험 차이를 정리한 사례.
쓸모없는 if로 코드 성능 4배 높이기
쓸모없는 if로 코드 성능 4배 높이기
도메인 특화 압축기 최적 인코딩 루프에 조건문 하나를 추가해 벤치마크 시간을 320µs에서 80µs로 단축함. 반복 간 메모리 주소 의존성을 줄여 CPU의 명령어 수준 병렬성을 더 잘 활용한 사례임.
코드 청결도는 코딩 에이전트에 영향을 미치는가? 통제된 최소쌍 연구
코드 청결도는 코딩 에이전트에 영향을 미치는가? 통제된 최소쌍 연구
아키텍처와 동작은 같고 코드 청결도만 다른 최소쌍을 만들어 자율 코딩 에이전트의 성능 차이를 측정함. 코드 품질이 탐색과 수정 비용에 영향을 주는지 분리해 평가한 연구임.
Show GN: UmLang(엄랭)으로 피카츄 배구 만들기와 엄랭 성능 공개
Show GN: Umlang(엄랭)으로 피카츄 배구 만들기 + 피카츄 배구 테스트 환경으로 엄랭 성능 공개
41시간 만에 UmLang으로 피카츄 배구를 구현한 사례를 소개함. 난해한 언어에서 Codex가 얼마나 잘 작동하는지 테스트 환경과 함께 성능을 공개함.
CPU를 정말 화나게 만드는 데이터 접근 패턴
CPU를 정말 화나게 만드는 데이터 접근 패턴
같은 합산 루프라도 데이터 접근 순서에 따라 실행 시간이 크게 달라짐. 선형 접근은 빠르지만 무작위 접근은 CPU 예측을 깨뜨려 사이클 수가 크게 늘어남.
whichllm - 내 하드웨어에서 실제로 돌아가고 최고 성능을 내는 로컬 LLM 찾기
whichllm - 내 하드웨어에서 실제로 돌아가고 최고 성능을 내는 로컬 LLM 찾기
하드웨어를 자동 감지해 실측 벤치마크 기준으로 로컬 LLM을 추천하는 CLI 도구. NVIDIA, AMD, Apple Silicon, CPU-only까지 지원해 사용 가능한 모델을 랭킹으로 제시.