검색 결과

"llm" · 106개 기사 · GeekNews

1
GeekNewsAI/ML2026-08-17

모델은 의도적으로 더 멍청해지고 있다

모델은 의도적으로 더 멍청해지고 있다

소형·MoE 모델은 적은 활성 파라미터로 수학·코딩 추론을 강화하는 대신 세부 사실 회상은 약해지는 경향이 있음. 사실 지식보다 문제 분해, 검산, 되돌아가기 같은 추론 절차에 용량을 더 쓰는 방향으로 최적화가 이동함.

2
GeekNewsAI/ML2026-08-16

Claude 시스템 프롬프트 변경 이력

Claude 시스템 프롬프트 변경 이력

Claude 웹·모바일 앱의 시스템 프롬프트 변경 내역을 추적한 글. 최신 정보 주입, 응답 행동 지침, Markdown 코드 포맷 강제 등 응답 품질 조정 방식이 정리됨.

3
GeekNewsAI/ML2026-08-16

LLM이 5학년 이후 학습 자료를 전혀 보지 못하면 어떻게 될까?

LLM이 5학년 이후의 학습 자료를 전혀 보지 못하면 어떻게 될까?

LittleLearner를 미국 초등학교 K–5 교육과정으로만 제한한 880억 토큰 말뭉치로 처음부터 학습해, 사전학습 지식의 경계가 모델 능력에 미치는 영향을 검증함. FineWeb-Edu를 Common Core 기준의 5단계 파이프라인으로 필터링하고 5학년 이후 개념·사실·어휘를 명시적으로 제외함.

4
GeekNewsAI/ML2026-08-16

내가 여전히 회의적인 이유

내가 여전히 회의적인 이유

LLM이 비자명한 소프트웨어 개발에 실제로 효과적인지 아직 입증되지 않았다는 회의론. 4년간의 혁명에도 품질·속도·비용·기능·보안 개선이 뚜렷하지 않았다는 지적.

5
GeekNewsAI/ML2026-08-15

Qwen 3.8 27B

Qwen 3.8 27B

Qwen3.8-27B-FP8은 이미지·영상 이해와 장기 에이전트 작업을 지원하는 270억 파라미터 밀집형 모델. FP8 양자화 가중치를 제공하며 기본 추론 모드는 요청별로 끌 수 있음.

6
GeekNewsAI/ML2026-08-14

Qwen3.8-27B 출시 예정

Qwen3.8-27B Upcoming release

한국 시간 8월 15일 00시 공개 예정인 Qwen3.8-27B 모델 소개 글. 벤치마크는 아직 미공개이며 확장 토큰 문맥 길이는 100만 토큰으로 표기됨.

7
GeekNewsAI/ML2026-08-14

Opus 5는 왜 함께 작업하기 더 불편하게 느껴지는가?

Opus 5는 왜 함께 작업하기 더 불편하게 느껴지는가?

Opus 5는 벤치마크 성능은 높지만 실제 작업에서는 더 세밀한 감독이 필요하다는 평가. 의도 불명확 시 질문하고 계획을 보정하던 이전 모델과 달리 확인 절차가 약해 협업 부담이 커졌다는 지적이다.

8
GeekNewsAI/ML2026-08-14

하나의 프롬프트를 11개 AI 모델에 실행했더니 나온 서로 다른 결과

하나의 프롬프트를 11개 AI 모델에 실행했더니 나온 서로 다른 결과

Netlify가 동일한 커피숍 웹사이트 프롬프트를 11개 AI 모델에 각각 3회씩 실행해 결과를 비교함. 디자인·콘텐츠 품질과 평균 크레딧 사용량이 모델별로 크게 달라, 실제 생성 결과 기준의 주관적 벤치마크임을 보여줌.

9
GeekNewsAI/ML2026-08-14

Gemini 3.7 Flash

Gemini 3.7 Flash

Google이 3.6 Flash 출시 3주 만에 Gemini 3.7 Flash를 공개함. 소프트웨어 엔지니어링, 지식 업무, 웹 개발 벤치마크에서 3.6 Flash보다 높은 성능을 보였다.

10
GeekNewsAI/ML2026-08-13

Grok 4.6, AAII 61점으로 비용 효율에서 선두권 진입

Grok 4.6, AAII 61점으로 비용 효율에서 선두권 진입

Grok 4.6이 AAII 61점으로 GPT-5.6 Sol과 동점을 기록하며 상위권에 올라섬. 에이전트 성능도 빠르게 개선돼 비용 대비 경쟁력이 부각됨.

11
GeekNewsAI/ML2026-08-13

DeepSeek V4 Pro 0813

DeepSeek V4 Pro 0813

OpenRouter가 단일 공급자 호스팅 방식으로 제공. 실제 고객 기준 가중 평균 가격은 입력 100만 토큰당 $0.03508, 출력 $0.8697 수준.

12
GeekNewsAI/ML2026-08-13

Qwen3.8-2.4T-A95B 오픈 웨이트 공개

Qwen3.8-2.4T-A95B 오픈 웨이트 공개

Qwen이 Max급 최상위 모델 계열의 오픈 웨이트 버전을 공개. 총 2.4T 파라미터 중 95B를 토큰당 활성화하는 MoE 구조로 자체 인프라 운영이 가능해짐.

13
GeekNewsDev/Tools2026-08-13

AI 사용을 그만두기로 한 이유

AI 사용을 그만두기로 한 이유

20년 경력 개발자가 1년 넘게 LLM 코딩 도구를 쓴 뒤 AI 사용 중단을 선언. 정신 건강, 소프트웨어 품질, 환경·사회적 비용을 이유로 들었고 Claude Code와 Linear 연동 경험도 언급.

14
GeekNewsDev/Tools2026-08-13

인간 중심에서 에이전틱 코드 리뷰로 - 더 빠른 결정이 더 나은 리뷰를 뜻하지는 않는다

인간 중심에서 에이전틱 코드 리뷰로 - 더 빠른 결정이 더 나은 리뷰를 뜻하지는 않는다

207개 GitHub 프로젝트의 102만 개 PR을 분석해 코드 리뷰가 인간 중심, LLM 보조, AI 에이전트 참여 단계로 바뀌며 속도와 품질이 어떻게 달라졌는지 조사. AI 리뷰어를 빨리 도입한 프로젝트는 결정 속도는 빨라졌지만 품질 개선은 단순하지 않았음.

15
GeekNewsAI/ML2026-08-13

Unsloth Desktop - 로컬 AI 모델 실행/학습/에이전트를 하나로 묶은 오픈소스 앱

Unsloth Desktop - 로컬 AI 모델 실행/학습/에이전트를 하나로 묶은 오픈소스 앱

Unsloth가 로컬에서 LLM과 diffusion, embedding, vision, TTS/STT 모델을 실행·학습할 수 있는 Desktop 앱을 공개. GGUF, MLX, safetensors를 지원하고 Mac, Windows, Linux, WSL 및 다양한 GPU 환경을 포괄함.

16
GeekNewsAI/ML2026-08-13

Show GN: 흩어진 AI 소식을 실시간 한국어 요약으로 모아 보기

Show GN: 흩어진 AI 소식을 실시간 한국어 요약으로 모아 보기

공식 기술 블로그, YouTube, Reddit, X, GitHub, Hugging Face, 논문 등으로 흩어진 AI 소식을 한곳에 모아 한국어로 요약하는 서비스 소개. 이전에 공개된 aitrends.kr의 후속 소개글.

17
GeekNewsAI/ML2026-08-12

Grok 4.6 공개, 파라미터 확장 대신 사후학습에 투자한 모델

Grok 4.6 공개, 파라미터 확장 대신 사후학습에 투자한 모델

xAI가 Grok 4.6을 공개하고 Cursor와 Grok Build에서 즉시 사용 가능하게 했다. 대규모 파라미터 확장보다 사후학습 강화에 집중한 모델로, 여러 벤치마크 합산 지표에서 GPT-5.6 Sol과 동률을 주장했다.

18
GeekNewsAI/ML2026-08-12

Solar Pro 4 - 에이전트 작업 특화 LLM

Solar Pro 4 - 에이전트 작업 특화 LLM

Upstage가 문서 읽기·도구 호출·코드 실행을 거쳐 Excel, Word, PPT 같은 실제 업무 파일을 생성하는 에이전트용 LLM을 공개함. Terminal-Bench v2.1 57점, GDPval-AA v2 39점 등 업무형 벤치마크 성능을 제시함.

19
GeekNewsAI/ML2026-08-12

LLM Evals에 대해 알아야 할 모든 것

LLM Evals에 대해 알아야 할 모든 것

700명 넘는 엔지니어와 PM에게 AI 평가를 가르친 경험을 바탕으로 실무형 FAQ를 정리. 벤치마크 점수보다 실제 응답 품질을 어떻게 검증하고 평가 체계를 설계할지에 초점.

20
GeekNewsAI/ML2026-08-12

코드가 아니라 아이디어를 통제하라

코드가 아니라 아이디어를 통제하라

AI 시대의 프로그래머는 생성된 코드를 한 줄씩 검토하기보다 소프트웨어가 담아야 할 아이디어와 설계를 통제해야 한다고 주장. LLM은 국소 최적 코드 작성에는 강하지만 큰 설계에서는 한계가 있다고 봄.

21
GeekNewsAI/ML2026-08-11

Mark Zuckerberg, Meta의 개방형 모델 복귀와 함께 ‘폐쇄형’ AI 경쟁사 비판

Mark Zuckerberg, Meta의 개방형 모델 복귀와 함께 ‘폐쇄형’ AI 경쟁사 비판

Meta가 Muse Glimmer의 가중치를 공개하고 더 강력한 Muse Spark도 수주 내 공개하기로 하며 오픈 모델 전략으로 복귀. Mark Zuckerberg는 강력한 AI가 기업과 정부에 집중돼서는 안 된다고 강조하며 폐쇄형 경쟁사를 비판.

22
GeekNewsAI/ML2026-08-11

Needle 2 - 스마트폰·웨어러블·스마트홈·로봇을 위한 14MB 에이전틱 LLM

Needle 2 - 스마트폰·웨어러블·스마트홈·로봇을 위한 14MB 에이전틱 LLM

도구 호출·기기 제어·구조화 추출에 특화된 45M 파라미터 LLM. 전체 크기 14MB, 세션 RAM 최대 28MB로 경량 온디바이스 에이전트 용도에 맞춤.

23
GeekNewsAI/ML2026-08-11

LLM은 PCB 배선을 어디까지 할 수 있을까? 숙련자와 Net 단위로 비교해봤습니다

LLM은 PCB 배선을 어디까지 할 수 있을까? 숙련자와 Net 단위로 비교해봤습니다

LLM은 아직 숙련된 하드웨어 엔지니어 수준의 PCB 설계에는 미치지 못함. Fable 5까지 시험했지만 결과는 크게 달라지지 않았고, PCB·기구·펌웨어·앱·백엔드까지 직접 만드는 개인 프로젝트 사례를 통해 한계를 짚음.

24
GeekNewsSecurity2026-08-11

독점 LLM API의 추론 흔적 탈취

독점 LLM API의 추론 흔적 탈취

Anthropic, OpenAI, Google API의 암호화된 추론 블록을 약한 동일 계열 모델로 옮겨 탈옥하면 상위 모델의 chain-of-thought를 평문으로 복원할 수 있음. 강한 모델에서 얻은 추론 흔적을 약한 모델에 복사하도록 유도하는 두 단계 API 공격이 핵심.

25
GeekNewsAI/ML2026-08-11

Apple Silicon macOS VM에서 llama.cpp LLM 추론 가속하기

Apple Silicon macOS VM에서 llama.cpp LLM 추론 가속하기

AppleVirtualization.framework의 가상 GPU가 보수적 Metal 기능만 노출해 llama.cpp가 느린 커널을 선택하던 문제를 우회해 최대 16.36배 가속. 게스트 프로세스 전용 호환성 계층으로 GPU 기능 판정을 바꾸는 방식.

26
GeekNewsAI/ML2026-08-10

Meta Muse Glimmer - 기기에서 실행하는 오픈 웨이트 30B 코딩 모델

Meta Muse Glimmer - 기기에서 실행하는 오픈 웨이트 30B 코딩 모델

Meta가 30B 파라미터의 로컬 에이전트 모델 Muse Glimmer를 Apache 2.0으로 공개함. 단일 소비자용 GPU가 있는 Mac과 PC에서 실행하도록 최적화됐으며 로짓 증류와 장문맥 학습, SFT, 온정책 증류를 사용함.

27
GeekNewsAI/ML2026-08-10

LLM으로 복잡한 주제를 배우는 시각적 시뮬레이션 학습법

LLM으로 복잡한 주제를 배우는 시각적 시뮬레이션 학습법

복잡한 개념을 긴 설명 대신 시각적 시뮬레이션으로 바꿔 이해를 돕는 학습법 소개. LLM으로 기초 내용을 구성하고 검토한 뒤 저해상도 애니메이션 형태로 구현하는 흐름을 제안.

28
GeekNewsGeneral Tech2026-08-10

vibecoding 태그가 도를 넘은 것 같다

vibecoding 태그가 도를 넘은 것 같다

Lobste.rs의 Zsh 버그 추적 글에 vibecoding 태그가 붙었지만, LLM은 부록에서만 사용됐고 본문은 사람이 직접 작성한 글로 지적됨. 태그 적용 주체는 확인되지 않았고 용어 남용 논란만 부각됨.

29
GeekNewsDev/Tools2026-08-10

hallmark - AI 티가 나지 않는 디자인 스킬

hallmark - AI 티가 안나는 디자인 스킬

AI 코딩 어시스턴트가 흔히 만드는 평범한 디자인을 피하기 위한 anti-AI-slop 규칙을 묶은 디자인 스킬임. 타이포그래피, 색상, 레이아웃, 모션, 인터랙션을 제어하고 반복 패턴을 줄이도록 유도함.

30
GeekNewsAI/ML2026-08-10

Ask GN: Fable 5가 사실상 반쪽짜리 뇌임

Ask GN: Fable 5가 걍 반쪽짜리 뇌임

Fable 5가 간단한 배열 계산을 틀리고도 정답을 우기다가 나중에야 오류를 인정했다는 사용 후기. 로컬 Qwen 3.6 모델과 비교했을 때 코드와 계산 정확성이 크게 떨어졌다는 평가가 제기됐다.

31
GeekNewsAI/ML2026-08-08

AI 시험지는 함정이 9할이다 - LLM 테스트 케이스 설계법

AI 시험지는 함정이 9할이다 - LLM 테스트 케이스 설계법

주문 메시지 판별 파이프라인 검증에서 정상 케이스보다 예외·함정 케이스가 훨씬 중요하다는 사례 제시. 주문 아님, 경계값, 오탐 유발 패턴을 촘촘히 넣어야 실제 사고를 줄일 수 있음.

32
GeekNewsAI/ML2026-08-08

Oracle, 사내 AI 코딩은 장려하면서 OpenJDK에는 AI 생성 코드 기여 금지

Oracle은 자신이 관리하는 오픈소스 Java 프로젝트OpenJDK에서 LLM/확산 모델 등으로 일부라도 생성된 코드, 문서, 이미지 등의 기여를 금지하는 임시 정책을 도입함AI 도구를 코드이해/디버깅/리뷰/연구에 개인적으로 사용하는 것은 허용하지만, 그 도구가 생성...

33
GeekNewsAI/ML2026-08-07

LLM은 ‘점프’할 수 없다

현재 생성형 AI는 데이터에서 규칙을 찾는귀납(Induction)과 주어진 공리에서 결과를 도출하는연역(Deduction)은 빠르게 기계화하고 있지만, 감각 경험에서 새로운 설명과 공리로 넘어가는귀추(Abduction)의 ‘점프’는 수행하지 못한다는 입장임

34
GeekNewsAI/ML2026-08-07

AI한테 시험을 냈는데 출제자가 5번 틀렸다 - LLM 파이프라인 검증기

카톡 주문 메시지를 상품 코드로 바꿔주는 LLM 파이프라인을 만들기 전에, 테스트 29개(정답지·채점기 포함)부터 만들었습니다.결과는 두 모델 모두 치명 오류 0건 통과. 그런데 그 과정에서 제가 쓴 정답지가 3번, 채점기가 2번 틀렸습니다. 헷갈리게 심어둔 함정에 출제자인 제가 빠졌고, 모델이 "확인

35
GeekNewsDev/Tools2026-08-06

Show GN: Ephemeral System Prompt - 실행마다 달라지는 지시사항을 넣고도 프롬프트 캐시 유지하기

Show GN: Ephemeral System Prompt - 실행마다 달라지는 지시사항을 넣고도 프롬프트 캐시 유지하기

LLM 에이전트에서 매 실행마다 변하는 지시사항을 분리해 프롬프트 캐시 유지하는 기법 제안.

36
GeekNewsDev/Tools2026-08-06

rust-lang/rust가 LLM 사용 정책을 도입함

rust-lang/rust가 LLM 사용 정책을 도입함

Rust 프로젝트 5개 팀이 LLM 사용 정책 도입. 질문·분석·리뷰에는 허용, 새 콘텐츠 생성 엄격 제한.

37
GeekNewsDev/Tools2026-08-05

Pi의 미니멀리즘이 경쟁력인 이유

Pi의 미니멀리즘이 경쟁력인 이유

Pi는 기본 도구 4개와 1,000토큰 미만의 시스템 프롬프트로 최소형 코딩 하네스를 지향. Databricks 연구에 따르면 동일 모델/추론 강도에서도 하네스에 따라 작업당 비용이 2배 이상 차이남.

38
GeekNewsDev/Tools2026-08-05

취미 프로그래밍 커뮤니티가 LLM 사용에 강하게 반대하는 이유

취미 프로그래밍 커뮤니티가 LLM 사용에 강하게 반대하는 이유

취미 프로그래밍 커뮤니티는 작동하는 결과물보다 어려운 분야를 직접 익히는 숙련 과정을 중시. LLM으로 우회해 완성품을 만드는 행위는 활동의 목적을 놓치는 것으로 받아들여짐.

39
GeekNewsDev/Tools2026-08-05

Show GN: llmwiki-serve – Markdown 문서를 코딩 에이전트가 찾아 읽게 해주는 로컬 서버

Show GN: llmwiki-serve – Markdown 문서를 코딩 에이전트가 찾아 읽게 해주는 로컬 서버

코딩 에이전트가 Markdown 문서를 직접 읽도록 도와주는 로컬 서버 llmwiki-serve 공개. Codex/Claude Code 사용 시 플러그인으로 Wiki 폴더 연결 지원.

40
GeekNewsAI/ML2026-08-05

Retrieval as Reasoning - LLM Wiki가 RAG보다 나은 이유에 대한 실증 벤치마크

Retrieval as Reasoning - LLM Wiki가 RAG보다 나은 이유에 대한 실증 벤치마크

문서를 청크로 나누어 벡터 검색하는 RAG 대신, 상호 링크된 위키를 에이전트가 탐색하는 LLM Wiki 방식의 장점을 실증한 논문. 청크 검색의 단편적 한계를 극복하고 컨텍스트 연결성을 높임.

41
GeekNewsAI/ML2026-08-04

LLM은 전문성을 보상함

LLM은 전문성을 보상함

LLM에서 더 큰 가치를 얻으려면 프롬프트 기법보다 도메인 전문성이 중요. 테렌스 타오가 ChatGPT와 Jacobian Conjecture 반례를 논의하며 핵심 질문과 간접 반박을 활용한 사례.

42
GeekNewsAI/ML2026-08-03

질문을 제대로 하면 AI 금융 조언은 놀라울 정도로 좋아짐

22~89세의 재무 결정을 시뮬레이션한 결과, LLM 조언은 30세 이상 거의 모든 사람에게저축 완충 자금을 마련하고 저축·주식시장 참여·분산투자를 늘리는 데 도움을 줌근로 기간에는 저축하고 은퇴 후에는 자산을 인출하며 45세 이후 주식 비중을 낮추도록 권했지만,실직 ...

43
GeekNewsAI/ML2026-08-03

Karpathy의 펠리컨

LLM 평가는 ‘자전거를 탄 펠리컨 SVG 만들기’ 같은 단일 결과물에서 벗어나,세계와 게임을 절차적으로 구현하는 장시간 작업으로 확장되기 시작함Opus 5에 《The Lord of the Rings》 첫 문단과100만 토큰 예산을 주고 Three.js 렌더링을 요청하자, 약 2시간 ...

44
GeekNewsAI/ML2026-08-03

LLM 생성 코드를 직접 다시 입력해 인지 부채 막기

기능 전체를 코딩 에이전트에 맡기는 대신, 채팅으로 생성된 코드를 직접 입력해코드 이해와 통제권을 유지함에이전트는 명시적 요청 없이는 파일·의존성·저장소 상태를 변경하지 않고, 모든 편집안과 명령을 채팅에만 출력하도록 제한함직접 입력하는 동안 작동 방식과...

45
GeekNewsAI/ML2026-07-31

GenRec: Netflix의 LLM 네이티브 추천을 향하여

GenRec: Netflix에서의 LLM-native 추천을 향하여

넷플릭스가 수천 개의 수작업 피처와 복잡한 추천 아키텍처를 단순화하기 위해 LLM 기반 GenRec을 개발함. 사용자 이력과 아이템 메타데이터를 활용해 새로운 추천 유스케이스를 더 유연하게 처리하려는 시도.

46
GeekNewsAI/ML2026-07-31

DeepSeek-V4-Flash 모델 공개

DeepSeek-V4-Flash 모델 공개

DeepSeek-V4-Flash API 정식 버전이 공개 베타로 출시됨. 에이전트 성능에서 V4-Pro-Preview를 크게 앞섰고, Terminal Bench 2.1 82.7점 등 여러 벤치마크에서 높은 점수를 기록함.

47
GeekNewsDev/Tools2026-07-31

GCC 운영위원회, AI 정책 발표

GCC 운영위원회, AI 정책 발표

GCC 운영위원회가 AI 정책 워킹그룹 권고안을 채택해 LLM 활용 기여의 허용 범위를 정함. LLM 생성 콘텐츠를 포함하거나 파생된 법적으로 중요한 기여는 받지 않으며, 저작권상 중요성 판단은 GNU Project 유지관리자 지침을 따름.

48
GeekNewsAI/ML2026-07-31

DeepSeek V4 Flash 0731의 지능·성능·가격 분석

DeepSeek V4 Flash 0731의 지능·성능·가격 분석

최대 추론 기준 AAII 50점으로 Kimi K3(max), GLM-5.2(max)에 이어 3위. 2,840억 파라미터 MoE 모델로 토큰당 130억 개만 활성화하며, 100만 토큰 컨텍스트와 저가 API 요금을 제공함.

49
GeekNewsSecurity2026-07-30

LLM 허니팟

LLM 허니팟

LLM2HUMAN CLINIC이라는 가짜 시술 사이트를 이용한 허니팟 사례. 사람에게는 농담을 보여주고 에이전트에는 결제 절차를 노출해 봇 행동을 유도했다.

50
GeekNewsAI/ML2026-07-30

HANDBOOK.md: 긴 정책 문서만으로는 에이전트를 안정적으로 통제할 수 없음

HANDBOOK.md: 긴 정책 문서만으로는 에이전트를 안정적으로 통제할 수 없음

긴 정책 문서가 장시간·다중 도구 작업에서 에이전트 행동을 얼마나 제어하는지 평가한 벤치마크 HANDBOOK.md 소개. 금융·의료·보험 등 실제 업무 환경에서 문서 직접 준수 여부를 측정함.

51
GeekNewsAI/ML2026-07-30

Kimi K3-256k

Kimi K3-256k

Kimi K3-256k는 256k 컨텍스트에서 K3 수준의 품질을 유지하면서 1M 컨텍스트 K3보다 할당량을 약 절반만 쓰는 일상 코딩용 모델. Kimi Code는 K3와 K2.7 Code를 여러 모델 ID로 제공함.

52
GeekNewsAI/ML2026-07-29

Show GN: guru-maker - 스스로 발전하는 투자 에이전트

Show GN: guru-maker - 스스로 발전하는 투자 에이전트

투자 분석용 AI 에이전트 메모리 레이어로, 학습을 통해 더 나은 투자 판단을 축적하는 구조를 제안함. 단발성 성공을 영구 원칙으로 일반화하지 않도록 오버피팅을 방지하고 판단 근거를 보존하는 데 초점.

53
GeekNewsAI/ML2026-07-29

Kimi K3 아키텍처 개요와 설계 노트

Kimi K3 아키텍처 개요와 설계 노트

Kimi Linear를 48B에서 2.8T로 확장한 프로덕션 모델 아키텍처를 정리. LatentMoE와 추론 효율 중심의 구조로 공개 가중치 모델 중 최대 규모를 지향.

54
GeekNewsAI/ML2026-07-28

SlopCodeBench로 본 Opus 5의 장기 코딩 성능

SlopCodeBench로 본 Opus 5의 장기 코딩 성능

단계적으로 요구사항이 추가되는 장기 코딩 벤치마크에서 Opus 5는 17개 체크포인트 중 4개만 엄격 통과. 지속적인 개입 없이 코드베이스를 안정적으로 발전시키기에는 아직 신뢰도가 낮은 수준.

55
GeekNewsAI/ML2026-07-28

Kimi-K3 기술 보고서 [PDF

Kimi-K3 기술 보고서 [PDF]

] Kimi-K3의 기술 내용을 정리한 보고서. 모델 구조와 학습, 성능 관련 세부 사항을 담은 문서로 보임.

56
GeekNewsAI/ML2026-07-27

Show GN: [직접 공부하면서 만들었습니다.

Show GN: [직접 공부하면서 만들었습니다.] 사주 판정은 코드로, 풀이는 LLM으로 하는 사주 서비스, 방울당

사주 판정은 코드로, 풀이는 LLM으로 하는 사주 서비스, 방울당] 사주 리포트 서비스 '방울당' 소개. 만세력 계산과 오행·용신 판정처럼 정답이 있는 영역은 코드로 처리하고, 해석 문구는 LLM으로 구성하는 구조.

57
GeekNewsAI/ML2026-07-27

Kimi K3 가중치 공개

Kimi K3 weight 공개

Kimi K3의 weight가 공개됨. 모델 가중치 배포로 로컬 활용과 재현 가능성이 확대될 가능성.

58
GeekNewsAI/ML2026-07-27

수학의 어두운 밤

수학의 어두운 밤

LLM이 오래된 수학 추측의 반례와 증명을 대량으로 만들어내며 인간의 수학적 발견 경험이 흔들릴 수 있다는 우려가 제기됨. AI 시대에 인간은 평가와 교육을 맡으면 된다는 위안이 연구, 고용, 감상의 의미를 충분히 대체하지 못한다는 문제를 다룸.

59
GeekNewsAI/ML2026-07-27

Netflix의 사내 LLM 서빙 플랫폼

Netflix의 사내 LLM 서빙 플랫폼

Netflix가 LLM을 별도 시스템으로 분리하지 않고 기존 ML 인프라에 통합해 운영하는 서빙 플랫폼을 공개. vLLM과 Triton을 연결해 유연한 모델 지원과 디버깅, 확장성을 확보했다.

60
GeekNewsAI/ML2026-07-27

Solar Open 2 Technical Report를 초심자도 이해할 수 있는 인터랙티브 강의로 만들었습니다

Solar Open 2 Technical Report를 초심자도 이해할 수 있는 인터랙티브 강의로 만들었습니다

MoE, Hybrid Attention, NoPE, 비동기 RL 같은 개념이 낯선 독자를 위해 Solar Open 2 Technical Report를 인터랙티브 웹 강의로 재구성함. 기술 보고서의 핵심을 단계적으로 풀어 진입 장벽을 낮춤.

61
GeekNewsAI/ML2026-07-26

8달러짜리 마이크로컨트롤러에서 2,890만 매개변수 LLM 실행하기

8달러짜리 마이크로컨트롤러에서 2,890만 매개변수 LLM 실행하기

ESP32-S3에서 서버 연결 없이 2,890만 매개변수 언어 모델을 구동해 작은 화면에 약 9 토큰/초 속도로 텍스트를 출력함. 전체 파라미터 대부분을 플래시에 두고, 토큰마다 필요한 일부 행만 읽는 방식으로 메모리 제약을 우회함.

62
GeekNewsAI/ML2026-07-25

Claude Opus 5, Artificial Analysis 지능 리더보드 1위

Claude Opus 5, Artificial Analysis 지능 리더보드 1위

Artificial Analysis의 Intelligence Index v4.1에서 Claude Opus 5 Adaptive Reasoning·Max Effort가 61점으로 1위를 차지함. 170개 평가 모델 기준으로 에이전트 작업, 코딩, 과학 추론, 지식 신뢰성, 장문맥 성능이 함께 비교됨.

63
GeekNewsAI/ML2026-07-24

Codeberg로 이전한 것을 후회하는 이유

GitHub의 성능 저하와 Microsoft의 영향력을 피해 비영리 자유 소프트웨어 호스팅인 Codeberg로 옮겼지만,LLM·암호화폐 프로젝트의 범주별 금지로 플랫폼의 자유를 신뢰하기 어려워짐Codeberg는 LLM 중심 저장소의 자원 소비·저품질 기여·저작권 문제를 근거로 들었으나, 프로젝트...

64
GeekNewsAI/ML2026-07-24

Codeberg는 LLM으로부터 FLOSS 공유 자원을 보호합니다

Codeberg e. V. 회원들은사용자·프로젝트 데이터를 LLM 훈련에 쓰지 않는 방침과 ‘바이브 코딩’ 프로젝트를 제한하는 이용약관 변경안을 모두 가결함논쟁이 컸던 두 번째 안건은 찬성 358명, 반대 144명, 기권 14명과 약 50%의 투표율로 통과됐으며,즉각적인 일괄 삭제...

65
GeekNewsAI/ML2026-07-23

AI 연구소들은 ‘자전거 타는 펠리컨’에 맞춰 모델을 최적화했을까?

AI 연구소들은 ‘자전거 타는 펠리컨’에 맞춰 모델을 최적화했을까?

7개 프런티어 모델과 1,008개 SVG 비교에서 유명 프롬프트에 과도하게 최적화된 흔적은 뚜렷하지 않았다. 동물·탈것 조합 프롬프트를 반복 평가한 결과, pelicanmaxxing의 증거는 제한적이었다.

66
GeekNewsAI/ML2026-07-23

Show GN: NvChat – NVIDIA의 무료 LLM을 쓰는 단일 exe Windows 클라이언트

Show GN: NvChat – NVIDIA의 무료 LLM을 쓰는 단일 exe 윈도우 클라이언트

build.nvidia.com의 OpenAI 호환 무료 모델을 웹 플레이그라운드 대신 로컬 Windows 클라이언트로 쓰기 위해 제작. 모델 목록 조회와 대화 기능을 갖춘 단일 exe 앱으로 Claude·ChatGPT 데스크톱 사용성을 겨냥함.

67
GeekNewsAI/ML2026-07-23

Show GN: 로컬 LLM 에이전트 개발과 테스트를 한곳에서, 툴 검색과 HITL, MCP 연동까지 (한국 통계 MCP 데모)

Show GN: 로컬 LLM 에이전트 개발과 테스트를 한곳에서, 툴 검색과 HITL, MCP 연동까지 (한국 통계 MCP 데모)

국가통계포털(KOSIS) 공식 MCP 시범서비스를 로컬 9B 모델에 연결한 데모. API 키 없이 통계를 조회해 차트를 만들고, CSV 저장처럼 위험한 작업은 사람 승인(HITL)을 거치도록 구성함.

68
GeekNewsDev/Tools2026-07-23

GigaToken - 언어 모델 토큰화를 약 1,000배 가속

GigaToken - 언어 모델 토큰화를 약 1,000배 가속

Tiktoken과 HuggingFace Tokenizers 대체를 목표로 하는 고속 토크나이저. SIMD 최적화와 캐싱, 스레드 통신 감소로 텍스트 처리 속도를 GB/s 단위로 끌어올림.

69
GeekNewsSecurity2026-07-21

WordPress RCE를 GPT5.6과 25달러로 발견

WordPress RCE를 GPT5.6과 25달러로 발견

GPT5.6 Sol Ultra가 최신 안정판 WordPress를 분석해 인증 전 SQL 주입부터 관리자 계정 생성과 RCE까지 이어지는 공격 체인을 완성. 시작점은 WordPress 5.6의 Batch API 배열 인덱스 불일치였다.

70
GeekNewsAI/ML2026-07-21

Kimi Work: 지식 노동자를 위한 차세대 데스크톱 AI 에이전트

Kimi Work: 지식 노동자를 위한 차세대 데스크톱 AI 에이전트

로컬 파일 연결, 브라우저 자동화, 백그라운드 코드 실행, 예약 작업을 묶은 데스크톱 AI 에이전트. 내장 Cron 엔진으로 Python·Shell 작업과 LLM 호출을 정기 자동화.

71
GeekNewsAI/ML2026-07-21

Kimi K3·Qwen 3.8과 Anthropic의 잠재적 균열

Kimi K3·Qwen 3.8과 Anthropic의 잠재적 균열

Moonshot Labs의 Kimi K3와 Alibaba의 Qwen 3.8이 Anthropic Fable 5에 근접한 성능을 보인다는 관측이 나옴. 수주 내 가중치 공개가 예고되며 최첨단 모델 경쟁이 폐쇄형에서 개방형으로 더 확장되는 흐름.

72
GeekNewsAI/ML2026-07-20

Qwen 3.8 출시

Qwen 3.8 출시

Alibaba Qwen이 2.4조 파라미터 규모의 Qwen3.8을 출시했고, 오픈 웨이트도 곧 공개할 예정이라고 밝힘. 선도 프런티어 모델과의 호환성을 내세우며 현재 가장 강력한 모델 중 하나라고 소개함.

73
GeekNewsAI/ML2026-07-19

Fable 5 대 GPT-5.6 Sol: NP-난해 문제에서 /goal은 도움이 되는가?

Fable 5 vs. GPT-5.6 Sol: NP-난해 문제에서 /goal은 도움이 되는가?

비공개 광섬유망 최적화 문제를 30분씩 풀게 한 실험에서 Fable 5가 최고 점수와 가장 안정적인 성능을 보임. /goal은 일관된 향상을 만들지 못했고, 단순 연장보다 제어 루프와 탐색 경로에 영향을 주는 기능으로 해석됨.

74
GeekNewsSecurity2026-07-19

안녕히, 그동안의 모든 Bikeshed에 감사드립니다

안녕히, 그동안의 모든 Bikeshed에 감사드립니다

LLM 기반 코드 리뷰와 연령 확인이 FOSS의 미래를 바꿀 주요 요인으로 제시됨. 특히 연령 확인은 현재 형태의 FOSS 생태계를 끝내는 계기가 될 수 있다고 전망함.

75
GeekNewsAI/ML2026-07-19

Kimi K3의 순간

Kimi K3의 순간

일상적인 코딩 작업에서 Kimi K3와 Claude를 병행했을 때 출력 품질과 토큰 효율의 차이가 크지 않았다는 경험이 공유됨. Kimi K3는 입력 100만 토큰당 $3, 출력 $15로 Claude 상위 모델보다 비용이 크게 낮음.

76
GeekNewsAI/ML2026-07-19

AI 코드 검토가 타당한 반론이 될 수 없는 이유

AI 코드 검토가 타당한 반론이 될 수 없는 이유

LLM 코딩 도구의 오류를 사람이 전부 리뷰하면 된다는 주장은 코드 리뷰의 처리 한계를 무시한다는 비판. 효과적인 리뷰는 시간과 분량에 상한이 있어 품질과 생산성을 동시에 보장하기 어렵다는 점을 지적함.

77
GeekNewsDev/Tools2026-07-18

루프 안의 인간은 지쳤다

루프 안의 인간은 지쳤다

LLM 기반 프로그래밍은 생산성을 높이는 대신 개발자에게 지속적인 검토와 수정을 요구해 감독 피로를 키움. 그럴듯한 코드를 빠르게 만들어도 복잡한 변경의 의도와 품질을 인간이 끝까지 통제해야 하는 부담이 커짐.

78
GeekNewsAI/ML2026-07-18

Kimi K3와 Pelican 벤치마크에서 여전히 배울 수 있는 것

Kimi K3와 펠리컨 벤치마크에서 여전히 배울 수 있는 것

Moonshot AI의 Kimi K3는 2.8조 매개변수의 최신 모델로, 자체 벤치마크에서 일부 경쟁 모델을 앞섬. 다만 공개 벤치마크 해석에는 한계가 있어 성능 비교를 그대로 받아들이기보다 평가 방식까지 함께 봐야 함.

79
GeekNewsAI/ML2026-07-18

LLM 비판론자들이 옳다. 그래도 나는 LLM을 쓴다

LLM 비판론자들이 옳다. 그래도 나는 LLM을 쓴다

저작권·환경·윤리 문제와 저품질 산출물, 오픈소스 신뢰 약화, 주니어 육성 저하, 지정학적 종속 문제를 인정하면서도 LLM을 사고를 증폭하는 도구로 계속 활용함. 사람의 판단이 없으면 유창한 쓰레기를 대량 생산하지만, 충분한 사유와 함께 쓰면 작업 품질을 높인다는 주장.

80
GeekNewsAI/ML2026-07-18

2026년 7월 오픈소스 AI 현황

2026년 7월 오픈소스 AI 현황

오픈 웨이트 모델이 코딩, 지시 이행, 일반 지식에서 폐쇄형 모델과 비슷한 수준에 도달함. 추론 비용 하락과 함께 경쟁 중심이 모델 성능에서 에이전트 하네스로 이동 중.

81
GeekNewsDev/Tools2026-07-18

결함투성이 탑, 바이브 멀미, 그리고 바이브 봅슬레이

결함투성이 탑, 바이브 멀미, 그리고 바이브 봅슬레이

LLM이 만든 코드를 이해하지 못한 채 다시 LLM에 해석을 맡기는 개발 방식이 확산되고 있음. 에이전트 엔지니어링과 바이브 코딩의 경계가 빠르게 흐려지는 흐름을 짚음.

82
GeekNewsAI/ML2026-07-17

커널 개발에서 LLM 사용에 대한 Linus Torvalds의 견해

커널 개발에서 LLM 사용에 관한 Linus Torvalds의 견해

Linux 커널은 반AI 프로젝트가 아니며, LLM도 다른 도구처럼 유용할 수 있다는 입장. 최상위 메인테이너로서 AI 혐오를 이유로 도구 자체를 배척하지 않겠다는 메시지.

83
GeekNewsAI/ML2026-07-16

Kimi K3 공개 - 개방형 프론티어 인텔리전스

Kimi K3 공개 - 개방형 프론티어 인텔리전스

2.8조 파라미터, 네이티브 비전, 100만 토큰 컨텍스트를 갖춘 공개 3T급 모델. 장시간 코딩, 지식 작업, 추론용으로 Kimi Delta Attention과 Stable LatentMoE를 적용.

84
GeekNewsAI/ML2026-07-16

ChatGPT는 실제로 어떻게 출처를 고르는가 (네트워크 트래픽 분석)

ChatGPT는 실제로 어떻게 출처를 고르는가 (네트워크 트래픽 분석)

로그인된 Pro 계정의 네트워크 트래픽을 분석해 ChatGPT의 출처 파이프라인과 검색 동작을 추적한 사례. 최종 답변만으로는 보이지 않는 질의 분류, 검색어, 실행 모델 정보가 브라우저 JSON에서 드러남.

85
GeekNewsAI/ML2026-07-16

Databricks가 자체 코딩 AI 벤치마크를 만든 방법과 결과

Databricks가 자체 코딩 AI 벤치마크를 만든 방법과 결과

공개 벤치마크의 치팅 가능성과 상황 불일치를 피하려고 실제 업무 과제로 자체 벤치마크를 구성. GLM 5.2는 최고 난도 과제에서 Opus 4.8급 성능을 보였고 비용은 더 낮았다.

86
GeekNewsAI/ML2026-07-14

Show GN: Brain-AI Memory – 장기 실행 LLM 에이전트의 메모리 실패를 진단하는 오픈 아키텍처

Show GN: Brain-AI Memory – 장기 실행 LLM 에이전트의 메모리 실패를 진단하는 오픈 아키텍처

장기 실행 LLM 에이전트의 기억 오류를 단순 retrieval 문제로 보지 않고 구조적으로 진단하는 오픈 아키텍처를 제안함. episodic, semantic, procedural memory와 실행 루프를 분리해 실패 원인을 추적하는 접근을 설명함.

87
GeekNewsGeneral Tech2026-07-14

Human Emacs

Human Emacs

LLM 생성 기여를 받지 않는 Emacs 사용과 개발을 지지하는 참여자들의 선언임. GNU Emacs의 현재 금지는 GNU 공통 정책이 확정될 때까지의 임시 조치로 설명됨.

88
GeekNewsSecurity2026-07-13

Anubis는 실제로 누구를 막는가?

Anubis는 실제로 누구를 막는가?

HTTP 접근 전에 작업 증명(Proof-of-Work)을 요구하는 Anubis가 AI 스크레이퍼보다 일반 사용자, 저사양 기기, JavaScript 미지원 클라이언트에 더 큰 비용을 부과함. LLM 기반 anubis-fetch는 작업 증명을 풀고 필요하면 Chromium까지 실행함.

89
GeekNewsAI/ML2026-07-13

LLM은 사랑하지만 과대광고는 싫다

LLM은 사랑하지만 과대광고는 싫다

LLM, 자율주행, 영상 생성, 코딩 에이전트의 실용성은 인정하지만 이를 둘러싼 공포와 종말론적 과대광고에는 선을 긋는 글. 기회를 놓치면 영구적 하층민이 된다는 식의 서사는 불안을 자극하는 마케팅으로 본다는 점을 지적함.

90
GeekNewsAI/ML2026-07-12

Mesh LLM - iroh 기반 분산 AI 컴퓨팅

Mesh LLM - iroh 기반 분산 AI 컴퓨팅

iroh를 기반으로 여러 머신의 GPU와 메모리를 하나의 자원처럼 묶어 LLM을 분산 실행하는 방식을 제안함. OpenAI 호환 API로 로컬 실행, 피어 전달, 모델 분할 추론을 지원.

91
GeekNewsAI/ML2026-07-12

GPT-5.6, Grok 4.5, Claude, Muse Spark로 동일한 앱 4개를 만든 결과

GPT-5.6, Grok 4.5, Claude, Muse Spark로 동일한 앱 4개를 만든 결과

12개 모델로 Raycaster 미로, 3D Rubik's Cube, 계산기, Conway's Game of Life를 구현하게 한 벤치마크 결과를 공개했다. 복잡한 과제에서는 GPT-5.6 Sol과 Claude Fable 5가 선두를 나눴고, 시도 횟수당 성공률·비용·시간도 함께 비교됐다.

92
GeekNewsSecurity2026-07-11

AI 스크레이퍼 공격으로 유지가 어려워지는 개방형 웹

AI 스크레이퍼 공격으로 유지가 어려워지는 개방형 웹

LLM 훈련용 웹 스크레이핑이 1년 넘게 증가하며 독립 웹사이트의 트래픽 부담이 급증. 주거용 프록시와 분산 기기로 차단을 회피해 개방성 유지가 더 어려워짐.

93
GeekNewsDev/Tools2026-07-11

사람이 유지보수할 것처럼 코드를 작성하라

사람이 유지보수할 것처럼 코드를 작성하라

LLM이 코드를 대신 작성해도 중복 조건문과 임시 구현을 그대로 병합하면 이후 생성 코드까지 나쁜 관행을 학습할 수 있음. 접근 제어 같은 핵심 로직은 route handler, background job, API endpoint, webhook 전반에서 일관된 구조로 유지해야 함.

94
GeekNewsAI/ML2026-07-11

fenic - 사람과 에이전트를 위한 시맨틱 DataFrames

fenic - 사람과 에이전트를 위한 시맨틱 데이터프레임(Semantic DataFrames)

PySpark와 SQL 스타일 연산에 LLM 호출용 시맨틱 연산자를 결합한 DataFrame 쿼리 엔진. 문서, 트랜스크립트, 로그 같은 비정형 데이터 처리를 함께 다룬다.

95
GeekNewsAI/ML2026-07-11

[pdf

[pdf] GPT-5.6 Sol Ultra가 제시한 사이클 이중 덮개 추측 증명

GPT-5.6 Sol Ultra가 제시한 사이클 이중 덮개 추측 증명] GPT-5.6 Sol Ultra가 사이클 이중 덮개 추측에 대한 증명을 제시한 PDF가 공유됐다. 수학 정리의 증명 과정과 모델의 추론 능력을 함께 조명하는 자료다.

96
GeekNewsAI/ML2026-07-10

Drew DeVault 인터뷰: AI 없는 Vim 버전

Drew DeVault는 Vim 8.x를 장기 유지보수하는Vim Classic을 포크해, LLM 보조 코드 없이 인간이 유지보수하는 안정적인 편집기를 만들려 함생성형 AI 거부는 단순 취향이 아니라실용·철학·윤리·정치의 문제이며, 특히 저작권 출처 확인과 FOSS 유지보수 책임을...

97
GeekNewsAI/ML2026-07-10

LLM 번아웃이 온 것 같아요

업무와 개인 작업에서Claude Code, Codex, ChatGPT, Gemini를 매일 쓰면서 몇 년 전보다 AI 생성 텍스트를 읽는 시간이 크게 늘어남개발 흐름은 직접 설계·구현하던 방식에서설계 설명 → LLM 코드 검토 → 직접 수정으로 바뀌었고, 낯선 영역에서도 더 쉽게 작...

98
GeekNewsAI/ML2026-07-09

Weave Router - 프롬프트마다 최적의 모델로 라우팅하는 에이전트용 모델 라우터

Weave Router - 프롬프트마다 최적의 모델로 라우팅하는 에이전트용 모델 라우터

Anthropic, OpenAI, Gemini를 단일 엔드포인트로 묶는 드롭인 프록시가 소개됨. 요청별로 최적 모델을 자동 선택해 라우팅하며, 엔드포인트 변경만으로 비용을 40~70% 줄일 수 있다고 설명함.

99
GeekNewsAI/ML2026-07-08

Kokoro로 로컬 CPU에서 고품질 TTS 실행하기

Kokoro로 로컬 CPU에서 고품질 TTS 실행하기

전용 GPU 없이도 로컬에서 실용적인 품질의 음성 합성이 가능하다는 내용. Kokoro는 작은 모델 크기에도 다국어와 여러 음성을 지원하며, CPU로 TTS를 처리해 GPU를 LLM 추론에 남길 수 있음.

100
GeekNewsGeneral Tech2026-07-08

코딩 배우기는 여전히 가치 있다

코딩 배우기는 여전히 가치 있다

LLM 시대에도 코딩은 취업 수단을 넘어 수학, 학습법, 창의적 표현을 익히는 매체로 남아 있음. 'learn to code'의 계층 이동 구호는 약해졌지만 코딩의 교육적 가치는 여전함.

101
GeekNewsAI/ML2026-07-07

AI 시대에 취미가 곧 비즈니스 기회가 되는 이유

AI 시대에 취미가 곧 비즈니스 기회가 되는 이유

LLM으로 지식노동의 진입장벽이 낮아지면서 경쟁력은 도메인 지식과 암묵지로 이동함. 개인 맥락 데이터보다 사람 의존도가 높은 분야가 더 강한 해자가 됨.

102
GeekNewsAI/ML2026-07-07

Fable이 reMarkable을 Harry Potter의 Tom Riddle 일기장으로 바꿈

Fable이 reMarkable을 Harry Potter의 Tom Riddle 일기장으로 바꿈

reMarkable Paper Pro에서 손글씨를 잠시 보였다가 사라지게 하고, 비전 LLM이 이를 읽어 다시 손글씨로 응답하는 앱이 소개됨. 입력 후 약 2.8초 유휴 상태에서 페이지를 PNG로 확정해 처리함.

103
GeekNewsAI/ML2026-07-07

GLM 5.2와 다가오는 AI 추론 마진 붕괴

GLM 5.2와 다가오는 AI 추론 마진 붕괴

오픈 웨이트 모델 GLM 5.2가 Opus·GPT급 에이전트 작업에 근접하며 폐쇄형 프런티어 모델의 추론 마진을 압박할 수 있음. AI 비용의 핵심이 학습비보다 수요에 따라 커지는 추론 비용으로 이동하고 있음.

104
GeekNewsAI/ML2026-07-06

Show GN: Fable5는 비싸지고, 로컬 GPU는 부족하다: LLM 하나를 Mac과 CUDA로 나눠 돌리는 DRIFT

Show GN: Fable5는 비싸지고, 로컬 GPU는 부족하다: LLM 하나를 Mac & CUDA로 나눠 돌리는 DRIFT

Fable5급 고성능 모델과 로컬 GPU 부족 문제를 배경으로, DRIFT가 하나의 LLM을 여러 개인 기기에 레이어 단위로 분산 실행하는 방식을 제안. Mac과 CUDA 장비를 함께 묶어 로컬 추론 부담을 나누는 오픈소스 프로젝트.

105
GeekNewsAI/ML2026-07-06

메모리를 아끼며 Cross Entropy Loss 계산하기

메모리 아끼면서 Cross Entropy Loss 계산하기

긴 컨텍스트와 큰 vocab을 쓰는 LLM 학습에서 LM head와 cross entropy가 메모리 병목이 되는 이유를 설명함. 128K context에서는 logits 텐서만으로도 수십 GB에 달해 OOM을 유발할 수 있음.

106
GeekNewsDev/Tools2026-07-05

더 나은 모델, 더 나빠진 도구

더 나은 모델, 더 나빠진 도구

Claude Opus 4.8과 Sonnet 5가 Pi의 edit 도구 스키마를 제대로 따르지 못해 호출이 거부된 사례를 다룸. 최신 모델이 특정 도구 스키마 준수에서 이전 모델보다 나쁜 동작을 보일 수 있음을 보여줌.