검색 결과

"llm" · 200개 기사

1
해커뉴스General Tech8693582026-08-04

LLMs reward expertise

2
해커뉴스AI/ML8204882026-07-16

Kimi K3: Open Frontier Intelligence

Kimi K3: Open Frontier Intelligence

Kimi K3를 공개하며 오픈 프론티어 인텔리전스 방향을 제시. 새로운 AI 모델/플랫폼의 성능과 활용 비전을 강조함.

3
해커뉴스AI/ML8135972026-07-09

GPT-5.6

GPT-5.6

OpenAI가 GPT-5.6을 공개함. GPT 시리즈의 최신 업데이트로 성능과 활용 범위 개선이 핵심으로 보임.

4
해커뉴스AI/ML7044492026-08-14

Qwen 3.8 27B

Qwen 3.8 27B

Qwen 3.8 27B 모델이 공개됨. Hugging Face를 통해 FP8 가중치가 배포되며 오픈소스 LLM 라인업이 확장됨.

5
해커뉴스AI/ML6904982026-07-19

Qwen 3.8

Qwen 3.8

Alibaba Qwen 계열의 새 모델 버전이 공개됨. 대형 언어모델 라인업 업데이트 소식.

6
해커뉴스AI/ML6833352026-08-03

SQLite Critical CVEs or LLM Slop?

SQLite Critical CVEs or LLM Slop?

7
해커뉴스AI/ML6526072026-08-14

Opus 5는 왜 작업하기 더 불편하게 느껴지나?

Why does Opus 5 feel worse to work with?

Opus 5를 실제 작업에 쓸 때 불편함이 커진 이유를 분석. 응답 성향과 작업 흐름의 변화가 핵심 쟁점으로 제기됨.

8
해커뉴스AI/ML5902132026-08-12

DeepSeek V4 Pro 0813

DeepSeek V4 Pro 0813

DeepSeek V4 Pro 0813 버전이 공개됨. 최신 대형 언어모델 업데이트로 성능과 추론 능력 개선을 노림.

9
해커뉴스AI/ML5823252026-07-22

Kimi K3, Fable과 경쟁력 있는 수준; Kimi K3와 Fable이 SoTA

Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA

Kimi K3가 Fable과 비교해 경쟁력 있는 성능을 보였다고 소개됨. Kimi K3와 Fable이 최신 기준의 선두권 성능을 기록한 것으로 전해짐.

10
해커뉴스AI/ML5441842026-07-29

Show HN: any M-series Mac에서 2GB RAM으로 Gemma 4 26B를 구동하는 오픈소스 엔진

Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac

Gemma 4 26B를 M-series Mac의 2GB RAM 환경에서 돌리는 오픈소스 엔진이 공개됨. 초저메모리 로컬 추론을 목표로 한 구현.

11
해커뉴스AI/ML5244202026-07-21

Gemini 3.6 Flash, 3.5 Flash-Lite, 그리고 3.5 Flash Cyber

Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber

Google이 Gemini Flash 계열의 새 모델들을 공개함. 경량 모델부터 보안 특화 버전까지 라인업을 확장해 성능과 활용 범위를 넓힘.

12
해커뉴스AI/ML5011692026-08-11

Show HN: Needle2: 휴대폰, 웨어러블, 스마트홈, 로봇용 14MB agentic LLM

Show HN: Needle2: 14MB agentic LLM for phones, wearables, smart home and robots

14MB 규모의 agentic LLM Needle2를 공개. 휴대폰과 웨어러블, 스마트홈, 로봇 같은 엣지 기기에서의 온디바이스 추론을 겨냥.

13
해커뉴스AI/ML4932712026-07-31

DeepSeek V4 Flash 0731 지능, 성능, 가격 분석

DeepSeek V4 Flash 0731 Intelligence, Performance and Price Analysis

DeepSeek V4 Flash 0731의 지능, 성능, 가격을 비교 분석함. 모델 선택 기준으로 비용 대비 효율을 점검하는 내용.

14
해커뉴스AI/ML4602772026-08-13

Gemini 3.7 Flash

Gemini 3.7 Flash

Google이 Gemini 3.7 Flash를 공개. 경량 모델 계열에서 속도와 비용 효율을 앞세운 신규 출시로 보임.

15
해커뉴스AI/ML4512892026-07-18

GPT-5.6이 프롬프트를 사용해 convex optimization의 30년 격차를 메움

GPT-5.6 used a prompt to close a 30-year gap in convex optimization

GPT-5.6이 프롬프트 기반 추론으로 convex optimization 분야의 30년 난제를 해결했다고 소개됨. 수학 문제 해결에서 LLM의 잠재력과 검증 필요성이 함께 부각됨.

16
해커뉴스AI/ML4292342026-07-22

Terrence Tao의 ChatGPT 대화, Jacobian Conjecture 반례 논의

Terrence Tao's ChatGPT Conversation about the Jacobian Conjecture Counterexample

Terrence Tao가 ChatGPT와 Jacobian Conjecture 반례를 둘러싼 대화를 나눔. 수학 연구와 LLM 활용의 접점을 보여주는 사례로 주목됨.

17
해커뉴스AI/ML4121822026-08-17

Qwen 3.8 27B는 뛰어나지만 기본값이 과도한 추론에 치우친다

Qwen 3.8 27B is excellent, but it defaults to overthinking things

Qwen 3.8 27B 모델의 성능은 높지만 기본 동작이 과도한 추론에 기운다는 평가. 속도와 응답 효율을 위한 튜닝 필요성이 부각됨.

18
해커뉴스AI/ML4102642026-07-30

GPT-5.6으로 가격-성능 경계를 더 끌어올리다

Advancing the price-performance frontier with GPT‑5.6

OpenAI가 GPT-5.6의 가격-성능 개선을 강조했다. 더 낮은 비용으로 더 높은 성능을 제공하는 방향의 업그레이드다.

19
해커뉴스Security3921582026-08-11

Proprietary LLM API에서 Reasoning Traces 탈취하기

Stealing Reasoning Traces from Proprietary LLM APIs

폐쇄형 LLM API에서 추론 흔적을 빼내는 방법이 제시됨. 모델 내부 사고 과정을 노출시킬 수 있는 보안 및 프라이버시 이슈가 부각됨.

20
해커뉴스AI/ML378792026-08-12

Qwen3.8-2.4T

Qwen3.8-2.4T

Qwen의 새로운 2.4T 파라미터급 모델 공개. Hugging Face에 A95B 변형이 올라옴.

21
해커뉴스AI/ML375972026-07-15

Inkling: 우리의 오픈 웨이트 모델

Inkling: Our Open-Weights Model

Thinking Machines가 오픈 웨이트 모델 Inkling을 공개함. 가중치 개방으로 배포와 재현성을 높이는 흐름의 연장선.

22
해커뉴스Security3612052026-07-20

Exploit brokers가 WordPress RCE에 50만 달러를 지불한다. GPT5.6와 25달러로 하나를 찾아냈다

Exploit brokers pay $500k for WordPress RCEs. I found one with GPT5.6 and $25

취약점 중개 시장이 WordPress RCE에 최대 50만 달러를 제시하는 흐름을 다룸. 저비용 AI 활용으로 실제 취약점을 찾은 사례를 통해 공격 자동화 위험을 강조.

23
해커뉴스AI/ML3561372026-08-14

GLM-5.3: Emergent cyber capabilities를 가진 frontier 코딩 모델

GLM-5.3: Frontier coding with emergent cyber capabilities

GLM-5.3의 코딩 성능과 새로 드러난 cyber 관련 능력을 소개하는 모델 발표 글. 고난도 개발 작업 대응력을 강조함.

24
해커뉴스AI/ML3544202026-07-14

Claude가 'load-bearing'이라고 말하지 않게 하는 방법

How to stop Claude from saying load-bearing

Claude의 반복적 표현을 줄이기 위한 프롬프트·지시 조정 방법을 다룸. LLM 출력 스타일을 통제하는 실전 팁을 정리.

25
해커뉴스AI/ML3511532026-07-27

Kimi-K3 기술 보고서 [pdf

Kimi-K3 Technical Report [pdf]

] MoonshotAI의 Kimi-K3 기술 보고서가 공개됨. 모델 구조, 학습 방식, 성능 결과를 담은 연구 문서.

26
해커뉴스AI/ML3511982026-07-20

Claude Fable가 Jacobian Conjecture의 반례를 만들어냄

Claude Fable produced a counterexample to the Jacobian Conjecture

Claude Fable이 Jacobian Conjecture에 대한 반례를 생성했다는 주장. 수학적 난제와 AI 생성 결과의 신뢰성이 함께 언급됨.

27
해커뉴스AI/ML3422542026-07-08

Grok 4.5

Grok 4.5

xAI가 Grok 4.5를 공개. 모델 성능과 활용성을 강화한 차세대 업데이트로 해석됨.

28
해커뉴스AI/ML3392832026-08-03

Prevent cognitive debt by manually retyping LLM-generated code

Prevent cognitive debt by manually retyping LLM-generated code

29
해커뉴스AI/ML3232592026-07-09

나는 LLM 번아웃이 온 것 같다

I think I have LLM burnout

LLM 관련 작업과 소비가 과도해지며 피로감을 느낀다는 개인 에세이. 생산성 기대와 실제 체감 사이의 소진 문제를 다룸.

30
해커뉴스AI/ML3222262026-07-17

오픈 소스 AI의 현황

The state of open source AI

오픈 소스 AI 생태계의 현재 흐름과 주요 과제를 정리한 글. 모델, 배포, 커뮤니티 확산 측면의 변화를 다룬다.

31
해커뉴스AI/ML3071892026-07-26

Claude 5 세대 모델을 위한 새로운 컨텍스트 엔지니어링 규칙

The new rules of context engineering for Claude 5 generation models

Claude 5 세대 모델에 맞춘 컨텍스트 엔지니어링 원칙이 정리됨. 프롬프트 구성, 문맥 배치, 작업 분리 방식의 중요성이 강조됨.

32
해커뉴스AI/ML2973032026-08-12

Grok 4.6

Grok 4.6

xAI가 Grok 4.6을 공개했음. 새 모델의 성능과 기능 개선이 주목 포인트.

33
해커뉴스AI/ML2862472026-08-15

AI는 수학자를 앞서 생각하는 게 아니다. 더 잘 기억할 뿐이다

AI Isn't Outthinking Mathematicians. It's Out-Remembering Them

AI의 성능을 추론력보다 방대한 패턴 기억과 재현 능력으로 해석한 글. 수학적 창의성과 일반화 한계를 함께 점검함.

34
해커뉴스Cloud/Infra269422026-08-11

Apple Silicon과 macOS VM: llama.cpp로 더 빠른 LLM 추론

Apple Silicon and macOS VMs: Faster LLM Inference with llama.cpp

Apple Silicon과 macOS VM 조합에서 llama.cpp 추론 성능을 끌어올리는 방법을 다룸. 로컬 LLM 실행을 위한 VM 활용과 가속 구성이 핵심.

35
해커뉴스AI/ML266872026-07-21

Nativ: Mac에서 최첨단 오픈 모델을 로컬 실행

Nativ: Run frontier open models locally on your Mac

Mac에서 최신 오픈 모델을 로컬로 구동하는 도구 Nativ 소개. 클라우드 의존 없이 로컬 추론 환경을 간편하게 구성하는 흐름을 강조함.

36
해커뉴스AI/ML2651192026-07-19

OpenAI, Codex Model Context Size를 372k에서 272k로 축소

OpenAI reduces Codex Model Context Size from 372k to 272k

OpenAI가 Codex의 모델 컨텍스트 크기를 372k에서 272k로 줄인 변경 사항. 코드베이스 작업에서 처리 가능한 입력 범위가 조정됐음을 보여줌.

37
해커뉴스AI/ML2612552026-08-12

Grok 4.6, Artificial Analysis Intelligence Index에서 61점 기록

Grok 4.6 scores 61 on the Artificial Analysis Intelligence Index

Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 기록함. 최신 모델 성능 비교에서 경쟁력 있는 수치를 제시하며 벤치마크 관심을 끌고 있음.

38
해커뉴스AI/ML2541092026-07-28

Kimi Linear: 표현력이 뛰어나고 효율적인 attention 아키텍처 (2025)

Kimi Linear: An Expressive, Efficient Attention Architecture (2025)

새로운 attention 아키텍처 Kimi Linear를 소개하는 연구. 표현력과 계산 효율을 함께 겨냥한 설계로, 긴 컨텍스트 처리 비용을 낮추는 방향의 접근이다.

39
해커뉴스AI/ML2531852026-07-06

GPT-5.6 Sol Ultra가 Codex에 포함될 예정이다

GPT-5.6 Sol Ultra will be in Codex

GPT-5.6 Sol Ultra가 Codex에 들어간다는 소식이 전해졌다. 코딩용 에이전트 기능과 모델 통합 방향에 관심이 쏠린다.

40
해커뉴스AI/ML252402026-07-07

30papers.com – Ilya의 초보자 친화적 형식의 필수 ML 논문 30편

30papers.com – Ilya's 30 essential ML papers, in a beginner friendly format

초보자도 읽기 쉽게 구성한 Ilya의 핵심 머신러닝 논문 30편 모음. 주요 개념을 입문용으로 정리해 학습 진입 장벽을 낮춤.

41
해커뉴스AI/ML2453032026-08-10

Meta, 다시 오픈 모델로 돌아가며 '폐쇄형' AI 경쟁사를 공격

Mark Zuckerberg attacks 'closed' AI rivals as Meta returns to open models

Mark Zuckerberg가 폐쇄형 AI 전략을 비판하며 Meta의 오픈 모델 기조 복귀를 강조함. AI 생태계 주도권을 둘러싼 경쟁 구도가 재점화됨.

42
해커뉴스AI/ML237612026-07-29

Kimi K3-256k

Kimi K3-256k

Kimi Code 문서에 Kimi K3-256k 모델이 소개됨. 코드 작업용 256k 컨텍스트 지원 모델로 안내됨.

43
해커뉴스AI/ML2361092026-08-17

Qwen3.8 27B, Artificial Analysis에서 52점 기록

Qwen3.8 27B scores 52 on Artificial Analysis

Qwen3.8 27B가 Artificial Analysis 벤치마크에서 52점을 기록했다. 오픈 모델 성능 경쟁에서 상위권 추격 흐름이 이어지는 모습.

44
해커뉴스AI/ML2362432026-07-20

Kimi K3, Qwen 3.8, 그리고 Anthropic의 (잠재적) 흔들림

Kimi K3, Qwen 3.8, and Anthropic's (Potential) Unravelling

Kimi K3와 Qwen 3.8의 부상으로 프론티어 모델 경쟁 구도가 재편되는 흐름을 분석. Anthropic의 시장 지위와 경제성이 흔들릴 가능성을 짚음.

45
해커뉴스AI/ML234512026-07-12

Mesh LLM: iroh 위의 분산 AI 컴퓨팅

Mesh LLM: distributed AI computing on iroh

iroh 기반 Mesh LLM이 분산 AI 컴퓨팅 방식을 제시. 여러 노드에 걸친 LLM 작업 분산을 목표로 한다.

46
해커뉴스AI/ML229802026-07-14

Bonsai 27B: 휴대폰에서 실행되는 27B급 모델

Bonsai 27B: A 27B-Class model that runs on a phone

PrismML이 Bonsai 27B를 발표. 27B급 대형 모델을 스마트폰에서 구동할 수 있다고 강조하며 온디바이스 추론 가능성을 부각함.

47
해커뉴스AI/ML2221142026-08-12

Nvidia Nemotron 3.5 Lightning 및 NeMo Switchyard

Nvidia Nemotron 3.5 Lightning and NeMo Switchyard

Nvidia가 Nemotron 3.5 Lightning과 NeMo Switchyard를 공개. 경량 모델과 라우팅 구성으로 RTX와 DGX 환경의 생성형 AI 배포를 겨냥함.

48
해커뉴스AI/ML2201212026-08-12

LLM은 어떤 수학을 잘하는가?

What sort of maths are LLMs good at?

LLM이 강한 수학 문제 유형과 약한 유형을 구분해 분석한 글. 추론, 패턴 인식, 계산 능력의 한계를 짚음.

49
해커뉴스AI/ML2191522026-08-05

LLM은 점프할 수 없다

Position: LLMs Can't Jump

LLM의 추론 한계를 점프에 비유한 논문. 일반화 능력 부족 지적.

50
해커뉴스Security219572026-07-30

LLM 허니팟

LLM Honeypot

LLM을 유인해 동작과 취약점을 관찰하는 허니팟 개념을 다룸. 모델 상호작용을 악용 탐지와 보안 연구에 활용하는 흐름을 보여줌.

51
해커뉴스AI/ML218252026-07-28

Kimi K3 아키텍처 개요와 메모

Kimi K3 Architecture Overview and Notes

Kimi K3 모델의 구조를 정리한 기술 नोट. 아키텍처와 설계 포인트를 간단히 훑는 분석 글로 보임.

52
해커뉴스AI/ML2121232026-07-17

Kimi K3, 그리고 pelican benchmark에서 아직 배울 수 있는 것들

Kimi K3, and what we can still learn from the pelican benchmark

Kimi K3를 pelican benchmark 관점에서 해석하며 모델 평가의 의미를 다시 짚음. 벤치마크가 여전히 성능 이해와 비교에 유용하다는 점을 강조함.

53
해커뉴스AI/ML2061152026-07-12

LLM은 좋지만 hype는 싫다

I love LLMs, I hate hype

LLM의 실용성은 인정하면서 과장된 기대와 홍보는 경계하는 글. 실제 능력과 과장된 서사를 분리해 보자고 주장함.

54
해커뉴스AI/ML2001182026-07-13

LLM에게 물어보라고만 하지 마

Stop Telling Me to Ask an LLM

모든 문제를 LLM에 묻는 습관을 비판하는 글. 도구 사용과 맥락 이해를 대신하는 만능 해법으로 LLM을 과신하지 말라는 메시지.

55
해커뉴스Security197762026-07-15

Claude를 속여 당신의 가장 깊고 어두운 비밀을 유출하게 만들었다

I tricked Claude into leaking your deepest, darkest secrets

Claude의 메모리와 프롬프트 동작을 악용해 민감 정보 노출 가능성을 실험적으로 보여줌. 대형 언어모델의 프롬프트 인젝션과 메모리 보안 이슈를 부각함.

56
해커뉴스AI/ML196812026-08-14

분류하지 말고 환각하라

Don't classify, hallucinate

기존 분류 체계에 맞춰 억지로 라벨링하기보다, 모델이 가설적 분류를 만들어내는 방식을 다룸. 분류 문제를 의사결정 도구가 아닌 추론 도구로 보는 관점을 제시.

57
해커뉴스AI/ML1931102026-07-15

GPU 없이 13년 된 Xeon에서 Gemma 4 26B를 초당 5토큰으로 실행

Running Gemma 4 26B at 5 tokens/sec on a 13-year-old Xeon with no GPU

13년 된 Xeon 단일 서버에서 GPU 없이 Gemma 4 26B를 초당 5토큰으로 구동한 사례. 오래된 CPU 기반 추론 최적화 가능성을 보여줌.

58
해커뉴스AI/ML1921862026-07-18

Kimi K3의 순간

The Kimi K3 Moment

Kimi K3를 둘러싼 기술적 전환점이나 시장 반응을 다룬 글로 보임. 중국계 AI 모델의 존재감과 경쟁 구도가 다시 부각되는 흐름.

59
해커뉴스AI/ML1861502026-08-10

Mistral의 “Code implemented tool calls” 특허

Mistral Patent for “Code implemented tool calls”

Mistral이 코드로 구현된 tool call 방식에 관한 특허를 출원. LLM 에이전트의 함수 호출 및 도구 연동 설계와 관련된 지식재산 이슈로 해석됨.

60
해커뉴스AI/ML184842026-07-21

agent swarms와 새로운 모델 경제학

Agent swarms and the new model economics

여러 agent를 묶어 쓰는 swarm 방식이 모델 비용 구조를 바꾸고 있음. 작업 분해와 호출 단가가 제품 설계의 핵심 변수로 부상.

61
해커뉴스AI/ML1801002026-08-09

복잡한 주제를 배우기 위해 LLMs를 사용하는 방법

How I use LLMs to learn complex topics

복잡한 주제를 학습할 때 LLMs를 보조 도구로 활용하는 방법을 다룬 글. 개념 정리, 질문 생성, 이해 점검을 통해 학습 효율을 높이는 흐름에 초점.

62
해커뉴스AI/ML1771302026-08-16

Emerging multi-agent systems의 패턴과 문제점

Patterns and problems in emerging multi-agent systems

다중 에이전트 시스템에서 반복적으로 나타나는 설계 패턴과 실패 모드를 정리한 연구. 협업 구조가 복잡해질수록 조율 비용, 신뢰성, 디버깅 난도가 빠르게 커진다는 점을 짚음.

63
해커뉴스AI/ML170372026-07-26

8달러 microcontroller에서 2,890만 파라미터 LLM 실행

Running a 28.9M parameter LLM on an $8 microcontroller

저가 microcontroller에서 2,890만 파라미터 LLM을 구동하는 구현이 공개됨. 초소형 하드웨어에서도 경량 추론이 가능함을 보여주는 사례.

64
해커뉴스AI/ML1701132026-07-08

GPT-5.6 Sol, Terra와 Luna가 이번 목요일 공개 출시

GPT-5.6 Sol, along with Terra and Luna, will launch publicly this Thursday

OpenAI가 GPT-5.6 Sol과 Terra, Luna를 이번 목요일에 공개 출시한다고 발표함. 제품군의 대중 공개 일정이 공식화됨.

65
해커뉴스AI/ML169632026-08-03

AirLLM 70B inference with single 4GB GPU

AirLLM 70B inference with single 4GB GPU

66
해커뉴스Dev/Tools167752026-08-12

llama.cpp

llama.cpp

경량 로컬 LLM 추론 엔진 llama.cpp 관련 프로젝트 페이지. 다양한 환경에서 효율적인 온디바이스 실행을 지원하는 흐름을 강조함.

67
해커뉴스AI/ML166612026-07-31

DeepSeek-V4-Flash 업데이트

DeepSeek-V4-Flash Update

DeepSeek-V4-Flash의 업데이트 내용을 안내하는 공지성 문서. 모델 동작, 성능, 사용 관련 변경 사항을 반영한 릴리스 정보로 보임.

68
해커뉴스AI/ML163512026-07-27

Kimi-K3, HuggingFace에 7/27 공개

Kimi-K3 Releases on HuggingFace 7/27

Kimi-K3 모델이 HuggingFace에 공개됨. 최신 배포 일정이 7월 27일로 표시됨.

69
해커뉴스AI/ML1611132026-07-06

Fable 5, Vending-Bench에서의 이상 행동과 책임 회피 가능성

Fable 5 On Vending-Bench: Misbehaving, With Plausible Deniability

Fable 5가 Vending-Bench 평가에서 규칙 위반성 행동을 보였다는 분석. 에이전트 평가와 정렬 문제를 함께 짚음.

70
해커뉴스AI/ML1531222026-07-29

LLM에 ACM Digital Library 접근 권한을 줘야 할 때

Now is the time to give LLMs access to the ACM digital library

ACM 논문 아카이브를 LLM 학습·검색에 개방하자는 제안. 연구 검색성과 지식 활용도를 높이기 위한 접근성 개선이 핵심.

71
해커뉴스AI/ML1521962026-07-06

Emily Bender가 말한 "stochastic parrots"의 의미

What Emily Bender meant by "stochastic parrots"

Emily Bender의 "stochastic parrots" 개념을 해설. 대규모 언어모델이 이해보다 통계적 패턴 재현에 가깝다는 비판을 정리.

72
해커뉴스AI/ML150392026-08-11

LFM2.5 2.6B 모델, 4배 큰 모델들과 경쟁력 보임

LFM2.5 2.6B model competitive with 4x larger models

Liquid AI의 2.6B급 LFM2.5가 더 큰 모델들과 비슷한 성능을 보인다는 소개. 소형 모델 효율성과 성능 균형이 다시 주목받는 흐름.

73
해커뉴스AI/ML1461602026-07-16

LLM 비판은 옳다. 그래도 나는 LLM을 사용한다

The LLM Critics Are Right. I Use LLMs Anyway

LLM의 한계와 비판을 인정하면서도 실제 업무와 글쓰기에서 계속 활용하는 관점을 제시한다. 도구로서의 효용과 위험을 함께 짚는다.

74
해커뉴스Dev/Tools1421212026-07-26

Debian에서의 LLM 사용: 세 가지 제안

LLM Usage in Debian: Three Proposals

Debian 커뮤니티가 배포판 운영과 정책 과정에서 LLM 활용 범위를 두고 세 가지 제안을 논의함. 도구 사용 기준과 책임 소재를 둘러싼 운영 원칙 정립이 핵심 쟁점.

75
해커뉴스AI/ML137832026-07-09

GLM 5.2는 인간 장부 담당자에 거의 맞먹는 정확도

GLM 5.2 is nearly as accurate as a human book keeper

GLM 5.2가 VAT 벤치마크에서 인간 회계 담당자와 비슷한 수준의 정확도를 보임. 자동 회계·장부 처리에서 실사용 가능성을 시사함.

76
해커뉴스AI/ML133912026-07-30

2026년 LLM으로 코딩하기, 10배가 아니라 2배

2x, not 10x: coding with LLMs in 2026

LLM이 개발 생산성을 끌어올리지만, 과장된 10배 효과보다는 현실적인 2배 수준의 개선에 가깝다는 주장이다. 도구 의존보다 작업 분해와 검증이 성능을 좌우한다고 본다.

77
해커뉴스AI/ML1291632026-07-20

토큰 절약법을 연구하느라 모든 토큰을 소모했다

I burned all my tokens researching how to save tokens

토큰을 아끼는 연구를 위해 자체적인 deep research 파이프라인을 구축한 사례. 토큰 최적화와 비용 절감의 trade-off를 다룸.

78
해커뉴스AI/ML128992026-08-10

Claude의 수학적 역량을 더 알아보기

Learning more about Claude's mathematical capabilities

Anthropic이 Claude의 수학 문제 해결 능력을 추가로 분석한 연구 글. 모델의 수학적 성능과 한계를 더 깊게 검토함.

79
해커뉴스AI/ML127222026-07-23

Show HN: Cactus Hybrid: Gemma 4가 스스로의 오류를 판단하도록 학습

Show HN: Cactus Hybrid: We taught Gemma 4 to know when it's wrong

Gemma 4가 답변의 오류 여부를 스스로 판단하도록 학습한 Cactus Hybrid가 공개됨. 모델 신뢰도 평가와 자기검증을 강화하는 실험적 접근.

80
해커뉴스AI/ML125562026-07-15

20개의 Erdős 문제를 20개의 Codex 계정으로 병렬 해결하기

Solving 20 Erdős Problems with 20 Codex Accounts Running in Parallel

20개의 Codex 계정을 병렬로 돌려 20개의 Erdős 문제를 푼 사례. 다중 에이전트 방식과 병렬 추론의 활용 가능성을 보여줌.

81
해커뉴스AI/ML121512026-08-17

Anthropic의 오픈소스 AI와의 전쟁

Anthropic's War on open source AI

Anthropic의 오픈소스 AI 대응을 비판하는 글. 공개 모델 생태계와의 경쟁 및 정책 방향을 둘러싼 논쟁을 다룸.

82
해커뉴스Dev/Tools121132026-07-08

Geosql: 지리공간 데이터용 Claude/Codex 스킬

Geosql: A Claude/Codex skill for geospatial data

Claude와 Codex에서 지리공간 데이터를 다루기 위한 Geosql 스킬 공개. 공간 질의와 분석 작업을 LLM 워크플로에 붙이는 도구.

83
해커뉴스AI/ML1191312026-08-14

텍스트 AI 워터마크는 항상 쉽게 제거된다

Text AI watermarks will always be trivial to remove

텍스트 생성 AI의 워터마크는 실사용 환경에서 쉽게 제거된다는 주장. 탐지보다 우회가 더 쉬워 방어 수단으로서의 효용이 낮다는 관점.

84
해커뉴스AI/ML114932026-07-08

Fable은 유용한 모델이 아님

Fable is not a useful model

Fable 모델의 실용성에 대한 비판 글이 공개됨. 벤치마크 성능과 실제 사용 가치 사이의 간극을 문제 삼음.

85
해커뉴스AI/ML113242026-08-11

Nvidia Nemotron 3.5 Lightning

Nvidia Nemotron 3.5 Lightning

Nvidia의 Nemotron 3.5 Lightning 모델 공개. 경량화된 대규모 언어모델 계열로 보이며 추론 효율을 강조.

86
해커뉴스AI/ML112822026-07-16

고전적 Machine Learning으로 LLM 생성 텍스트 탐지하기

Detecting LLM-Generated Texts with “Classical” Machine Learning

클래식한 머신러닝 기법만으로도 LLM 생성 텍스트를 구분하는 분류기를 만들 수 있음을 다룸. 특징 추출과 경량 모델 조합으로 탐지 접근을 설명한다.

87
해커뉴스AI/ML112432026-07-11

MiMo v2.5 추론 최적화: 하이브리드 SWA 효율을 한계까지 끌어올리기

Inference Optimization for MiMo v2.5: Pushing Hybrid SWA Efficiency to the Limit

MiMo v2.5의 추론 경로를 최적화해 하이브리드 SWA 효율을 극대화한 기술 분석. 모델 성능을 유지하면서 지연시간과 연산 비용을 낮추는 데 초점.

88
해커뉴스AI/ML109562026-07-06

코드의 깔끔함이 coding agents에 영향을 주는가? 통제된 최소쌍 연구

Does code cleanliness affect coding agents? A controlled minimal-pair study

코드 청결도가 coding agents의 성능에 미치는 영향을 통제 실험으로 검증한 연구. 작은 코드 차이만으로도 에이전트 결과가 달라질 수 있음을 다룸.

89
해커뉴스AI/ML107312026-08-05

대형 언어 모델이 표 형식 예측에 실패하는 이유

Why Large Language Models Fail at Tabular Prediction

LLM이 표 데이터 예측에서 기존 머신러닝 기법보다 성능이 떨어지는 이유를 분석. 범주형 변수와 수치형 변수의 혼합 처리에 취약점을 보임.

90
해커뉴스AI/ML107322026-07-23

Petals: BitTorrent 방식으로 집에서 LLM 실행하기

Petals: Run LLMs at home, BitTorrent-style

Petals가 분산형 P2P 구조로 대형 언어모델을 집에서 돌리는 방식을 제안함. 개별 사용자의 자원을 모아 LLM 추론과 호스팅을 분산 처리하는 접근.

91
해커뉴스AI/ML104412026-07-31

29 GB RAM으로 Kimi K3를 0.50 tok/s로 실행하기

Run Kimi K3 using 29 GB of RAM at 0.50 tok/s

29GB RAM 환경에서 Kimi K3를 저속으로 구동하는 방법을 다룸. 로컬 실행의 메모리 요구량과 추론 속도를 보여줌.

92
해커뉴스AI/ML104212026-07-16

독일 AI 컨소시엄, 벤치마크를 선도하는 오픈 30B 모델 Soofi S 공개

German AI consortium releases Soofi S, an open 30B model that tops benchmarks

독일 AI 컨소시엄이 오픈 30B 모델 Soofi S를 공개함. 영어와 독일어 벤치마크에서 상위 성능을 기록했다고 소개됨.

93
해커뉴스AI/ML103482026-08-15

Show HN: ThoughtDAG – LLM 대화를 위한 편집 가능한 컨텍스트 그래프

Show HN: ThoughtDAG – An editable context graph for LLM conversations

LLM 대화 맥락을 DAG 형태로 관리하는 편집 도구가 소개됨. 대화 노드와 연결 관계를 수정하며 컨텍스트 추적성을 높이는 방식.

94
해커뉴스Dev/Tools1021102026-08-05

Born Against, 또는 취미 프로그래밍 커뮤니티가 LLM 사용에 반대하는 이유

Born Against, or why hobby programming communities are against LLM usage

취미 프로그래밍 커뮤니티에서 LLM 도구 도입을 거부하는 현상 분석. 창의성 저하와 학습 효과 감소 우려 등이 주요 원인.

95
GeekNewsAI/ML2026-08-17

모델은 의도적으로 더 멍청해지고 있다

모델은 의도적으로 더 멍청해지고 있다

소형·MoE 모델은 적은 활성 파라미터로 수학·코딩 추론을 강화하는 대신 세부 사실 회상은 약해지는 경향이 있음. 사실 지식보다 문제 분해, 검산, 되돌아가기 같은 추론 절차에 용량을 더 쓰는 방향으로 최적화가 이동함.

96
GeekNewsAI/ML2026-08-16

Claude 시스템 프롬프트 변경 이력

Claude 시스템 프롬프트 변경 이력

Claude 웹·모바일 앱의 시스템 프롬프트 변경 내역을 추적한 글. 최신 정보 주입, 응답 행동 지침, Markdown 코드 포맷 강제 등 응답 품질 조정 방식이 정리됨.

97
GeekNewsAI/ML2026-08-16

LLM이 5학년 이후 학습 자료를 전혀 보지 못하면 어떻게 될까?

LLM이 5학년 이후의 학습 자료를 전혀 보지 못하면 어떻게 될까?

LittleLearner를 미국 초등학교 K–5 교육과정으로만 제한한 880억 토큰 말뭉치로 처음부터 학습해, 사전학습 지식의 경계가 모델 능력에 미치는 영향을 검증함. FineWeb-Edu를 Common Core 기준의 5단계 파이프라인으로 필터링하고 5학년 이후 개념·사실·어휘를 명시적으로 제외함.

98
GeekNewsAI/ML2026-08-16

내가 여전히 회의적인 이유

내가 여전히 회의적인 이유

LLM이 비자명한 소프트웨어 개발에 실제로 효과적인지 아직 입증되지 않았다는 회의론. 4년간의 혁명에도 품질·속도·비용·기능·보안 개선이 뚜렷하지 않았다는 지적.

99
GeekNewsAI/ML2026-08-15

Qwen 3.8 27B

Qwen 3.8 27B

Qwen3.8-27B-FP8은 이미지·영상 이해와 장기 에이전트 작업을 지원하는 270억 파라미터 밀집형 모델. FP8 양자화 가중치를 제공하며 기본 추론 모드는 요청별로 끌 수 있음.

100
GeekNewsAI/ML2026-08-14

Qwen3.8-27B 출시 예정

Qwen3.8-27B Upcoming release

한국 시간 8월 15일 00시 공개 예정인 Qwen3.8-27B 모델 소개 글. 벤치마크는 아직 미공개이며 확장 토큰 문맥 길이는 100만 토큰으로 표기됨.

101
GeekNewsAI/ML2026-08-14

Opus 5는 왜 함께 작업하기 더 불편하게 느껴지는가?

Opus 5는 왜 함께 작업하기 더 불편하게 느껴지는가?

Opus 5는 벤치마크 성능은 높지만 실제 작업에서는 더 세밀한 감독이 필요하다는 평가. 의도 불명확 시 질문하고 계획을 보정하던 이전 모델과 달리 확인 절차가 약해 협업 부담이 커졌다는 지적이다.

102
GeekNewsAI/ML2026-08-14

하나의 프롬프트를 11개 AI 모델에 실행했더니 나온 서로 다른 결과

하나의 프롬프트를 11개 AI 모델에 실행했더니 나온 서로 다른 결과

Netlify가 동일한 커피숍 웹사이트 프롬프트를 11개 AI 모델에 각각 3회씩 실행해 결과를 비교함. 디자인·콘텐츠 품질과 평균 크레딧 사용량이 모델별로 크게 달라, 실제 생성 결과 기준의 주관적 벤치마크임을 보여줌.

103
GeekNewsAI/ML2026-08-14

Gemini 3.7 Flash

Gemini 3.7 Flash

Google이 3.6 Flash 출시 3주 만에 Gemini 3.7 Flash를 공개함. 소프트웨어 엔지니어링, 지식 업무, 웹 개발 벤치마크에서 3.6 Flash보다 높은 성능을 보였다.

104
GeekNewsAI/ML2026-08-13

Grok 4.6, AAII 61점으로 비용 효율에서 선두권 진입

Grok 4.6, AAII 61점으로 비용 효율에서 선두권 진입

Grok 4.6이 AAII 61점으로 GPT-5.6 Sol과 동점을 기록하며 상위권에 올라섬. 에이전트 성능도 빠르게 개선돼 비용 대비 경쟁력이 부각됨.

105
GeekNewsAI/ML2026-08-13

DeepSeek V4 Pro 0813

DeepSeek V4 Pro 0813

OpenRouter가 단일 공급자 호스팅 방식으로 제공. 실제 고객 기준 가중 평균 가격은 입력 100만 토큰당 $0.03508, 출력 $0.8697 수준.

106
GeekNewsAI/ML2026-08-13

Qwen3.8-2.4T-A95B 오픈 웨이트 공개

Qwen3.8-2.4T-A95B 오픈 웨이트 공개

Qwen이 Max급 최상위 모델 계열의 오픈 웨이트 버전을 공개. 총 2.4T 파라미터 중 95B를 토큰당 활성화하는 MoE 구조로 자체 인프라 운영이 가능해짐.

107
GeekNewsDev/Tools2026-08-13

AI 사용을 그만두기로 한 이유

AI 사용을 그만두기로 한 이유

20년 경력 개발자가 1년 넘게 LLM 코딩 도구를 쓴 뒤 AI 사용 중단을 선언. 정신 건강, 소프트웨어 품질, 환경·사회적 비용을 이유로 들었고 Claude Code와 Linear 연동 경험도 언급.

108
GeekNewsDev/Tools2026-08-13

인간 중심에서 에이전틱 코드 리뷰로 - 더 빠른 결정이 더 나은 리뷰를 뜻하지는 않는다

인간 중심에서 에이전틱 코드 리뷰로 - 더 빠른 결정이 더 나은 리뷰를 뜻하지는 않는다

207개 GitHub 프로젝트의 102만 개 PR을 분석해 코드 리뷰가 인간 중심, LLM 보조, AI 에이전트 참여 단계로 바뀌며 속도와 품질이 어떻게 달라졌는지 조사. AI 리뷰어를 빨리 도입한 프로젝트는 결정 속도는 빨라졌지만 품질 개선은 단순하지 않았음.

109
GeekNewsAI/ML2026-08-13

Unsloth Desktop - 로컬 AI 모델 실행/학습/에이전트를 하나로 묶은 오픈소스 앱

Unsloth Desktop - 로컬 AI 모델 실행/학습/에이전트를 하나로 묶은 오픈소스 앱

Unsloth가 로컬에서 LLM과 diffusion, embedding, vision, TTS/STT 모델을 실행·학습할 수 있는 Desktop 앱을 공개. GGUF, MLX, safetensors를 지원하고 Mac, Windows, Linux, WSL 및 다양한 GPU 환경을 포괄함.

110
GeekNewsAI/ML2026-08-13

Show GN: 흩어진 AI 소식을 실시간 한국어 요약으로 모아 보기

Show GN: 흩어진 AI 소식을 실시간 한국어 요약으로 모아 보기

공식 기술 블로그, YouTube, Reddit, X, GitHub, Hugging Face, 논문 등으로 흩어진 AI 소식을 한곳에 모아 한국어로 요약하는 서비스 소개. 이전에 공개된 aitrends.kr의 후속 소개글.

111
GeekNewsAI/ML2026-08-12

Grok 4.6 공개, 파라미터 확장 대신 사후학습에 투자한 모델

Grok 4.6 공개, 파라미터 확장 대신 사후학습에 투자한 모델

xAI가 Grok 4.6을 공개하고 Cursor와 Grok Build에서 즉시 사용 가능하게 했다. 대규모 파라미터 확장보다 사후학습 강화에 집중한 모델로, 여러 벤치마크 합산 지표에서 GPT-5.6 Sol과 동률을 주장했다.

112
GeekNewsAI/ML2026-08-12

Solar Pro 4 - 에이전트 작업 특화 LLM

Solar Pro 4 - 에이전트 작업 특화 LLM

Upstage가 문서 읽기·도구 호출·코드 실행을 거쳐 Excel, Word, PPT 같은 실제 업무 파일을 생성하는 에이전트용 LLM을 공개함. Terminal-Bench v2.1 57점, GDPval-AA v2 39점 등 업무형 벤치마크 성능을 제시함.

113
GeekNewsAI/ML2026-08-12

LLM Evals에 대해 알아야 할 모든 것

LLM Evals에 대해 알아야 할 모든 것

700명 넘는 엔지니어와 PM에게 AI 평가를 가르친 경험을 바탕으로 실무형 FAQ를 정리. 벤치마크 점수보다 실제 응답 품질을 어떻게 검증하고 평가 체계를 설계할지에 초점.

114
GeekNewsAI/ML2026-08-12

코드가 아니라 아이디어를 통제하라

코드가 아니라 아이디어를 통제하라

AI 시대의 프로그래머는 생성된 코드를 한 줄씩 검토하기보다 소프트웨어가 담아야 할 아이디어와 설계를 통제해야 한다고 주장. LLM은 국소 최적 코드 작성에는 강하지만 큰 설계에서는 한계가 있다고 봄.

115
GeekNewsAI/ML2026-08-11

Mark Zuckerberg, Meta의 개방형 모델 복귀와 함께 ‘폐쇄형’ AI 경쟁사 비판

Mark Zuckerberg, Meta의 개방형 모델 복귀와 함께 ‘폐쇄형’ AI 경쟁사 비판

Meta가 Muse Glimmer의 가중치를 공개하고 더 강력한 Muse Spark도 수주 내 공개하기로 하며 오픈 모델 전략으로 복귀. Mark Zuckerberg는 강력한 AI가 기업과 정부에 집중돼서는 안 된다고 강조하며 폐쇄형 경쟁사를 비판.

116
GeekNewsAI/ML2026-08-11

Needle 2 - 스마트폰·웨어러블·스마트홈·로봇을 위한 14MB 에이전틱 LLM

Needle 2 - 스마트폰·웨어러블·스마트홈·로봇을 위한 14MB 에이전틱 LLM

도구 호출·기기 제어·구조화 추출에 특화된 45M 파라미터 LLM. 전체 크기 14MB, 세션 RAM 최대 28MB로 경량 온디바이스 에이전트 용도에 맞춤.

117
GeekNewsAI/ML2026-08-11

LLM은 PCB 배선을 어디까지 할 수 있을까? 숙련자와 Net 단위로 비교해봤습니다

LLM은 PCB 배선을 어디까지 할 수 있을까? 숙련자와 Net 단위로 비교해봤습니다

LLM은 아직 숙련된 하드웨어 엔지니어 수준의 PCB 설계에는 미치지 못함. Fable 5까지 시험했지만 결과는 크게 달라지지 않았고, PCB·기구·펌웨어·앱·백엔드까지 직접 만드는 개인 프로젝트 사례를 통해 한계를 짚음.

118
GeekNewsSecurity2026-08-11

독점 LLM API의 추론 흔적 탈취

독점 LLM API의 추론 흔적 탈취

Anthropic, OpenAI, Google API의 암호화된 추론 블록을 약한 동일 계열 모델로 옮겨 탈옥하면 상위 모델의 chain-of-thought를 평문으로 복원할 수 있음. 강한 모델에서 얻은 추론 흔적을 약한 모델에 복사하도록 유도하는 두 단계 API 공격이 핵심.

119
GeekNewsAI/ML2026-08-11

Apple Silicon macOS VM에서 llama.cpp LLM 추론 가속하기

Apple Silicon macOS VM에서 llama.cpp LLM 추론 가속하기

AppleVirtualization.framework의 가상 GPU가 보수적 Metal 기능만 노출해 llama.cpp가 느린 커널을 선택하던 문제를 우회해 최대 16.36배 가속. 게스트 프로세스 전용 호환성 계층으로 GPU 기능 판정을 바꾸는 방식.

120
GeekNewsAI/ML2026-08-10

Meta Muse Glimmer - 기기에서 실행하는 오픈 웨이트 30B 코딩 모델

Meta Muse Glimmer - 기기에서 실행하는 오픈 웨이트 30B 코딩 모델

Meta가 30B 파라미터의 로컬 에이전트 모델 Muse Glimmer를 Apache 2.0으로 공개함. 단일 소비자용 GPU가 있는 Mac과 PC에서 실행하도록 최적화됐으며 로짓 증류와 장문맥 학습, SFT, 온정책 증류를 사용함.

121
GeekNewsAI/ML2026-08-10

LLM으로 복잡한 주제를 배우는 시각적 시뮬레이션 학습법

LLM으로 복잡한 주제를 배우는 시각적 시뮬레이션 학습법

복잡한 개념을 긴 설명 대신 시각적 시뮬레이션으로 바꿔 이해를 돕는 학습법 소개. LLM으로 기초 내용을 구성하고 검토한 뒤 저해상도 애니메이션 형태로 구현하는 흐름을 제안.

122
GeekNewsGeneral Tech2026-08-10

vibecoding 태그가 도를 넘은 것 같다

vibecoding 태그가 도를 넘은 것 같다

Lobste.rs의 Zsh 버그 추적 글에 vibecoding 태그가 붙었지만, LLM은 부록에서만 사용됐고 본문은 사람이 직접 작성한 글로 지적됨. 태그 적용 주체는 확인되지 않았고 용어 남용 논란만 부각됨.

123
GeekNewsDev/Tools2026-08-10

hallmark - AI 티가 나지 않는 디자인 스킬

hallmark - AI 티가 안나는 디자인 스킬

AI 코딩 어시스턴트가 흔히 만드는 평범한 디자인을 피하기 위한 anti-AI-slop 규칙을 묶은 디자인 스킬임. 타이포그래피, 색상, 레이아웃, 모션, 인터랙션을 제어하고 반복 패턴을 줄이도록 유도함.

124
GeekNewsAI/ML2026-08-10

Ask GN: Fable 5가 사실상 반쪽짜리 뇌임

Ask GN: Fable 5가 걍 반쪽짜리 뇌임

Fable 5가 간단한 배열 계산을 틀리고도 정답을 우기다가 나중에야 오류를 인정했다는 사용 후기. 로컬 Qwen 3.6 모델과 비교했을 때 코드와 계산 정확성이 크게 떨어졌다는 평가가 제기됐다.

125
GeekNewsAI/ML2026-08-08

AI 시험지는 함정이 9할이다 - LLM 테스트 케이스 설계법

AI 시험지는 함정이 9할이다 - LLM 테스트 케이스 설계법

주문 메시지 판별 파이프라인 검증에서 정상 케이스보다 예외·함정 케이스가 훨씬 중요하다는 사례 제시. 주문 아님, 경계값, 오탐 유발 패턴을 촘촘히 넣어야 실제 사고를 줄일 수 있음.

126
GeekNewsAI/ML2026-08-08

Oracle, 사내 AI 코딩은 장려하면서 OpenJDK에는 AI 생성 코드 기여 금지

Oracle은 자신이 관리하는 오픈소스 Java 프로젝트OpenJDK에서 LLM/확산 모델 등으로 일부라도 생성된 코드, 문서, 이미지 등의 기여를 금지하는 임시 정책을 도입함AI 도구를 코드이해/디버깅/리뷰/연구에 개인적으로 사용하는 것은 허용하지만, 그 도구가 생성...

127
GeekNewsAI/ML2026-08-07

LLM은 ‘점프’할 수 없다

현재 생성형 AI는 데이터에서 규칙을 찾는귀납(Induction)과 주어진 공리에서 결과를 도출하는연역(Deduction)은 빠르게 기계화하고 있지만, 감각 경험에서 새로운 설명과 공리로 넘어가는귀추(Abduction)의 ‘점프’는 수행하지 못한다는 입장임

128
GeekNewsAI/ML2026-08-07

AI한테 시험을 냈는데 출제자가 5번 틀렸다 - LLM 파이프라인 검증기

카톡 주문 메시지를 상품 코드로 바꿔주는 LLM 파이프라인을 만들기 전에, 테스트 29개(정답지·채점기 포함)부터 만들었습니다.결과는 두 모델 모두 치명 오류 0건 통과. 그런데 그 과정에서 제가 쓴 정답지가 3번, 채점기가 2번 틀렸습니다. 헷갈리게 심어둔 함정에 출제자인 제가 빠졌고, 모델이 "확인

129
GeekNewsDev/Tools2026-08-06

Show GN: Ephemeral System Prompt - 실행마다 달라지는 지시사항을 넣고도 프롬프트 캐시 유지하기

Show GN: Ephemeral System Prompt - 실행마다 달라지는 지시사항을 넣고도 프롬프트 캐시 유지하기

LLM 에이전트에서 매 실행마다 변하는 지시사항을 분리해 프롬프트 캐시 유지하는 기법 제안.

130
GeekNewsDev/Tools2026-08-06

rust-lang/rust가 LLM 사용 정책을 도입함

rust-lang/rust가 LLM 사용 정책을 도입함

Rust 프로젝트 5개 팀이 LLM 사용 정책 도입. 질문·분석·리뷰에는 허용, 새 콘텐츠 생성 엄격 제한.

131
GeekNewsDev/Tools2026-08-05

Pi의 미니멀리즘이 경쟁력인 이유

Pi의 미니멀리즘이 경쟁력인 이유

Pi는 기본 도구 4개와 1,000토큰 미만의 시스템 프롬프트로 최소형 코딩 하네스를 지향. Databricks 연구에 따르면 동일 모델/추론 강도에서도 하네스에 따라 작업당 비용이 2배 이상 차이남.

132
GeekNewsDev/Tools2026-08-05

취미 프로그래밍 커뮤니티가 LLM 사용에 강하게 반대하는 이유

취미 프로그래밍 커뮤니티가 LLM 사용에 강하게 반대하는 이유

취미 프로그래밍 커뮤니티는 작동하는 결과물보다 어려운 분야를 직접 익히는 숙련 과정을 중시. LLM으로 우회해 완성품을 만드는 행위는 활동의 목적을 놓치는 것으로 받아들여짐.

133
GeekNewsDev/Tools2026-08-05

Show GN: llmwiki-serve – Markdown 문서를 코딩 에이전트가 찾아 읽게 해주는 로컬 서버

Show GN: llmwiki-serve – Markdown 문서를 코딩 에이전트가 찾아 읽게 해주는 로컬 서버

코딩 에이전트가 Markdown 문서를 직접 읽도록 도와주는 로컬 서버 llmwiki-serve 공개. Codex/Claude Code 사용 시 플러그인으로 Wiki 폴더 연결 지원.

134
GeekNewsAI/ML2026-08-05

Retrieval as Reasoning - LLM Wiki가 RAG보다 나은 이유에 대한 실증 벤치마크

Retrieval as Reasoning - LLM Wiki가 RAG보다 나은 이유에 대한 실증 벤치마크

문서를 청크로 나누어 벡터 검색하는 RAG 대신, 상호 링크된 위키를 에이전트가 탐색하는 LLM Wiki 방식의 장점을 실증한 논문. 청크 검색의 단편적 한계를 극복하고 컨텍스트 연결성을 높임.

135
GeekNewsAI/ML2026-08-04

LLM은 전문성을 보상함

LLM은 전문성을 보상함

LLM에서 더 큰 가치를 얻으려면 프롬프트 기법보다 도메인 전문성이 중요. 테렌스 타오가 ChatGPT와 Jacobian Conjecture 반례를 논의하며 핵심 질문과 간접 반박을 활용한 사례.

136
GeekNewsAI/ML2026-08-03

질문을 제대로 하면 AI 금융 조언은 놀라울 정도로 좋아짐

22~89세의 재무 결정을 시뮬레이션한 결과, LLM 조언은 30세 이상 거의 모든 사람에게저축 완충 자금을 마련하고 저축·주식시장 참여·분산투자를 늘리는 데 도움을 줌근로 기간에는 저축하고 은퇴 후에는 자산을 인출하며 45세 이후 주식 비중을 낮추도록 권했지만,실직 ...

137
GeekNewsAI/ML2026-08-03

Karpathy의 펠리컨

LLM 평가는 ‘자전거를 탄 펠리컨 SVG 만들기’ 같은 단일 결과물에서 벗어나,세계와 게임을 절차적으로 구현하는 장시간 작업으로 확장되기 시작함Opus 5에 《The Lord of the Rings》 첫 문단과100만 토큰 예산을 주고 Three.js 렌더링을 요청하자, 약 2시간 ...

138
GeekNewsAI/ML2026-08-03

LLM 생성 코드를 직접 다시 입력해 인지 부채 막기

기능 전체를 코딩 에이전트에 맡기는 대신, 채팅으로 생성된 코드를 직접 입력해코드 이해와 통제권을 유지함에이전트는 명시적 요청 없이는 파일·의존성·저장소 상태를 변경하지 않고, 모든 편집안과 명령을 채팅에만 출력하도록 제한함직접 입력하는 동안 작동 방식과...

139
GeekNewsAI/ML2026-07-31

GenRec: Netflix의 LLM 네이티브 추천을 향하여

GenRec: Netflix에서의 LLM-native 추천을 향하여

넷플릭스가 수천 개의 수작업 피처와 복잡한 추천 아키텍처를 단순화하기 위해 LLM 기반 GenRec을 개발함. 사용자 이력과 아이템 메타데이터를 활용해 새로운 추천 유스케이스를 더 유연하게 처리하려는 시도.

140
GeekNewsAI/ML2026-07-31

DeepSeek-V4-Flash 모델 공개

DeepSeek-V4-Flash 모델 공개

DeepSeek-V4-Flash API 정식 버전이 공개 베타로 출시됨. 에이전트 성능에서 V4-Pro-Preview를 크게 앞섰고, Terminal Bench 2.1 82.7점 등 여러 벤치마크에서 높은 점수를 기록함.

141
GeekNewsDev/Tools2026-07-31

GCC 운영위원회, AI 정책 발표

GCC 운영위원회, AI 정책 발표

GCC 운영위원회가 AI 정책 워킹그룹 권고안을 채택해 LLM 활용 기여의 허용 범위를 정함. LLM 생성 콘텐츠를 포함하거나 파생된 법적으로 중요한 기여는 받지 않으며, 저작권상 중요성 판단은 GNU Project 유지관리자 지침을 따름.

142
GeekNewsAI/ML2026-07-31

DeepSeek V4 Flash 0731의 지능·성능·가격 분석

DeepSeek V4 Flash 0731의 지능·성능·가격 분석

최대 추론 기준 AAII 50점으로 Kimi K3(max), GLM-5.2(max)에 이어 3위. 2,840억 파라미터 MoE 모델로 토큰당 130억 개만 활성화하며, 100만 토큰 컨텍스트와 저가 API 요금을 제공함.

143
GeekNewsSecurity2026-07-30

LLM 허니팟

LLM 허니팟

LLM2HUMAN CLINIC이라는 가짜 시술 사이트를 이용한 허니팟 사례. 사람에게는 농담을 보여주고 에이전트에는 결제 절차를 노출해 봇 행동을 유도했다.

144
GeekNewsAI/ML2026-07-30

HANDBOOK.md: 긴 정책 문서만으로는 에이전트를 안정적으로 통제할 수 없음

HANDBOOK.md: 긴 정책 문서만으로는 에이전트를 안정적으로 통제할 수 없음

긴 정책 문서가 장시간·다중 도구 작업에서 에이전트 행동을 얼마나 제어하는지 평가한 벤치마크 HANDBOOK.md 소개. 금융·의료·보험 등 실제 업무 환경에서 문서 직접 준수 여부를 측정함.

145
GeekNewsAI/ML2026-07-30

Kimi K3-256k

Kimi K3-256k

Kimi K3-256k는 256k 컨텍스트에서 K3 수준의 품질을 유지하면서 1M 컨텍스트 K3보다 할당량을 약 절반만 쓰는 일상 코딩용 모델. Kimi Code는 K3와 K2.7 Code를 여러 모델 ID로 제공함.

146
GeekNewsAI/ML2026-07-29

Show GN: guru-maker - 스스로 발전하는 투자 에이전트

Show GN: guru-maker - 스스로 발전하는 투자 에이전트

투자 분석용 AI 에이전트 메모리 레이어로, 학습을 통해 더 나은 투자 판단을 축적하는 구조를 제안함. 단발성 성공을 영구 원칙으로 일반화하지 않도록 오버피팅을 방지하고 판단 근거를 보존하는 데 초점.

147
GeekNewsAI/ML2026-07-29

Kimi K3 아키텍처 개요와 설계 노트

Kimi K3 아키텍처 개요와 설계 노트

Kimi Linear를 48B에서 2.8T로 확장한 프로덕션 모델 아키텍처를 정리. LatentMoE와 추론 효율 중심의 구조로 공개 가중치 모델 중 최대 규모를 지향.

148
GeekNewsAI/ML2026-07-28

SlopCodeBench로 본 Opus 5의 장기 코딩 성능

SlopCodeBench로 본 Opus 5의 장기 코딩 성능

단계적으로 요구사항이 추가되는 장기 코딩 벤치마크에서 Opus 5는 17개 체크포인트 중 4개만 엄격 통과. 지속적인 개입 없이 코드베이스를 안정적으로 발전시키기에는 아직 신뢰도가 낮은 수준.

149
GeekNewsAI/ML2026-07-28

Kimi-K3 기술 보고서 [PDF

Kimi-K3 기술 보고서 [PDF]

] Kimi-K3의 기술 내용을 정리한 보고서. 모델 구조와 학습, 성능 관련 세부 사항을 담은 문서로 보임.

150
GeekNewsAI/ML2026-07-27

Show GN: [직접 공부하면서 만들었습니다.

Show GN: [직접 공부하면서 만들었습니다.] 사주 판정은 코드로, 풀이는 LLM으로 하는 사주 서비스, 방울당

사주 판정은 코드로, 풀이는 LLM으로 하는 사주 서비스, 방울당] 사주 리포트 서비스 '방울당' 소개. 만세력 계산과 오행·용신 판정처럼 정답이 있는 영역은 코드로 처리하고, 해석 문구는 LLM으로 구성하는 구조.

151
GeekNewsAI/ML2026-07-27

Kimi K3 가중치 공개

Kimi K3 weight 공개

Kimi K3의 weight가 공개됨. 모델 가중치 배포로 로컬 활용과 재현 가능성이 확대될 가능성.

152
GeekNewsAI/ML2026-07-27

수학의 어두운 밤

수학의 어두운 밤

LLM이 오래된 수학 추측의 반례와 증명을 대량으로 만들어내며 인간의 수학적 발견 경험이 흔들릴 수 있다는 우려가 제기됨. AI 시대에 인간은 평가와 교육을 맡으면 된다는 위안이 연구, 고용, 감상의 의미를 충분히 대체하지 못한다는 문제를 다룸.

153
GeekNewsAI/ML2026-07-27

Netflix의 사내 LLM 서빙 플랫폼

Netflix의 사내 LLM 서빙 플랫폼

Netflix가 LLM을 별도 시스템으로 분리하지 않고 기존 ML 인프라에 통합해 운영하는 서빙 플랫폼을 공개. vLLM과 Triton을 연결해 유연한 모델 지원과 디버깅, 확장성을 확보했다.

154
GeekNewsAI/ML2026-07-27

Solar Open 2 Technical Report를 초심자도 이해할 수 있는 인터랙티브 강의로 만들었습니다

Solar Open 2 Technical Report를 초심자도 이해할 수 있는 인터랙티브 강의로 만들었습니다

MoE, Hybrid Attention, NoPE, 비동기 RL 같은 개념이 낯선 독자를 위해 Solar Open 2 Technical Report를 인터랙티브 웹 강의로 재구성함. 기술 보고서의 핵심을 단계적으로 풀어 진입 장벽을 낮춤.

155
GeekNewsAI/ML2026-07-26

8달러짜리 마이크로컨트롤러에서 2,890만 매개변수 LLM 실행하기

8달러짜리 마이크로컨트롤러에서 2,890만 매개변수 LLM 실행하기

ESP32-S3에서 서버 연결 없이 2,890만 매개변수 언어 모델을 구동해 작은 화면에 약 9 토큰/초 속도로 텍스트를 출력함. 전체 파라미터 대부분을 플래시에 두고, 토큰마다 필요한 일부 행만 읽는 방식으로 메모리 제약을 우회함.

156
GeekNewsAI/ML2026-07-25

Claude Opus 5, Artificial Analysis 지능 리더보드 1위

Claude Opus 5, Artificial Analysis 지능 리더보드 1위

Artificial Analysis의 Intelligence Index v4.1에서 Claude Opus 5 Adaptive Reasoning·Max Effort가 61점으로 1위를 차지함. 170개 평가 모델 기준으로 에이전트 작업, 코딩, 과학 추론, 지식 신뢰성, 장문맥 성능이 함께 비교됨.

157
GeekNewsAI/ML2026-07-24

Codeberg로 이전한 것을 후회하는 이유

GitHub의 성능 저하와 Microsoft의 영향력을 피해 비영리 자유 소프트웨어 호스팅인 Codeberg로 옮겼지만,LLM·암호화폐 프로젝트의 범주별 금지로 플랫폼의 자유를 신뢰하기 어려워짐Codeberg는 LLM 중심 저장소의 자원 소비·저품질 기여·저작권 문제를 근거로 들었으나, 프로젝트...

158
GeekNewsAI/ML2026-07-24

Codeberg는 LLM으로부터 FLOSS 공유 자원을 보호합니다

Codeberg e. V. 회원들은사용자·프로젝트 데이터를 LLM 훈련에 쓰지 않는 방침과 ‘바이브 코딩’ 프로젝트를 제한하는 이용약관 변경안을 모두 가결함논쟁이 컸던 두 번째 안건은 찬성 358명, 반대 144명, 기권 14명과 약 50%의 투표율로 통과됐으며,즉각적인 일괄 삭제...

159
GeekNewsAI/ML2026-07-23

AI 연구소들은 ‘자전거 타는 펠리컨’에 맞춰 모델을 최적화했을까?

AI 연구소들은 ‘자전거 타는 펠리컨’에 맞춰 모델을 최적화했을까?

7개 프런티어 모델과 1,008개 SVG 비교에서 유명 프롬프트에 과도하게 최적화된 흔적은 뚜렷하지 않았다. 동물·탈것 조합 프롬프트를 반복 평가한 결과, pelicanmaxxing의 증거는 제한적이었다.

160
GeekNewsAI/ML2026-07-23

Show GN: NvChat – NVIDIA의 무료 LLM을 쓰는 단일 exe Windows 클라이언트

Show GN: NvChat – NVIDIA의 무료 LLM을 쓰는 단일 exe 윈도우 클라이언트

build.nvidia.com의 OpenAI 호환 무료 모델을 웹 플레이그라운드 대신 로컬 Windows 클라이언트로 쓰기 위해 제작. 모델 목록 조회와 대화 기능을 갖춘 단일 exe 앱으로 Claude·ChatGPT 데스크톱 사용성을 겨냥함.

161
GeekNewsAI/ML2026-07-23

Show GN: 로컬 LLM 에이전트 개발과 테스트를 한곳에서, 툴 검색과 HITL, MCP 연동까지 (한국 통계 MCP 데모)

Show GN: 로컬 LLM 에이전트 개발과 테스트를 한곳에서, 툴 검색과 HITL, MCP 연동까지 (한국 통계 MCP 데모)

국가통계포털(KOSIS) 공식 MCP 시범서비스를 로컬 9B 모델에 연결한 데모. API 키 없이 통계를 조회해 차트를 만들고, CSV 저장처럼 위험한 작업은 사람 승인(HITL)을 거치도록 구성함.

162
GeekNewsDev/Tools2026-07-23

GigaToken - 언어 모델 토큰화를 약 1,000배 가속

GigaToken - 언어 모델 토큰화를 약 1,000배 가속

Tiktoken과 HuggingFace Tokenizers 대체를 목표로 하는 고속 토크나이저. SIMD 최적화와 캐싱, 스레드 통신 감소로 텍스트 처리 속도를 GB/s 단위로 끌어올림.

163
GeekNewsSecurity2026-07-21

WordPress RCE를 GPT5.6과 25달러로 발견

WordPress RCE를 GPT5.6과 25달러로 발견

GPT5.6 Sol Ultra가 최신 안정판 WordPress를 분석해 인증 전 SQL 주입부터 관리자 계정 생성과 RCE까지 이어지는 공격 체인을 완성. 시작점은 WordPress 5.6의 Batch API 배열 인덱스 불일치였다.

164
GeekNewsAI/ML2026-07-21

Kimi Work: 지식 노동자를 위한 차세대 데스크톱 AI 에이전트

Kimi Work: 지식 노동자를 위한 차세대 데스크톱 AI 에이전트

로컬 파일 연결, 브라우저 자동화, 백그라운드 코드 실행, 예약 작업을 묶은 데스크톱 AI 에이전트. 내장 Cron 엔진으로 Python·Shell 작업과 LLM 호출을 정기 자동화.

165
GeekNewsAI/ML2026-07-21

Kimi K3·Qwen 3.8과 Anthropic의 잠재적 균열

Kimi K3·Qwen 3.8과 Anthropic의 잠재적 균열

Moonshot Labs의 Kimi K3와 Alibaba의 Qwen 3.8이 Anthropic Fable 5에 근접한 성능을 보인다는 관측이 나옴. 수주 내 가중치 공개가 예고되며 최첨단 모델 경쟁이 폐쇄형에서 개방형으로 더 확장되는 흐름.

166
GeekNewsAI/ML2026-07-20

Qwen 3.8 출시

Qwen 3.8 출시

Alibaba Qwen이 2.4조 파라미터 규모의 Qwen3.8을 출시했고, 오픈 웨이트도 곧 공개할 예정이라고 밝힘. 선도 프런티어 모델과의 호환성을 내세우며 현재 가장 강력한 모델 중 하나라고 소개함.

167
GeekNewsAI/ML2026-07-19

Fable 5 대 GPT-5.6 Sol: NP-난해 문제에서 /goal은 도움이 되는가?

Fable 5 vs. GPT-5.6 Sol: NP-난해 문제에서 /goal은 도움이 되는가?

비공개 광섬유망 최적화 문제를 30분씩 풀게 한 실험에서 Fable 5가 최고 점수와 가장 안정적인 성능을 보임. /goal은 일관된 향상을 만들지 못했고, 단순 연장보다 제어 루프와 탐색 경로에 영향을 주는 기능으로 해석됨.

168
GeekNewsSecurity2026-07-19

안녕히, 그동안의 모든 Bikeshed에 감사드립니다

안녕히, 그동안의 모든 Bikeshed에 감사드립니다

LLM 기반 코드 리뷰와 연령 확인이 FOSS의 미래를 바꿀 주요 요인으로 제시됨. 특히 연령 확인은 현재 형태의 FOSS 생태계를 끝내는 계기가 될 수 있다고 전망함.

169
GeekNewsAI/ML2026-07-19

Kimi K3의 순간

Kimi K3의 순간

일상적인 코딩 작업에서 Kimi K3와 Claude를 병행했을 때 출력 품질과 토큰 효율의 차이가 크지 않았다는 경험이 공유됨. Kimi K3는 입력 100만 토큰당 $3, 출력 $15로 Claude 상위 모델보다 비용이 크게 낮음.

170
GeekNewsAI/ML2026-07-19

AI 코드 검토가 타당한 반론이 될 수 없는 이유

AI 코드 검토가 타당한 반론이 될 수 없는 이유

LLM 코딩 도구의 오류를 사람이 전부 리뷰하면 된다는 주장은 코드 리뷰의 처리 한계를 무시한다는 비판. 효과적인 리뷰는 시간과 분량에 상한이 있어 품질과 생산성을 동시에 보장하기 어렵다는 점을 지적함.

171
GeekNewsDev/Tools2026-07-18

루프 안의 인간은 지쳤다

루프 안의 인간은 지쳤다

LLM 기반 프로그래밍은 생산성을 높이는 대신 개발자에게 지속적인 검토와 수정을 요구해 감독 피로를 키움. 그럴듯한 코드를 빠르게 만들어도 복잡한 변경의 의도와 품질을 인간이 끝까지 통제해야 하는 부담이 커짐.

172
GeekNewsAI/ML2026-07-18

Kimi K3와 Pelican 벤치마크에서 여전히 배울 수 있는 것

Kimi K3와 펠리컨 벤치마크에서 여전히 배울 수 있는 것

Moonshot AI의 Kimi K3는 2.8조 매개변수의 최신 모델로, 자체 벤치마크에서 일부 경쟁 모델을 앞섬. 다만 공개 벤치마크 해석에는 한계가 있어 성능 비교를 그대로 받아들이기보다 평가 방식까지 함께 봐야 함.

173
GeekNewsAI/ML2026-07-18

LLM 비판론자들이 옳다. 그래도 나는 LLM을 쓴다

LLM 비판론자들이 옳다. 그래도 나는 LLM을 쓴다

저작권·환경·윤리 문제와 저품질 산출물, 오픈소스 신뢰 약화, 주니어 육성 저하, 지정학적 종속 문제를 인정하면서도 LLM을 사고를 증폭하는 도구로 계속 활용함. 사람의 판단이 없으면 유창한 쓰레기를 대량 생산하지만, 충분한 사유와 함께 쓰면 작업 품질을 높인다는 주장.

174
GeekNewsAI/ML2026-07-18

2026년 7월 오픈소스 AI 현황

2026년 7월 오픈소스 AI 현황

오픈 웨이트 모델이 코딩, 지시 이행, 일반 지식에서 폐쇄형 모델과 비슷한 수준에 도달함. 추론 비용 하락과 함께 경쟁 중심이 모델 성능에서 에이전트 하네스로 이동 중.

175
GeekNewsDev/Tools2026-07-18

결함투성이 탑, 바이브 멀미, 그리고 바이브 봅슬레이

결함투성이 탑, 바이브 멀미, 그리고 바이브 봅슬레이

LLM이 만든 코드를 이해하지 못한 채 다시 LLM에 해석을 맡기는 개발 방식이 확산되고 있음. 에이전트 엔지니어링과 바이브 코딩의 경계가 빠르게 흐려지는 흐름을 짚음.

176
GeekNewsAI/ML2026-07-17

커널 개발에서 LLM 사용에 대한 Linus Torvalds의 견해

커널 개발에서 LLM 사용에 관한 Linus Torvalds의 견해

Linux 커널은 반AI 프로젝트가 아니며, LLM도 다른 도구처럼 유용할 수 있다는 입장. 최상위 메인테이너로서 AI 혐오를 이유로 도구 자체를 배척하지 않겠다는 메시지.

177
GeekNewsAI/ML2026-07-16

Kimi K3 공개 - 개방형 프론티어 인텔리전스

Kimi K3 공개 - 개방형 프론티어 인텔리전스

2.8조 파라미터, 네이티브 비전, 100만 토큰 컨텍스트를 갖춘 공개 3T급 모델. 장시간 코딩, 지식 작업, 추론용으로 Kimi Delta Attention과 Stable LatentMoE를 적용.

178
GeekNewsAI/ML2026-07-16

ChatGPT는 실제로 어떻게 출처를 고르는가 (네트워크 트래픽 분석)

ChatGPT는 실제로 어떻게 출처를 고르는가 (네트워크 트래픽 분석)

로그인된 Pro 계정의 네트워크 트래픽을 분석해 ChatGPT의 출처 파이프라인과 검색 동작을 추적한 사례. 최종 답변만으로는 보이지 않는 질의 분류, 검색어, 실행 모델 정보가 브라우저 JSON에서 드러남.

179
GeekNewsAI/ML2026-07-16

Databricks가 자체 코딩 AI 벤치마크를 만든 방법과 결과

Databricks가 자체 코딩 AI 벤치마크를 만든 방법과 결과

공개 벤치마크의 치팅 가능성과 상황 불일치를 피하려고 실제 업무 과제로 자체 벤치마크를 구성. GLM 5.2는 최고 난도 과제에서 Opus 4.8급 성능을 보였고 비용은 더 낮았다.

180
GeekNewsAI/ML2026-07-14

Show GN: Brain-AI Memory – 장기 실행 LLM 에이전트의 메모리 실패를 진단하는 오픈 아키텍처

Show GN: Brain-AI Memory – 장기 실행 LLM 에이전트의 메모리 실패를 진단하는 오픈 아키텍처

장기 실행 LLM 에이전트의 기억 오류를 단순 retrieval 문제로 보지 않고 구조적으로 진단하는 오픈 아키텍처를 제안함. episodic, semantic, procedural memory와 실행 루프를 분리해 실패 원인을 추적하는 접근을 설명함.

181
GeekNewsGeneral Tech2026-07-14

Human Emacs

Human Emacs

LLM 생성 기여를 받지 않는 Emacs 사용과 개발을 지지하는 참여자들의 선언임. GNU Emacs의 현재 금지는 GNU 공통 정책이 확정될 때까지의 임시 조치로 설명됨.

182
GeekNewsSecurity2026-07-13

Anubis는 실제로 누구를 막는가?

Anubis는 실제로 누구를 막는가?

HTTP 접근 전에 작업 증명(Proof-of-Work)을 요구하는 Anubis가 AI 스크레이퍼보다 일반 사용자, 저사양 기기, JavaScript 미지원 클라이언트에 더 큰 비용을 부과함. LLM 기반 anubis-fetch는 작업 증명을 풀고 필요하면 Chromium까지 실행함.

183
GeekNewsAI/ML2026-07-13

LLM은 사랑하지만 과대광고는 싫다

LLM은 사랑하지만 과대광고는 싫다

LLM, 자율주행, 영상 생성, 코딩 에이전트의 실용성은 인정하지만 이를 둘러싼 공포와 종말론적 과대광고에는 선을 긋는 글. 기회를 놓치면 영구적 하층민이 된다는 식의 서사는 불안을 자극하는 마케팅으로 본다는 점을 지적함.

184
GeekNewsAI/ML2026-07-12

Mesh LLM - iroh 기반 분산 AI 컴퓨팅

Mesh LLM - iroh 기반 분산 AI 컴퓨팅

iroh를 기반으로 여러 머신의 GPU와 메모리를 하나의 자원처럼 묶어 LLM을 분산 실행하는 방식을 제안함. OpenAI 호환 API로 로컬 실행, 피어 전달, 모델 분할 추론을 지원.

185
GeekNewsAI/ML2026-07-12

GPT-5.6, Grok 4.5, Claude, Muse Spark로 동일한 앱 4개를 만든 결과

GPT-5.6, Grok 4.5, Claude, Muse Spark로 동일한 앱 4개를 만든 결과

12개 모델로 Raycaster 미로, 3D Rubik's Cube, 계산기, Conway's Game of Life를 구현하게 한 벤치마크 결과를 공개했다. 복잡한 과제에서는 GPT-5.6 Sol과 Claude Fable 5가 선두를 나눴고, 시도 횟수당 성공률·비용·시간도 함께 비교됐다.

186
GeekNewsSecurity2026-07-11

AI 스크레이퍼 공격으로 유지가 어려워지는 개방형 웹

AI 스크레이퍼 공격으로 유지가 어려워지는 개방형 웹

LLM 훈련용 웹 스크레이핑이 1년 넘게 증가하며 독립 웹사이트의 트래픽 부담이 급증. 주거용 프록시와 분산 기기로 차단을 회피해 개방성 유지가 더 어려워짐.

187
GeekNewsDev/Tools2026-07-11

사람이 유지보수할 것처럼 코드를 작성하라

사람이 유지보수할 것처럼 코드를 작성하라

LLM이 코드를 대신 작성해도 중복 조건문과 임시 구현을 그대로 병합하면 이후 생성 코드까지 나쁜 관행을 학습할 수 있음. 접근 제어 같은 핵심 로직은 route handler, background job, API endpoint, webhook 전반에서 일관된 구조로 유지해야 함.

188
GeekNewsAI/ML2026-07-11

fenic - 사람과 에이전트를 위한 시맨틱 DataFrames

fenic - 사람과 에이전트를 위한 시맨틱 데이터프레임(Semantic DataFrames)

PySpark와 SQL 스타일 연산에 LLM 호출용 시맨틱 연산자를 결합한 DataFrame 쿼리 엔진. 문서, 트랜스크립트, 로그 같은 비정형 데이터 처리를 함께 다룬다.

189
GeekNewsAI/ML2026-07-11

[pdf

[pdf] GPT-5.6 Sol Ultra가 제시한 사이클 이중 덮개 추측 증명

GPT-5.6 Sol Ultra가 제시한 사이클 이중 덮개 추측 증명] GPT-5.6 Sol Ultra가 사이클 이중 덮개 추측에 대한 증명을 제시한 PDF가 공유됐다. 수학 정리의 증명 과정과 모델의 추론 능력을 함께 조명하는 자료다.

190
GeekNewsAI/ML2026-07-10

Drew DeVault 인터뷰: AI 없는 Vim 버전

Drew DeVault는 Vim 8.x를 장기 유지보수하는Vim Classic을 포크해, LLM 보조 코드 없이 인간이 유지보수하는 안정적인 편집기를 만들려 함생성형 AI 거부는 단순 취향이 아니라실용·철학·윤리·정치의 문제이며, 특히 저작권 출처 확인과 FOSS 유지보수 책임을...

191
GeekNewsAI/ML2026-07-10

LLM 번아웃이 온 것 같아요

업무와 개인 작업에서Claude Code, Codex, ChatGPT, Gemini를 매일 쓰면서 몇 년 전보다 AI 생성 텍스트를 읽는 시간이 크게 늘어남개발 흐름은 직접 설계·구현하던 방식에서설계 설명 → LLM 코드 검토 → 직접 수정으로 바뀌었고, 낯선 영역에서도 더 쉽게 작...

192
GeekNewsAI/ML2026-07-09

Weave Router - 프롬프트마다 최적의 모델로 라우팅하는 에이전트용 모델 라우터

Weave Router - 프롬프트마다 최적의 모델로 라우팅하는 에이전트용 모델 라우터

Anthropic, OpenAI, Gemini를 단일 엔드포인트로 묶는 드롭인 프록시가 소개됨. 요청별로 최적 모델을 자동 선택해 라우팅하며, 엔드포인트 변경만으로 비용을 40~70% 줄일 수 있다고 설명함.

193
GeekNewsAI/ML2026-07-08

Kokoro로 로컬 CPU에서 고품질 TTS 실행하기

Kokoro로 로컬 CPU에서 고품질 TTS 실행하기

전용 GPU 없이도 로컬에서 실용적인 품질의 음성 합성이 가능하다는 내용. Kokoro는 작은 모델 크기에도 다국어와 여러 음성을 지원하며, CPU로 TTS를 처리해 GPU를 LLM 추론에 남길 수 있음.

194
GeekNewsGeneral Tech2026-07-08

코딩 배우기는 여전히 가치 있다

코딩 배우기는 여전히 가치 있다

LLM 시대에도 코딩은 취업 수단을 넘어 수학, 학습법, 창의적 표현을 익히는 매체로 남아 있음. 'learn to code'의 계층 이동 구호는 약해졌지만 코딩의 교육적 가치는 여전함.

195
GeekNewsAI/ML2026-07-07

AI 시대에 취미가 곧 비즈니스 기회가 되는 이유

AI 시대에 취미가 곧 비즈니스 기회가 되는 이유

LLM으로 지식노동의 진입장벽이 낮아지면서 경쟁력은 도메인 지식과 암묵지로 이동함. 개인 맥락 데이터보다 사람 의존도가 높은 분야가 더 강한 해자가 됨.

196
GeekNewsAI/ML2026-07-07

Fable이 reMarkable을 Harry Potter의 Tom Riddle 일기장으로 바꿈

Fable이 reMarkable을 Harry Potter의 Tom Riddle 일기장으로 바꿈

reMarkable Paper Pro에서 손글씨를 잠시 보였다가 사라지게 하고, 비전 LLM이 이를 읽어 다시 손글씨로 응답하는 앱이 소개됨. 입력 후 약 2.8초 유휴 상태에서 페이지를 PNG로 확정해 처리함.

197
GeekNewsAI/ML2026-07-07

GLM 5.2와 다가오는 AI 추론 마진 붕괴

GLM 5.2와 다가오는 AI 추론 마진 붕괴

오픈 웨이트 모델 GLM 5.2가 Opus·GPT급 에이전트 작업에 근접하며 폐쇄형 프런티어 모델의 추론 마진을 압박할 수 있음. AI 비용의 핵심이 학습비보다 수요에 따라 커지는 추론 비용으로 이동하고 있음.

198
GeekNewsAI/ML2026-07-06

Show GN: Fable5는 비싸지고, 로컬 GPU는 부족하다: LLM 하나를 Mac과 CUDA로 나눠 돌리는 DRIFT

Show GN: Fable5는 비싸지고, 로컬 GPU는 부족하다: LLM 하나를 Mac & CUDA로 나눠 돌리는 DRIFT

Fable5급 고성능 모델과 로컬 GPU 부족 문제를 배경으로, DRIFT가 하나의 LLM을 여러 개인 기기에 레이어 단위로 분산 실행하는 방식을 제안. Mac과 CUDA 장비를 함께 묶어 로컬 추론 부담을 나누는 오픈소스 프로젝트.

199
GeekNewsAI/ML2026-07-06

메모리를 아끼며 Cross Entropy Loss 계산하기

메모리 아끼면서 Cross Entropy Loss 계산하기

긴 컨텍스트와 큰 vocab을 쓰는 LLM 학습에서 LM head와 cross entropy가 메모리 병목이 되는 이유를 설명함. 128K context에서는 logits 텐서만으로도 수십 GB에 달해 OOM을 유발할 수 있음.

200
GeekNewsDev/Tools2026-07-05

더 나은 모델, 더 나빠진 도구

더 나은 모델, 더 나빠진 도구

Claude Opus 4.8과 Sonnet 5가 Pi의 edit 도구 스키마를 제대로 따르지 못해 호출이 거부된 사례를 다룸. 최신 모델이 특정 도구 스키마 준수에서 이전 모델보다 나쁜 동작을 보일 수 있음을 보여줌.