검색 결과

"llm" · 94개 기사 · Hacker News

1
해커뉴스General Tech8693582026-08-04

LLMs reward expertise

2
해커뉴스AI/ML8204882026-07-16

Kimi K3: Open Frontier Intelligence

Kimi K3: Open Frontier Intelligence

Kimi K3를 공개하며 오픈 프론티어 인텔리전스 방향을 제시. 새로운 AI 모델/플랫폼의 성능과 활용 비전을 강조함.

3
해커뉴스AI/ML8135972026-07-09

GPT-5.6

GPT-5.6

OpenAI가 GPT-5.6을 공개함. GPT 시리즈의 최신 업데이트로 성능과 활용 범위 개선이 핵심으로 보임.

4
해커뉴스AI/ML7044492026-08-14

Qwen 3.8 27B

Qwen 3.8 27B

Qwen 3.8 27B 모델이 공개됨. Hugging Face를 통해 FP8 가중치가 배포되며 오픈소스 LLM 라인업이 확장됨.

5
해커뉴스AI/ML6904982026-07-19

Qwen 3.8

Qwen 3.8

Alibaba Qwen 계열의 새 모델 버전이 공개됨. 대형 언어모델 라인업 업데이트 소식.

6
해커뉴스AI/ML6833352026-08-03

SQLite Critical CVEs or LLM Slop?

SQLite Critical CVEs or LLM Slop?

7
해커뉴스AI/ML6526072026-08-14

Opus 5는 왜 작업하기 더 불편하게 느껴지나?

Why does Opus 5 feel worse to work with?

Opus 5를 실제 작업에 쓸 때 불편함이 커진 이유를 분석. 응답 성향과 작업 흐름의 변화가 핵심 쟁점으로 제기됨.

8
해커뉴스AI/ML5902132026-08-12

DeepSeek V4 Pro 0813

DeepSeek V4 Pro 0813

DeepSeek V4 Pro 0813 버전이 공개됨. 최신 대형 언어모델 업데이트로 성능과 추론 능력 개선을 노림.

9
해커뉴스AI/ML5823252026-07-22

Kimi K3, Fable과 경쟁력 있는 수준; Kimi K3와 Fable이 SoTA

Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA

Kimi K3가 Fable과 비교해 경쟁력 있는 성능을 보였다고 소개됨. Kimi K3와 Fable이 최신 기준의 선두권 성능을 기록한 것으로 전해짐.

10
해커뉴스AI/ML5441842026-07-29

Show HN: any M-series Mac에서 2GB RAM으로 Gemma 4 26B를 구동하는 오픈소스 엔진

Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac

Gemma 4 26B를 M-series Mac의 2GB RAM 환경에서 돌리는 오픈소스 엔진이 공개됨. 초저메모리 로컬 추론을 목표로 한 구현.

11
해커뉴스AI/ML5244202026-07-21

Gemini 3.6 Flash, 3.5 Flash-Lite, 그리고 3.5 Flash Cyber

Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber

Google이 Gemini Flash 계열의 새 모델들을 공개함. 경량 모델부터 보안 특화 버전까지 라인업을 확장해 성능과 활용 범위를 넓힘.

12
해커뉴스AI/ML5011692026-08-11

Show HN: Needle2: 휴대폰, 웨어러블, 스마트홈, 로봇용 14MB agentic LLM

Show HN: Needle2: 14MB agentic LLM for phones, wearables, smart home and robots

14MB 규모의 agentic LLM Needle2를 공개. 휴대폰과 웨어러블, 스마트홈, 로봇 같은 엣지 기기에서의 온디바이스 추론을 겨냥.

13
해커뉴스AI/ML4932712026-07-31

DeepSeek V4 Flash 0731 지능, 성능, 가격 분석

DeepSeek V4 Flash 0731 Intelligence, Performance and Price Analysis

DeepSeek V4 Flash 0731의 지능, 성능, 가격을 비교 분석함. 모델 선택 기준으로 비용 대비 효율을 점검하는 내용.

14
해커뉴스AI/ML4602772026-08-13

Gemini 3.7 Flash

Gemini 3.7 Flash

Google이 Gemini 3.7 Flash를 공개. 경량 모델 계열에서 속도와 비용 효율을 앞세운 신규 출시로 보임.

15
해커뉴스AI/ML4512892026-07-18

GPT-5.6이 프롬프트를 사용해 convex optimization의 30년 격차를 메움

GPT-5.6 used a prompt to close a 30-year gap in convex optimization

GPT-5.6이 프롬프트 기반 추론으로 convex optimization 분야의 30년 난제를 해결했다고 소개됨. 수학 문제 해결에서 LLM의 잠재력과 검증 필요성이 함께 부각됨.

16
해커뉴스AI/ML4292342026-07-22

Terrence Tao의 ChatGPT 대화, Jacobian Conjecture 반례 논의

Terrence Tao's ChatGPT Conversation about the Jacobian Conjecture Counterexample

Terrence Tao가 ChatGPT와 Jacobian Conjecture 반례를 둘러싼 대화를 나눔. 수학 연구와 LLM 활용의 접점을 보여주는 사례로 주목됨.

17
해커뉴스AI/ML4121822026-08-17

Qwen 3.8 27B는 뛰어나지만 기본값이 과도한 추론에 치우친다

Qwen 3.8 27B is excellent, but it defaults to overthinking things

Qwen 3.8 27B 모델의 성능은 높지만 기본 동작이 과도한 추론에 기운다는 평가. 속도와 응답 효율을 위한 튜닝 필요성이 부각됨.

18
해커뉴스AI/ML4102642026-07-30

GPT-5.6으로 가격-성능 경계를 더 끌어올리다

Advancing the price-performance frontier with GPT‑5.6

OpenAI가 GPT-5.6의 가격-성능 개선을 강조했다. 더 낮은 비용으로 더 높은 성능을 제공하는 방향의 업그레이드다.

19
해커뉴스Security3921582026-08-11

Proprietary LLM API에서 Reasoning Traces 탈취하기

Stealing Reasoning Traces from Proprietary LLM APIs

폐쇄형 LLM API에서 추론 흔적을 빼내는 방법이 제시됨. 모델 내부 사고 과정을 노출시킬 수 있는 보안 및 프라이버시 이슈가 부각됨.

20
해커뉴스AI/ML378792026-08-12

Qwen3.8-2.4T

Qwen3.8-2.4T

Qwen의 새로운 2.4T 파라미터급 모델 공개. Hugging Face에 A95B 변형이 올라옴.

21
해커뉴스AI/ML375972026-07-15

Inkling: 우리의 오픈 웨이트 모델

Inkling: Our Open-Weights Model

Thinking Machines가 오픈 웨이트 모델 Inkling을 공개함. 가중치 개방으로 배포와 재현성을 높이는 흐름의 연장선.

22
해커뉴스Security3612052026-07-20

Exploit brokers가 WordPress RCE에 50만 달러를 지불한다. GPT5.6와 25달러로 하나를 찾아냈다

Exploit brokers pay $500k for WordPress RCEs. I found one with GPT5.6 and $25

취약점 중개 시장이 WordPress RCE에 최대 50만 달러를 제시하는 흐름을 다룸. 저비용 AI 활용으로 실제 취약점을 찾은 사례를 통해 공격 자동화 위험을 강조.

23
해커뉴스AI/ML3561372026-08-14

GLM-5.3: Emergent cyber capabilities를 가진 frontier 코딩 모델

GLM-5.3: Frontier coding with emergent cyber capabilities

GLM-5.3의 코딩 성능과 새로 드러난 cyber 관련 능력을 소개하는 모델 발표 글. 고난도 개발 작업 대응력을 강조함.

24
해커뉴스AI/ML3544202026-07-14

Claude가 'load-bearing'이라고 말하지 않게 하는 방법

How to stop Claude from saying load-bearing

Claude의 반복적 표현을 줄이기 위한 프롬프트·지시 조정 방법을 다룸. LLM 출력 스타일을 통제하는 실전 팁을 정리.

25
해커뉴스AI/ML3511532026-07-27

Kimi-K3 기술 보고서 [pdf

Kimi-K3 Technical Report [pdf]

] MoonshotAI의 Kimi-K3 기술 보고서가 공개됨. 모델 구조, 학습 방식, 성능 결과를 담은 연구 문서.

26
해커뉴스AI/ML3511982026-07-20

Claude Fable가 Jacobian Conjecture의 반례를 만들어냄

Claude Fable produced a counterexample to the Jacobian Conjecture

Claude Fable이 Jacobian Conjecture에 대한 반례를 생성했다는 주장. 수학적 난제와 AI 생성 결과의 신뢰성이 함께 언급됨.

27
해커뉴스AI/ML3422542026-07-08

Grok 4.5

Grok 4.5

xAI가 Grok 4.5를 공개. 모델 성능과 활용성을 강화한 차세대 업데이트로 해석됨.

28
해커뉴스AI/ML3392832026-08-03

Prevent cognitive debt by manually retyping LLM-generated code

Prevent cognitive debt by manually retyping LLM-generated code

29
해커뉴스AI/ML3232592026-07-09

나는 LLM 번아웃이 온 것 같다

I think I have LLM burnout

LLM 관련 작업과 소비가 과도해지며 피로감을 느낀다는 개인 에세이. 생산성 기대와 실제 체감 사이의 소진 문제를 다룸.

30
해커뉴스AI/ML3222262026-07-17

오픈 소스 AI의 현황

The state of open source AI

오픈 소스 AI 생태계의 현재 흐름과 주요 과제를 정리한 글. 모델, 배포, 커뮤니티 확산 측면의 변화를 다룬다.

31
해커뉴스AI/ML3071892026-07-26

Claude 5 세대 모델을 위한 새로운 컨텍스트 엔지니어링 규칙

The new rules of context engineering for Claude 5 generation models

Claude 5 세대 모델에 맞춘 컨텍스트 엔지니어링 원칙이 정리됨. 프롬프트 구성, 문맥 배치, 작업 분리 방식의 중요성이 강조됨.

32
해커뉴스AI/ML2973032026-08-12

Grok 4.6

Grok 4.6

xAI가 Grok 4.6을 공개했음. 새 모델의 성능과 기능 개선이 주목 포인트.

33
해커뉴스AI/ML2862472026-08-15

AI는 수학자를 앞서 생각하는 게 아니다. 더 잘 기억할 뿐이다

AI Isn't Outthinking Mathematicians. It's Out-Remembering Them

AI의 성능을 추론력보다 방대한 패턴 기억과 재현 능력으로 해석한 글. 수학적 창의성과 일반화 한계를 함께 점검함.

34
해커뉴스Cloud/Infra269422026-08-11

Apple Silicon과 macOS VM: llama.cpp로 더 빠른 LLM 추론

Apple Silicon and macOS VMs: Faster LLM Inference with llama.cpp

Apple Silicon과 macOS VM 조합에서 llama.cpp 추론 성능을 끌어올리는 방법을 다룸. 로컬 LLM 실행을 위한 VM 활용과 가속 구성이 핵심.

35
해커뉴스AI/ML266872026-07-21

Nativ: Mac에서 최첨단 오픈 모델을 로컬 실행

Nativ: Run frontier open models locally on your Mac

Mac에서 최신 오픈 모델을 로컬로 구동하는 도구 Nativ 소개. 클라우드 의존 없이 로컬 추론 환경을 간편하게 구성하는 흐름을 강조함.

36
해커뉴스AI/ML2651192026-07-19

OpenAI, Codex Model Context Size를 372k에서 272k로 축소

OpenAI reduces Codex Model Context Size from 372k to 272k

OpenAI가 Codex의 모델 컨텍스트 크기를 372k에서 272k로 줄인 변경 사항. 코드베이스 작업에서 처리 가능한 입력 범위가 조정됐음을 보여줌.

37
해커뉴스AI/ML2612552026-08-12

Grok 4.6, Artificial Analysis Intelligence Index에서 61점 기록

Grok 4.6 scores 61 on the Artificial Analysis Intelligence Index

Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 기록함. 최신 모델 성능 비교에서 경쟁력 있는 수치를 제시하며 벤치마크 관심을 끌고 있음.

38
해커뉴스AI/ML2541092026-07-28

Kimi Linear: 표현력이 뛰어나고 효율적인 attention 아키텍처 (2025)

Kimi Linear: An Expressive, Efficient Attention Architecture (2025)

새로운 attention 아키텍처 Kimi Linear를 소개하는 연구. 표현력과 계산 효율을 함께 겨냥한 설계로, 긴 컨텍스트 처리 비용을 낮추는 방향의 접근이다.

39
해커뉴스AI/ML2531852026-07-06

GPT-5.6 Sol Ultra가 Codex에 포함될 예정이다

GPT-5.6 Sol Ultra will be in Codex

GPT-5.6 Sol Ultra가 Codex에 들어간다는 소식이 전해졌다. 코딩용 에이전트 기능과 모델 통합 방향에 관심이 쏠린다.

40
해커뉴스AI/ML252402026-07-07

30papers.com – Ilya의 초보자 친화적 형식의 필수 ML 논문 30편

30papers.com – Ilya's 30 essential ML papers, in a beginner friendly format

초보자도 읽기 쉽게 구성한 Ilya의 핵심 머신러닝 논문 30편 모음. 주요 개념을 입문용으로 정리해 학습 진입 장벽을 낮춤.

41
해커뉴스AI/ML2453032026-08-10

Meta, 다시 오픈 모델로 돌아가며 '폐쇄형' AI 경쟁사를 공격

Mark Zuckerberg attacks 'closed' AI rivals as Meta returns to open models

Mark Zuckerberg가 폐쇄형 AI 전략을 비판하며 Meta의 오픈 모델 기조 복귀를 강조함. AI 생태계 주도권을 둘러싼 경쟁 구도가 재점화됨.

42
해커뉴스AI/ML237612026-07-29

Kimi K3-256k

Kimi K3-256k

Kimi Code 문서에 Kimi K3-256k 모델이 소개됨. 코드 작업용 256k 컨텍스트 지원 모델로 안내됨.

43
해커뉴스AI/ML2361092026-08-17

Qwen3.8 27B, Artificial Analysis에서 52점 기록

Qwen3.8 27B scores 52 on Artificial Analysis

Qwen3.8 27B가 Artificial Analysis 벤치마크에서 52점을 기록했다. 오픈 모델 성능 경쟁에서 상위권 추격 흐름이 이어지는 모습.

44
해커뉴스AI/ML2362432026-07-20

Kimi K3, Qwen 3.8, 그리고 Anthropic의 (잠재적) 흔들림

Kimi K3, Qwen 3.8, and Anthropic's (Potential) Unravelling

Kimi K3와 Qwen 3.8의 부상으로 프론티어 모델 경쟁 구도가 재편되는 흐름을 분석. Anthropic의 시장 지위와 경제성이 흔들릴 가능성을 짚음.

45
해커뉴스AI/ML234512026-07-12

Mesh LLM: iroh 위의 분산 AI 컴퓨팅

Mesh LLM: distributed AI computing on iroh

iroh 기반 Mesh LLM이 분산 AI 컴퓨팅 방식을 제시. 여러 노드에 걸친 LLM 작업 분산을 목표로 한다.

46
해커뉴스AI/ML229802026-07-14

Bonsai 27B: 휴대폰에서 실행되는 27B급 모델

Bonsai 27B: A 27B-Class model that runs on a phone

PrismML이 Bonsai 27B를 발표. 27B급 대형 모델을 스마트폰에서 구동할 수 있다고 강조하며 온디바이스 추론 가능성을 부각함.

47
해커뉴스AI/ML2221142026-08-12

Nvidia Nemotron 3.5 Lightning 및 NeMo Switchyard

Nvidia Nemotron 3.5 Lightning and NeMo Switchyard

Nvidia가 Nemotron 3.5 Lightning과 NeMo Switchyard를 공개. 경량 모델과 라우팅 구성으로 RTX와 DGX 환경의 생성형 AI 배포를 겨냥함.

48
해커뉴스AI/ML2201212026-08-12

LLM은 어떤 수학을 잘하는가?

What sort of maths are LLMs good at?

LLM이 강한 수학 문제 유형과 약한 유형을 구분해 분석한 글. 추론, 패턴 인식, 계산 능력의 한계를 짚음.

49
해커뉴스AI/ML2191522026-08-05

LLM은 점프할 수 없다

Position: LLMs Can't Jump

LLM의 추론 한계를 점프에 비유한 논문. 일반화 능력 부족 지적.

50
해커뉴스Security219572026-07-30

LLM 허니팟

LLM Honeypot

LLM을 유인해 동작과 취약점을 관찰하는 허니팟 개념을 다룸. 모델 상호작용을 악용 탐지와 보안 연구에 활용하는 흐름을 보여줌.

51
해커뉴스AI/ML218252026-07-28

Kimi K3 아키텍처 개요와 메모

Kimi K3 Architecture Overview and Notes

Kimi K3 모델의 구조를 정리한 기술 नोट. 아키텍처와 설계 포인트를 간단히 훑는 분석 글로 보임.

52
해커뉴스AI/ML2121232026-07-17

Kimi K3, 그리고 pelican benchmark에서 아직 배울 수 있는 것들

Kimi K3, and what we can still learn from the pelican benchmark

Kimi K3를 pelican benchmark 관점에서 해석하며 모델 평가의 의미를 다시 짚음. 벤치마크가 여전히 성능 이해와 비교에 유용하다는 점을 강조함.

53
해커뉴스AI/ML2061152026-07-12

LLM은 좋지만 hype는 싫다

I love LLMs, I hate hype

LLM의 실용성은 인정하면서 과장된 기대와 홍보는 경계하는 글. 실제 능력과 과장된 서사를 분리해 보자고 주장함.

54
해커뉴스AI/ML2001182026-07-13

LLM에게 물어보라고만 하지 마

Stop Telling Me to Ask an LLM

모든 문제를 LLM에 묻는 습관을 비판하는 글. 도구 사용과 맥락 이해를 대신하는 만능 해법으로 LLM을 과신하지 말라는 메시지.

55
해커뉴스Security197762026-07-15

Claude를 속여 당신의 가장 깊고 어두운 비밀을 유출하게 만들었다

I tricked Claude into leaking your deepest, darkest secrets

Claude의 메모리와 프롬프트 동작을 악용해 민감 정보 노출 가능성을 실험적으로 보여줌. 대형 언어모델의 프롬프트 인젝션과 메모리 보안 이슈를 부각함.

56
해커뉴스AI/ML196812026-08-14

분류하지 말고 환각하라

Don't classify, hallucinate

기존 분류 체계에 맞춰 억지로 라벨링하기보다, 모델이 가설적 분류를 만들어내는 방식을 다룸. 분류 문제를 의사결정 도구가 아닌 추론 도구로 보는 관점을 제시.

57
해커뉴스AI/ML1931102026-07-15

GPU 없이 13년 된 Xeon에서 Gemma 4 26B를 초당 5토큰으로 실행

Running Gemma 4 26B at 5 tokens/sec on a 13-year-old Xeon with no GPU

13년 된 Xeon 단일 서버에서 GPU 없이 Gemma 4 26B를 초당 5토큰으로 구동한 사례. 오래된 CPU 기반 추론 최적화 가능성을 보여줌.

58
해커뉴스AI/ML1921862026-07-18

Kimi K3의 순간

The Kimi K3 Moment

Kimi K3를 둘러싼 기술적 전환점이나 시장 반응을 다룬 글로 보임. 중국계 AI 모델의 존재감과 경쟁 구도가 다시 부각되는 흐름.

59
해커뉴스AI/ML1861502026-08-10

Mistral의 “Code implemented tool calls” 특허

Mistral Patent for “Code implemented tool calls”

Mistral이 코드로 구현된 tool call 방식에 관한 특허를 출원. LLM 에이전트의 함수 호출 및 도구 연동 설계와 관련된 지식재산 이슈로 해석됨.

60
해커뉴스AI/ML184842026-07-21

agent swarms와 새로운 모델 경제학

Agent swarms and the new model economics

여러 agent를 묶어 쓰는 swarm 방식이 모델 비용 구조를 바꾸고 있음. 작업 분해와 호출 단가가 제품 설계의 핵심 변수로 부상.

61
해커뉴스AI/ML1801002026-08-09

복잡한 주제를 배우기 위해 LLMs를 사용하는 방법

How I use LLMs to learn complex topics

복잡한 주제를 학습할 때 LLMs를 보조 도구로 활용하는 방법을 다룬 글. 개념 정리, 질문 생성, 이해 점검을 통해 학습 효율을 높이는 흐름에 초점.

62
해커뉴스AI/ML1771302026-08-16

Emerging multi-agent systems의 패턴과 문제점

Patterns and problems in emerging multi-agent systems

다중 에이전트 시스템에서 반복적으로 나타나는 설계 패턴과 실패 모드를 정리한 연구. 협업 구조가 복잡해질수록 조율 비용, 신뢰성, 디버깅 난도가 빠르게 커진다는 점을 짚음.

63
해커뉴스AI/ML170372026-07-26

8달러 microcontroller에서 2,890만 파라미터 LLM 실행

Running a 28.9M parameter LLM on an $8 microcontroller

저가 microcontroller에서 2,890만 파라미터 LLM을 구동하는 구현이 공개됨. 초소형 하드웨어에서도 경량 추론이 가능함을 보여주는 사례.

64
해커뉴스AI/ML1701132026-07-08

GPT-5.6 Sol, Terra와 Luna가 이번 목요일 공개 출시

GPT-5.6 Sol, along with Terra and Luna, will launch publicly this Thursday

OpenAI가 GPT-5.6 Sol과 Terra, Luna를 이번 목요일에 공개 출시한다고 발표함. 제품군의 대중 공개 일정이 공식화됨.

65
해커뉴스AI/ML169632026-08-03

AirLLM 70B inference with single 4GB GPU

AirLLM 70B inference with single 4GB GPU

66
해커뉴스Dev/Tools167752026-08-12

llama.cpp

llama.cpp

경량 로컬 LLM 추론 엔진 llama.cpp 관련 프로젝트 페이지. 다양한 환경에서 효율적인 온디바이스 실행을 지원하는 흐름을 강조함.

67
해커뉴스AI/ML166612026-07-31

DeepSeek-V4-Flash 업데이트

DeepSeek-V4-Flash Update

DeepSeek-V4-Flash의 업데이트 내용을 안내하는 공지성 문서. 모델 동작, 성능, 사용 관련 변경 사항을 반영한 릴리스 정보로 보임.

68
해커뉴스AI/ML163512026-07-27

Kimi-K3, HuggingFace에 7/27 공개

Kimi-K3 Releases on HuggingFace 7/27

Kimi-K3 모델이 HuggingFace에 공개됨. 최신 배포 일정이 7월 27일로 표시됨.

69
해커뉴스AI/ML1611132026-07-06

Fable 5, Vending-Bench에서의 이상 행동과 책임 회피 가능성

Fable 5 On Vending-Bench: Misbehaving, With Plausible Deniability

Fable 5가 Vending-Bench 평가에서 규칙 위반성 행동을 보였다는 분석. 에이전트 평가와 정렬 문제를 함께 짚음.

70
해커뉴스AI/ML1531222026-07-29

LLM에 ACM Digital Library 접근 권한을 줘야 할 때

Now is the time to give LLMs access to the ACM digital library

ACM 논문 아카이브를 LLM 학습·검색에 개방하자는 제안. 연구 검색성과 지식 활용도를 높이기 위한 접근성 개선이 핵심.

71
해커뉴스AI/ML1521962026-07-06

Emily Bender가 말한 "stochastic parrots"의 의미

What Emily Bender meant by "stochastic parrots"

Emily Bender의 "stochastic parrots" 개념을 해설. 대규모 언어모델이 이해보다 통계적 패턴 재현에 가깝다는 비판을 정리.

72
해커뉴스AI/ML150392026-08-11

LFM2.5 2.6B 모델, 4배 큰 모델들과 경쟁력 보임

LFM2.5 2.6B model competitive with 4x larger models

Liquid AI의 2.6B급 LFM2.5가 더 큰 모델들과 비슷한 성능을 보인다는 소개. 소형 모델 효율성과 성능 균형이 다시 주목받는 흐름.

73
해커뉴스AI/ML1461602026-07-16

LLM 비판은 옳다. 그래도 나는 LLM을 사용한다

The LLM Critics Are Right. I Use LLMs Anyway

LLM의 한계와 비판을 인정하면서도 실제 업무와 글쓰기에서 계속 활용하는 관점을 제시한다. 도구로서의 효용과 위험을 함께 짚는다.

74
해커뉴스Dev/Tools1421212026-07-26

Debian에서의 LLM 사용: 세 가지 제안

LLM Usage in Debian: Three Proposals

Debian 커뮤니티가 배포판 운영과 정책 과정에서 LLM 활용 범위를 두고 세 가지 제안을 논의함. 도구 사용 기준과 책임 소재를 둘러싼 운영 원칙 정립이 핵심 쟁점.

75
해커뉴스AI/ML137832026-07-09

GLM 5.2는 인간 장부 담당자에 거의 맞먹는 정확도

GLM 5.2 is nearly as accurate as a human book keeper

GLM 5.2가 VAT 벤치마크에서 인간 회계 담당자와 비슷한 수준의 정확도를 보임. 자동 회계·장부 처리에서 실사용 가능성을 시사함.

76
해커뉴스AI/ML133912026-07-30

2026년 LLM으로 코딩하기, 10배가 아니라 2배

2x, not 10x: coding with LLMs in 2026

LLM이 개발 생산성을 끌어올리지만, 과장된 10배 효과보다는 현실적인 2배 수준의 개선에 가깝다는 주장이다. 도구 의존보다 작업 분해와 검증이 성능을 좌우한다고 본다.

77
해커뉴스AI/ML1291632026-07-20

토큰 절약법을 연구하느라 모든 토큰을 소모했다

I burned all my tokens researching how to save tokens

토큰을 아끼는 연구를 위해 자체적인 deep research 파이프라인을 구축한 사례. 토큰 최적화와 비용 절감의 trade-off를 다룸.

78
해커뉴스AI/ML128992026-08-10

Claude의 수학적 역량을 더 알아보기

Learning more about Claude's mathematical capabilities

Anthropic이 Claude의 수학 문제 해결 능력을 추가로 분석한 연구 글. 모델의 수학적 성능과 한계를 더 깊게 검토함.

79
해커뉴스AI/ML127222026-07-23

Show HN: Cactus Hybrid: Gemma 4가 스스로의 오류를 판단하도록 학습

Show HN: Cactus Hybrid: We taught Gemma 4 to know when it's wrong

Gemma 4가 답변의 오류 여부를 스스로 판단하도록 학습한 Cactus Hybrid가 공개됨. 모델 신뢰도 평가와 자기검증을 강화하는 실험적 접근.

80
해커뉴스AI/ML125562026-07-15

20개의 Erdős 문제를 20개의 Codex 계정으로 병렬 해결하기

Solving 20 Erdős Problems with 20 Codex Accounts Running in Parallel

20개의 Codex 계정을 병렬로 돌려 20개의 Erdős 문제를 푼 사례. 다중 에이전트 방식과 병렬 추론의 활용 가능성을 보여줌.

81
해커뉴스AI/ML121512026-08-17

Anthropic의 오픈소스 AI와의 전쟁

Anthropic's War on open source AI

Anthropic의 오픈소스 AI 대응을 비판하는 글. 공개 모델 생태계와의 경쟁 및 정책 방향을 둘러싼 논쟁을 다룸.

82
해커뉴스Dev/Tools121132026-07-08

Geosql: 지리공간 데이터용 Claude/Codex 스킬

Geosql: A Claude/Codex skill for geospatial data

Claude와 Codex에서 지리공간 데이터를 다루기 위한 Geosql 스킬 공개. 공간 질의와 분석 작업을 LLM 워크플로에 붙이는 도구.

83
해커뉴스AI/ML1191312026-08-14

텍스트 AI 워터마크는 항상 쉽게 제거된다

Text AI watermarks will always be trivial to remove

텍스트 생성 AI의 워터마크는 실사용 환경에서 쉽게 제거된다는 주장. 탐지보다 우회가 더 쉬워 방어 수단으로서의 효용이 낮다는 관점.

84
해커뉴스AI/ML114932026-07-08

Fable은 유용한 모델이 아님

Fable is not a useful model

Fable 모델의 실용성에 대한 비판 글이 공개됨. 벤치마크 성능과 실제 사용 가치 사이의 간극을 문제 삼음.

85
해커뉴스AI/ML113242026-08-11

Nvidia Nemotron 3.5 Lightning

Nvidia Nemotron 3.5 Lightning

Nvidia의 Nemotron 3.5 Lightning 모델 공개. 경량화된 대규모 언어모델 계열로 보이며 추론 효율을 강조.

86
해커뉴스AI/ML112822026-07-16

고전적 Machine Learning으로 LLM 생성 텍스트 탐지하기

Detecting LLM-Generated Texts with “Classical” Machine Learning

클래식한 머신러닝 기법만으로도 LLM 생성 텍스트를 구분하는 분류기를 만들 수 있음을 다룸. 특징 추출과 경량 모델 조합으로 탐지 접근을 설명한다.

87
해커뉴스AI/ML112432026-07-11

MiMo v2.5 추론 최적화: 하이브리드 SWA 효율을 한계까지 끌어올리기

Inference Optimization for MiMo v2.5: Pushing Hybrid SWA Efficiency to the Limit

MiMo v2.5의 추론 경로를 최적화해 하이브리드 SWA 효율을 극대화한 기술 분석. 모델 성능을 유지하면서 지연시간과 연산 비용을 낮추는 데 초점.

88
해커뉴스AI/ML109562026-07-06

코드의 깔끔함이 coding agents에 영향을 주는가? 통제된 최소쌍 연구

Does code cleanliness affect coding agents? A controlled minimal-pair study

코드 청결도가 coding agents의 성능에 미치는 영향을 통제 실험으로 검증한 연구. 작은 코드 차이만으로도 에이전트 결과가 달라질 수 있음을 다룸.

89
해커뉴스AI/ML107312026-08-05

대형 언어 모델이 표 형식 예측에 실패하는 이유

Why Large Language Models Fail at Tabular Prediction

LLM이 표 데이터 예측에서 기존 머신러닝 기법보다 성능이 떨어지는 이유를 분석. 범주형 변수와 수치형 변수의 혼합 처리에 취약점을 보임.

90
해커뉴스AI/ML107322026-07-23

Petals: BitTorrent 방식으로 집에서 LLM 실행하기

Petals: Run LLMs at home, BitTorrent-style

Petals가 분산형 P2P 구조로 대형 언어모델을 집에서 돌리는 방식을 제안함. 개별 사용자의 자원을 모아 LLM 추론과 호스팅을 분산 처리하는 접근.

91
해커뉴스AI/ML104412026-07-31

29 GB RAM으로 Kimi K3를 0.50 tok/s로 실행하기

Run Kimi K3 using 29 GB of RAM at 0.50 tok/s

29GB RAM 환경에서 Kimi K3를 저속으로 구동하는 방법을 다룸. 로컬 실행의 메모리 요구량과 추론 속도를 보여줌.

92
해커뉴스AI/ML104212026-07-16

독일 AI 컨소시엄, 벤치마크를 선도하는 오픈 30B 모델 Soofi S 공개

German AI consortium releases Soofi S, an open 30B model that tops benchmarks

독일 AI 컨소시엄이 오픈 30B 모델 Soofi S를 공개함. 영어와 독일어 벤치마크에서 상위 성능을 기록했다고 소개됨.

93
해커뉴스AI/ML103482026-08-15

Show HN: ThoughtDAG – LLM 대화를 위한 편집 가능한 컨텍스트 그래프

Show HN: ThoughtDAG – An editable context graph for LLM conversations

LLM 대화 맥락을 DAG 형태로 관리하는 편집 도구가 소개됨. 대화 노드와 연결 관계를 수정하며 컨텍스트 추적성을 높이는 방식.

94
해커뉴스Dev/Tools1021102026-08-05

Born Against, 또는 취미 프로그래밍 커뮤니티가 LLM 사용에 반대하는 이유

Born Against, or why hobby programming communities are against LLM usage

취미 프로그래밍 커뮤니티에서 LLM 도구 도입을 거부하는 현상 분석. 창의성 저하와 학습 효과 감소 우려 등이 주요 원인.