검색 결과

"inference" · 139개 기사

1
해커뉴스AI/ML7893542026-06-16

로컬 모델 실행이 이제는 괜찮아짐

Running local models is good now

로컬 모델 실행 환경이 성숙해졌다는 평가. 성능과 사용성이 개선되며 실사용 기준에 가까워짐.

2
해커뉴스AI/ML6952882026-06-27

DSpark: Speculative decoding이 LLM 추론을 가속화한다 [pdf

DSpark: Speculative decoding accelerates LLM inference [pdf]

] speculative decoding을 활용해 LLM 추론 속도를 높이는 DSpark 연구를 소개. 지연 시간과 처리량 개선을 목표로 한 가속 기법을 제시.

3
해커뉴스AI/ML6392602026-06-01

10년 된 Xeon만으로 충분하다

A 10 year old Xeon is all you need

2016년형 Xeon에서 Gemma 4를 돌린 사례를 다룸. 구형 서버 CPU로도 최신 AI 추론이 가능하다는 점을 보여줌.

4
해커뉴스General Tech6294772026-08-07

AMD acquires Taalas to boost inference performance by etching models in silicon

AMD acquires Taalas to boost inference performance by etching models in silicon

5
해커뉴스AI/ML5441842026-07-29

Show HN: any M-series Mac에서 2GB RAM으로 Gemma 4 26B를 구동하는 오픈소스 엔진

Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac

Gemma 4 26B를 M-series Mac의 2GB RAM 환경에서 돌리는 오픈소스 엔진이 공개됨. 초저메모리 로컬 추론을 목표로 한 구현.

6
해커뉴스AI/ML4272922026-06-08

MiMo-v2.5-Pro-UltraSpeed: 초당 1000 토큰 처리하는 1T 모델

MiMo-v2.5-Pro-UltraSpeed: 1T model with 1000 tokens per second

Xiaomi가 MiMo-v2.5-Pro-UltraSpeed를 공개하며 초당 1000 토큰 처리 성능을 내세움. 1T 규모 모델의 고속 추론 경쟁을 강조한 발표.

7
해커뉴스AI/ML4253952026-06-29

로컬 개발을 위한 Qwen 3.6 27B가 적정 지점

Qwen 3.6 27B is the sweet spot for local development

Qwen 3.6 27B를 로컬 개발용으로 쓰기 좋은 균형점으로 평가. 성능과 실행 부담 사이의 타협안으로 주목.

8
해커뉴스AI/ML413932026-08-11

H3-metal – Apple Silicon용 네이티브 MiniMax-H3 추론

H3-metal – Native MiniMax-H3 inference for Apple Silicon

Apple Silicon에서 MiniMax-H3를 네이티브로 구동하는 추론 경로를 소개. Mac 로컬 환경에서의 AI 추론 성능 최적화 흐름에 초점.

9
해커뉴스AI/ML4121822026-08-17

Qwen 3.8 27B는 뛰어나지만 기본값이 과도한 추론에 치우친다

Qwen 3.8 27B is excellent, but it defaults to overthinking things

Qwen 3.8 27B 모델의 성능은 높지만 기본 동작이 과도한 추론에 기운다는 평가. 속도와 응답 효율을 위한 튜닝 필요성이 부각됨.

10
해커뉴스AI/ML4102642026-07-30

GPT-5.6으로 가격-성능 경계를 더 끌어올리다

Advancing the price-performance frontier with GPT‑5.6

OpenAI가 GPT-5.6의 가격-성능 개선을 강조했다. 더 낮은 비용으로 더 높은 성능을 제공하는 방향의 업그레이드다.

11
해커뉴스AI/ML3911232026-05-05

OpenAI가 대규모에서 저지연 음성 AI를 제공하는 방법

How OpenAI delivers low-latency voice AI at scale

OpenAI의 음성 AI 저지연 처리 구조를 설명하는 글. 대규모 실시간 음성 상호작용을 위해 지연을 줄이는 시스템 설계가 핵심.

12
해커뉴스AI/ML378792026-08-12

Qwen3.8-2.4T

Qwen3.8-2.4T

Qwen의 새로운 2.4T 파라미터급 모델 공개. Hugging Face에 A95B 변형이 올라옴.

13
해커뉴스AI/ML3762362026-07-07

GLM 5.2와 다가오는 AI 마진 붕괴

GLM 5.2 and the coming AI margin collapse

GLM 5.2를 계기로 AI 서비스의 수익성 압박을 분석함. 모델 경쟁 심화와 비용 구조 악화가 마진 붕괴로 이어질 수 있다는 전망.

14
해커뉴스AI/ML3631582026-06-23

GLM-5.2 로컬 실행 방법

GLM-5.2 – How to Run Locally

GLM-5.2 모델을 로컬에서 실행하는 방법을 정리한 글. 설치와 실행 환경 구성에 초점이 맞춰짐.

15
해커뉴스AI/ML3531572026-05-05

Gemma 4 가속화: multi-token prediction drafters로 더 빠른 추론

Accelerating Gemma 4: faster inference with multi-token prediction drafters

Google이 Gemma 4 추론 속도를 높이는 multi-token prediction drafters를 소개. 디코딩 병목을 줄여 지연시간과 처리량 개선을 노림.

16
해커뉴스AI/ML339872026-08-04

DeepSeek V4 Flash, 단일 AMD MI300X에서 실행

DeepSeek V4 Flash on a Single AMD MI300X

DeepSeek V4 Flash 모델을 AMD MI300X GPU 단일 장치에서 실행하는 데 성공. 최적화 기법과 벤치마크 결과 공개.

17
해커뉴스AI/ML285882026-05-11

24GB 메모리의 M4에서 local models 실행하기

Running local models on an M4 with 24GB memory

Apple M4와 24GB 메모리 환경에서 로컬 모델 구동 경험을 정리한 글. 온디바이스 추론의 현실적인 한계와 활용 가능성을 다룸.

18
해커뉴스AI/ML2831092026-08-13

GPT-5.6 Sol을 ultrafast로 가속

Accelerating GPT-5.6 Sol Ultrafast

Cerebras가 OpenAI의 GPT-5.6 Sol을 초고속 추론 경로로 가속하는 내용을 공개. 대형 모델 응답 지연을 줄이는 인프라 최적화가 핵심.

19
해커뉴스AI/ML2833722026-06-24

AI의 감당 가능성 위기

AI's Affordability Crisis

AI 사용 비용이 빠르게 쌓이면서 도입 장벽이 높아지고 있음. 대규모 모델 활용에서 비용 구조 재검토가 필요하다는 문제의식이 제기됨.

20
해커뉴스AI/ML2741132026-07-28

DeltaNet 계열 선형 어텐션 변형 살펴보기

A walk through of the DeltaNet family of linear attention variants

DeltaNet 계열의 선형 어텐션 변형을 단계적으로 설명. 긴 컨텍스트 효율성과 구조적 차이를 중심으로 정리.

21
해커뉴스Cloud/Infra269422026-08-11

Apple Silicon과 macOS VM: llama.cpp로 더 빠른 LLM 추론

Apple Silicon and macOS VMs: Faster LLM Inference with llama.cpp

Apple Silicon과 macOS VM 조합에서 llama.cpp 추론 성능을 끌어올리는 방법을 다룸. 로컬 LLM 실행을 위한 VM 활용과 가속 구성이 핵심.

22
해커뉴스AI/ML2672302026-05-17

Apple Silicon 비용이 OpenRouter보다 더 비쌈

Apple Silicon costs more than OpenRouter

오프라인 LLM 구동 시 Apple Silicon의 전력·운영 비용이 상용 API보다 높을 수 있음을 비교함. 로컬 추론의 경제성이 하드웨어 효율에 크게 좌우됨.

23
해커뉴스AI/ML266872026-07-21

Nativ: Mac에서 최첨단 오픈 모델을 로컬 실행

Nativ: Run frontier open models locally on your Mac

Mac에서 최신 오픈 모델을 로컬로 구동하는 도구 Nativ 소개. 클라우드 의존 없이 로컬 추론 환경을 간편하게 구성하는 흐름을 강조함.

24
해커뉴스AI/ML262492026-07-22

GigaToken: 약 1000배 더 빠른 언어 모델 토크나이제이션

GigaToken: ~1000x faster Language model tokenization

GigaToken이 기존보다 약 1000배 빠른 토크나이제이션을 내세움. 언어 모델 입력 전처리 병목을 크게 줄이려는 프로젝트.

25
해커뉴스AI/ML259852026-07-28

오픈 모델을 쓰는 경험은 놀라울 만큼 좋다

Using an open model feels surprisingly good

오픈 모델 사용 경험과 장점을 긍정적으로 평가. 로컬 실행성과 통제성, 비용 효율이 실제 사용 만족도를 끌어올린다는 관점.

26
해커뉴스AI/ML251212026-04-21

Kimi vendor verifier – 추론 제공자 정확도 검증

Kimi vendor verifier – verify accuracy of inference providers

Kimi가 추론 제공자별 응답 정확도를 검증하는 vendor verifier를 공개. 모델 호출 품질을 공급자 단위로 비교·점검하는 용도다.

27
해커뉴스AI/ML233512026-06-10

DiffusionGemma: 4배 더 빠른 텍스트 생성

DiffusionGemma: 4x Faster Text Generation

Google이 DiffusionGemma를 공개해 텍스트 생성 속도를 크게 끌어올림. 확산 모델 기반 접근으로 생성 효율 개선을 노림.

28
해커뉴스AI/ML229802026-07-14

Bonsai 27B: 휴대폰에서 실행되는 27B급 모델

Bonsai 27B: A 27B-Class model that runs on a phone

PrismML이 Bonsai 27B를 발표. 27B급 대형 모델을 스마트폰에서 구동할 수 있다고 강조하며 온디바이스 추론 가능성을 부각함.

29
해커뉴스AI/ML224712026-07-04

달러당 성능이 더 빠르고 저렴해지고 있다

Performance per dollar is getting faster and cheaper

GLM52와 AMD 조합을 중심으로 성능 대비 비용이 개선되는 흐름을 짚음. 더 빠른 처리 속도와 낮아진 단가가 함께 강조됨.

30
해커뉴스AI/ML2221142026-08-12

Nvidia Nemotron 3.5 Lightning 및 NeMo Switchyard

Nvidia Nemotron 3.5 Lightning and NeMo Switchyard

Nvidia가 Nemotron 3.5 Lightning과 NeMo Switchyard를 공개. 경량 모델과 라우팅 구성으로 RTX와 DGX 환경의 생성형 AI 배포를 겨냥함.

31
해커뉴스AI/ML220302026-06-10

Kolmogorov-Arnold Networks를 통한 FPGAs 기반 초고속 머신러닝

Ultrafast machine learning on FPGAs via Kolmogorov-Arnold Networks

Kolmogorov-Arnold Networks를 FPGA에 올려 초저지연·고처리량 머신러닝을 구현하는 방법을 소개. 하드웨어 가속으로 추론 성능을 끌어올리는 접근.

32
해커뉴스AI/ML216772026-05-31

로컬 디바이스용 1-Bit Bonsai Image 4B 이미지 생성

1-Bit Bonsai Image 4B Image Generation for Local Devices

로컬 디바이스에서 실행 가능한 4B급 이미지 생성 모델 1-Bit Bonsai Image 4B가 소개됨. 저비트 양자화로 온디바이스 활용성과 실행 효율을 강조.

33
해커뉴스AI/ML2141002026-07-03

Jamesob의 SOTA LLM 로컬 실행 가이드

Jamesob's guide to running SOTA LLMs locally

로컬 환경에서 최신 SOTA LLM을 실행하는 방법을 정리한 가이드. 설치, 모델 선택, 운영 팁을 통해 개인 장비에서의 추론 활용성을 높임.

34
해커뉴스AI/ML209412026-05-16

Orthrus-Qwen3: Qwen3에서 최대 7.8배 tokens/forward, 동일한 출력 분포

Orthrus-Qwen3: up to 7.8×tokens/forward on Qwen3, identical output distribution

Orthrus-Qwen3가 Qwen3에서 forward당 처리 토큰 수를 최대 7.8배까지 늘리면서 출력 분포를 동일하게 유지한다고 주장함. LLM 추론 효율 개선을 겨냥한 최적화 기법임.

35
해커뉴스AI/ML206482026-07-07

Ternlight – 브라우저에서 실행되는 7MB 임베딩 모델 (WASM)

Ternlight – 7 MB embedding model that runs in browser (WASM)

브라우저에서 WASM으로 동작하는 초경량 임베딩 모델을 공개. 로컬 추론과 클라이언트사이드 AI의 가능성을 넓힘.

36
해커뉴스Dev/Tools206652026-05-07

Metal용 DeepSeek 4 Flash 로컬 추론 엔진

DeepSeek 4 Flash local inference engine for Metal

Metal 기반 로컬 추론 엔진 ds4 공개. Apple Silicon 환경에서 DeepSeek 4 Flash를 로컬로 실행하는 구현.

37
해커뉴스AI/ML196812026-08-14

분류하지 말고 환각하라

Don't classify, hallucinate

기존 분류 체계에 맞춰 억지로 라벨링하기보다, 모델이 가설적 분류를 만들어내는 방식을 다룸. 분류 문제를 의사결정 도구가 아닌 추론 도구로 보는 관점을 제시.

38
해커뉴스AI/ML1931102026-07-15

GPU 없이 13년 된 Xeon에서 Gemma 4 26B를 초당 5토큰으로 실행

Running Gemma 4 26B at 5 tokens/sec on a 13-year-old Xeon with no GPU

13년 된 Xeon 단일 서버에서 GPU 없이 Gemma 4 26B를 초당 5토큰으로 구동한 사례. 오래된 CPU 기반 추론 최적화 가능성을 보여줌.

39
해커뉴스AI/ML189882026-05-29

표준 GPU에서 실시간 LLM 추론: 요청당 3k tokens/s

Real-time LLM Inference on Standard GPUs: 3k tokens/s per request

표준 GPU로도 실시간 LLM 추론을 고속 처리하는 방법을 제시. 요청당 초당 3천 토큰 수준의 처리 성능이 핵심.

40
해커뉴스AI/ML188972026-05-10

로컬 AI가 표준이 되어야 함

Local AI needs to be the norm

AI 실행을 클라우드가 아닌 로컬 환경 중심으로 전환해야 한다는 주장. 프라이버시와 비용, 지연시간 측면의 이점을 강조함.

41
해커뉴스AI/ML1872712026-07-10

Apple Silicon 임원이 설명하는 Mac mini AI 수요와 온디바이스 미래

Apple Silicon Exec Explains Mac Mini AI Demand and On-Device Future

Mac mini에 대한 AI 수요가 급증한 배경과 Apple Silicon의 역할을 다룸. 온디바이스 AI가 앞으로의 핵심 방향으로 제시됨.

42
해커뉴스AI/ML183702026-05-30

Liquid AI, 38T로 학습한 8B-A1B MoE 공개

Liquid AI reveals 8B-A1B MoE trained on 38T

Liquid AI가 8B-A1B MoE 모델을 공개함. 38T 토큰으로 학습한 대규모 언어 모델로 소개됨.

43
해커뉴스AI/ML1771142026-06-11

DeepSeek 관련 메모

Notes on DeepSeek

DeepSeek에 대한 관찰과 메모를 정리한 글. 모델 성능, 비용 효율, AI 업계 파급 효과를 다룸.

44
해커뉴스AI/ML172662026-07-03

코드를 이미지로 바꿔 OCR하게 해 Fable 비용 60% 절감

60% Fable cost cut by converting code to images and having the model OCR it

코드를 텍스트로 직접 넣는 대신 이미지로 변환해 모델이 OCR하도록 바꾸며 추론 비용을 60% 줄인 사례. 입력 형식 최적화만으로 비용 효율을 크게 높일 수 있음을 보여줌.

45
해커뉴스AI/ML172452026-05-16

Δ-Mem: 대규모 언어 모델을 위한 효율적 온라인 메모리

Δ-Mem: Efficient Online Memory for Large Language Models

대규모 언어 모델에 적용하는 효율적인 온라인 메모리 기법을 제안. 장기 문맥 유지와 추론 효율 개선을 목표로 함.

46
해커뉴스AI/ML170372026-07-26

8달러 microcontroller에서 2,890만 파라미터 LLM 실행

Running a 28.9M parameter LLM on an $8 microcontroller

저가 microcontroller에서 2,890만 파라미터 LLM을 구동하는 구현이 공개됨. 초소형 하드웨어에서도 경량 추론이 가능함을 보여주는 사례.

47
해커뉴스AI/ML169632026-08-03

AirLLM 70B inference with single 4GB GPU

AirLLM 70B inference with single 4GB GPU

48
해커뉴스Dev/Tools167752026-08-12

llama.cpp

llama.cpp

경량 로컬 LLM 추론 엔진 llama.cpp 관련 프로젝트 페이지. 다양한 환경에서 효율적인 온디바이스 실행을 지원하는 흐름을 강조함.

49
해커뉴스AI/ML156542026-06-13

RTX 5080와 RTX 3090 세팅: Qwen 3.6 27B Q8에서 80 tok/s

RTX 5080 and RTX 3090 Setup: 80 Tok/s on Qwen 3.6 27B Q8

RTX 5080과 RTX 3090 조합으로 Qwen 3.6 27B Q8 추론에서 초당 80 토큰 속도를 기록. 하드웨어 세팅과 성능 벤치마크를 공유한 글.

50
해커뉴스AI/ML1451842026-06-29

Tokenmaxxing은 죽었다, Tokenmaxxing 만세

Tokenmaxxing is dead, long live tokenmaxxing

AI 에이전트 시대의 토큰 최적화 담론이 다시 정리됨. 단순한 토큰 절약을 넘어 실제 성능과 비용의 균형이 핵심으로 부각됨.

51
해커뉴스AI/ML143362026-05-03

Show HN: Apple의 SHARP를 ONNX Runtime Web로 브라우저에서 실행

Show HN: Apple's SHARP running in the browser via ONNX runtime web

Apple의 SHARP 모델을 ONNX Runtime Web으로 브라우저에서 구동하는 데모. 로컬 웹 환경에서 머신러닝 추론을 실행하는 구현 사례.

52
해커뉴스Dev/Tools138122026-05-30

Show HN: Tiny-vLLM – C++와 CUDA 기반 고성능 LLM 추론 엔진

Show HN: Tiny-vLLM – high performance LLM inference engine in C++ and CUDA

C++와 CUDA로 구현한 Tiny-vLLM이 소개됨. LLM 추론 성능을 높이기 위한 경량 엔진을 목표로 함.

53
해커뉴스AI/ML138402026-04-21

Ternary Bonsai: 1.58비트에서의 최고 지능

Ternary Bonsai: Top Intelligence at 1.58 Bits

극저비트 표현을 활용해 지능형 시스템의 효율과 성능을 탐구하는 제안. ternary 표현으로 모델 압축과 추론 효율을 노린다.

54
해커뉴스AI/ML135282026-06-07

추측적 KV 코딩: KV 캐시를 최대 약 4배 무손실 압축

Speculative KV coding: losslessly compressing KV cache by up to ~4×

LLM 추론의 KV 캐시를 무손실로 최대 약 4배 압축하는 기법을 제안함. 저장 공간과 메모리 대역폭 부담을 줄여 추론 효율 개선을 노림.

55
해커뉴스AI/ML1321242026-06-25

오픈 웨이트 모델의 견디기 힘든 저렴함

The unbearable cheapness of open weight models

오픈 웨이트 모델의 사용 비용이 예상보다 빠르게 낮아지며 고성능 모델 접근성이 크게 넓어짐. 모델 경쟁의 중심이 가격보다 배포, 운영, 제품화로 이동하는 흐름.

56
해커뉴스AI/ML132132026-06-05

Huawei의 vLLM용 KV-cache 양자화 네이티브 백엔드 KVarN

KVarN: Native vLLM backend for KV-cache quantization by Huawei

vLLM에서 KV-cache 양자화를 지원하는 네이티브 백엔드 KVarN을 소개. 메모리 사용량과 추론 효율 개선을 노린 구성.

57
해커뉴스AI/ML132202026-04-27

TurboQuant: 첫 원리부터 따라가는 해설

TurboQuant: A first-principles walkthrough

TurboQuant의 동작 원리를 기초부터 풀어쓴 기술 글. 모델 양자화와 추론 효율 개선을 이해하는 데 초점이 있다.

58
해커뉴스AI/ML131392026-07-21

단 한 번의 편집에는 frontier model 하나면 충분하다

You only need the frontier model for one single edit

작은 편집 작업에서도 고성능 frontier model이 필요한 지점을 짚음. 모델 선택을 작업 단위로 최적화하는 편집 워크플로를 제안.

59
해커뉴스AI/ML124262026-04-25

질문 8개로 만든 3D Body – 사진도, GPU도 없음

A 3D Body from Eight Questions – No Photo, No GPU

사진 없이 8개 질문만으로 3D 신체를 생성하는 방법을 소개. GPU 없이도 동작하는 경량 추정·생성 접근을 강조.

60
해커뉴스AI/ML122362026-07-07

불안정한 네트워크 환경에서 Small AI Models가 주목받다

Small AI Models Gain Traction In places with unreliable networks

네트워크가 불안정한 환경에서 소형 AI 모델의 활용성이 부각됨. 연결 의존도를 낮춘 온디바이스·로컬 추론 수요가 커지는 흐름.

61
해커뉴스AI/ML121302026-04-21

Soul Player C64 - 1MHz Commodore 64에서 동작하는 실제 Transformer

Soul Player C64 – A real transformer running on a 1 MHz Commodore 64

1MHz Commodore 64에서 실제 Transformer를 구동한 프로젝트. 극도로 제한된 하드웨어에서의 추론 최적화와 모델 경량화가 핵심이다.

62
해커뉴스AI/ML120502026-06-17

SubQ 1.1 Small

SubQ 1.1 Small

SubQ 1.1 Small 기술 보고서. 소형 모델의 성능과 효율을 중심으로 한 업데이트를 다룸.

63
해커뉴스General Tech119202026-05-28

스트레스가 hippocampal의 겹치는 사건 통합과 memory inference를 방해한다

Stress disrupts hippocampal integration of overlapping events, memory inference

스트레스가 해마의 사건 통합과 기억 추론 능력을 저해한다는 연구 결과. 겹치는 경험을 연결해 의미를 추론하는 과정이 영향을 받음.

64
해커뉴스AI/ML118562026-07-23

Show HN: Echo – open-weight 모델로 Fable급 결과를 3분의 1 비용으로 구현

Show HN: Echo – Fable-level results at 1/3 the cost using open-weight models

Echo가 open-weight 모델 조합으로 Fable 수준의 결과를 더 낮은 비용에 제공한다고 소개. 생성형 AI 워크플로의 비용 최적화 가능성을 강조함.

65
해커뉴스AI/ML116542026-08-14

AI At Home 1부: 잡동사니 상자

AI At Home Part 1: A Box Of Scraps

가정용 환경에서 AI를 구축하는 과정을 다룬 연재의 첫 글. 제한된 자원과 임시 부품으로 시스템을 구성하는 접근을 소개함.

66
해커뉴스AI/ML116452026-06-02

MAI-Thinking-1

MAI-Thinking-1

Microsoft AI가 추론 중심 모델 MAI-Thinking-1을 공개. 복잡한 사고와 문제 해결 성능을 강조한 신규 모델 라인업.

67
해커뉴스General Tech115472026-08-03

Why we write our own C and C++ inference engines

Why we write our own C and C++ inference engines

68
해커뉴스AI/ML114232026-07-07

Kokoro로 로컬 CPU 친화적 고품질 TTS(Text-to-Speech)

Local, CPU-Friendly, High-Quality TTS (Text-to-Speech) with Kokoro

Kokoro는 로컬 CPU에서도 실행 가능한 고품질 TTS 모델로 소개됨. 경량 추론과 음성 품질의 균형이 핵심 포인트.

69
해커뉴스AI/ML113242026-08-11

Nvidia Nemotron 3.5 Lightning

Nvidia Nemotron 3.5 Lightning

Nvidia의 Nemotron 3.5 Lightning 모델 공개. 경량화된 대규모 언어모델 계열로 보이며 추론 효율을 강조.

70
해커뉴스AI/ML112102026-07-26

Inflect-Micro-v2: 936만 파라미터로 구현한 완전한 음성 모델

Inflect-Micro-v2: complete voice in 9.36M parameters

Inflect-Micro-v2가 936만 파라미터 규모에서 완전한 음성 기능을 구현한 모델로 소개됨. 초경량 음성 모델의 효율성과 품질 균형이 주목됨.

71
해커뉴스AI/ML112432026-07-11

MiMo v2.5 추론 최적화: 하이브리드 SWA 효율을 한계까지 끌어올리기

Inference Optimization for MiMo v2.5: Pushing Hybrid SWA Efficiency to the Limit

MiMo v2.5의 추론 경로를 최적화해 하이브리드 SWA 효율을 극대화한 기술 분석. 모델 성능을 유지하면서 지연시간과 연산 비용을 낮추는 데 초점.

72
해커뉴스AI/ML110152026-05-01

LLM용 고급 양자화 알고리즘

Advanced Quantization Algorithm for LLMs

Intel의 auto-round가 LLM 압축을 위한 고급 quantization 알고리즘을 제공함. 추론 효율을 높이고 모델 배포 비용을 줄이는 데 초점을 둠.

73
해커뉴스Cloud/Infra109202026-06-03

AMD MI300X에서 DeepSeek-V4-Flash 구동하기

Bringing Up DeepSeek-V4-Flash on AMD MI300X

AMD MI300X에서 DeepSeek-V4-Flash를 실제로 올리고 실행하는 과정을 다룸. 모델 포팅과 하드웨어 최적화 이슈를 중심으로 정리한 기술 글.

74
해커뉴스AI/ML106302026-08-05

Maple-Preview – iPhone에서 초당 120토큰을 처리하는 Ternary 20B MoE

Show HN: Maple-Preview – Ternary 20B MoE running at 120 tok/s on a iPhone

Maple-Preview 공개: 20B MoE 모델이 iPhone에서 120 tok/s로 동작. 삼진 가중치 사용.

75
해커뉴스Dev/Tools106522026-06-28

Wayfinder Router: 로컬과 호스팅 LLM 사이의 결정적 쿼리 라우팅

Wayfinder Router: deterministic routing of queries between local and hosted LLM

로컬 LLM과 호스팅 LLM 사이에서 쿼리를 규칙 기반으로 분기하는 라우터. 비용·지연시간·품질 기준에 따라 모델 선택을 자동화.

76
해커뉴스AI/ML104412026-07-31

29 GB RAM으로 Kimi K3를 0.50 tok/s로 실행하기

Run Kimi K3 using 29 GB of RAM at 0.50 tok/s

29GB RAM 환경에서 Kimi K3를 저속으로 구동하는 방법을 다룸. 로컬 실행의 메모리 요구량과 추론 속도를 보여줌.

77
해커뉴스AI/ML101332026-07-29

Kimi K3 자체 호스팅: 하드웨어 비용 20% 증가, 작업 해결률 20% 향상

Self-hosting Kimi K3: 20% more hardware cost, 20% better task resolution

Kimi K3를 자체 호스팅할 때 하드웨어 비용이 약 20% 늘어나는 대신 작업 해결률이 약 20% 개선된다는 분석. 운영 비용과 성능의 맞교환이 핵심.

78
해커뉴스AI/ML101122026-05-22

Multi-Stream LLMs: 프롬프트, 사고, I/O를 병렬화·분리하는 새 논문

Multi-Stream LLMs: new paper on parallelizing/separating prompts, thinking, I/O

프롬프트 처리, 추론, 입출력 흐름을 분리해 병렬화하는 LLM 아키텍처를 다룬 새 논문. 모델 실행 구조 최적화와 처리 효율 개선을 겨냥.

79
GeekNewsAI/ML2632026-04-20

로컬 LLM 생태계에는 Ollama가 필요하지 않다

로컬 LLM 생태계에는 Ollama가 필요하지 않다

Ollama가 초기에는 로컬 LLM 실행을 단순화했지만, 이후 출처 은폐와 클라우드 중심 전환으로 신뢰를 잃었다. 핵심 엔진 llama.cpp의 공로를 가리는 구조도 비판받고 있다.

80
GeekNewsAI/ML942026-04-23

vLLM Recipes 개편 - 모델+하드웨어 조합별 설정을 딸각 한방으로

vLLM Recipes 개편 - 모델+하드웨어 조합별 설정을 딸각 한방으로

vLLM Recipes가 개편돼 모델과 하드웨어 조합에 맞는 실행 설정을 인터랙티브하게 찾을 수 있게 됐다. 어떤 모델을 어떤 서버에서 돌릴지 빠르게 확인하는 용도다.

81
GeekNewsAI/ML922026-04-22

Google LiteRT-LM - 엣지 디바이스용 고성능 LLM 추론 프레임워크

Google LiteRT-LM - 엣지 디바이스용 고성능 LLM 추론 프레임워크

Google이 Android, iOS, 웹, 데스크톱, IoT 등 엣지 환경에서 동작하는 온디바이스 LLM 추론 엔진 LiteRT-LM을 공개했다. 프로덕션 수준 성능과 범용 배포를 목표로 한다.

82
GeekNewsAI/ML42026-04-27

Mixture of Experts(MoE)란 무엇인가 — DeepSeek이 왜 1.6조 파라미터인데 싸게 돌아가는지

Mixture of Experts(MoE)란 무엇인가 — DeepSeek이 왜 1.6조 파라미터인데 싸게 돌아가는지

MoE 구조가 모든 파라미터를 매번 쓰지 않고 일부 전문가만 활성화해 추론 비용을 줄이는 방식으로 설명됨. DeepSeek V4의 대규모 파라미터와 낮은 운용비의 배경을 풀어낸 글.

83
GeekNewsAI/ML312026-04-30

GLM-5 대규모 서비스 중 발견한 레이스 컨디션 버그 수정기 — Coding Agent 추론 인프라의 Scaling Pain

GLM-5 대규모 서비스 중 발견한 레이스 컨디션 버그 수정기 — Coding Agent 추론 인프라의 Scaling Pain

GLM-5 기반 Coding Agent를 대규모로 서비스하며 발견한 KV cache 레이스 컨디션 버그 2건의 재현과 수정 과정을 공유. 처리량 최적화와 추론 인프라 확장 과정의 병목도 정리.

84
GeekNewsAI/ML112026-04-24

DeepSeek V4: 100만 토큰 컨텍스트를 지원하는 고효율 대규모 언어 모델

DeepSeek v4 : 100만 토큰 컨텍스트를 지원하는 고효율 대규모 언어 모델

DeepSeek V4가 100만 토큰 컨텍스트와 MoE 구조를 제공하는 대규모 언어 모델로 공개. Pro와 Flash 두 버전으로 나뉘며 고효율 추론을 강조.

85
GeekNewsAI/ML2026-08-17

Qwen 3.8 27B는 뛰어나지만 기본 설정에서 추론 시간이 지나치게 김

Qwen 3.8 27B는 뛰어나지만 기본 설정에서 지나치게 오래 추론함

Alibaba Qwen 3.8 27B는 비전 기능, 262,144토큰 컨텍스트, 17GB 양자화 파일로 노트북에서도 코드 작성과 도구 호출, 이미지 분석을 수행함. 다만 기본 추론 강도 xhigh가 단순 요청에도 과도하게 작동해 응답 지연이 커짐.

86
GeekNewsAI/ML2026-08-15

Qwen3.8-27B, 17~19GB 메모리에서 4-bit 로컬 실행 가능

Qwen3.8-27B, 17~19GB 메모리에서 4-bit 로컬 실행 가능

Qwen3.8-27B가 Unsloth GGUF/NVFP4로 공개되며 개인 장비에서 4-bit 로컬 실행이 가능해짐. 비전, 추론, 256K 컨텍스트를 지원하고 YaRN으로 최대 1M 컨텍스트 확장도 가능.

87
GeekNewsCloud/Infra2026-08-14

GPT-5.6 Sol을 초당 750토큰으로 가속하는 Ultrafast Mode

GPT-5.6 Sol을 초당 750토큰으로 가속하는 Ultrafast Mode

Cerebras와 OpenAI가 API의 새 서비스 계층인 Ultrafast Mode를 일부 고객에게 제한 공개함. GPT-5.6 Sol에서 품질 저하 없이 초당 최대 750개 출력 토큰을 제공한다.

88
GeekNewsAI/ML2026-08-13

DeepSeek V4 Pro 0813

DeepSeek V4 Pro 0813

OpenRouter가 단일 공급자 호스팅 방식으로 제공. 실제 고객 기준 가중 평균 가격은 입력 100만 토큰당 $0.03508, 출력 $0.8697 수준.

89
GeekNewsAI/ML2026-08-13

Unsloth, Qwen3.8 2.4T를 397GB로 줄여 로컬 실행 지원

Unsloth, Qwen3.8 2.4T를 397GB로 줄여 로컬 실행 지원

Unsloth가 Qwen3.8-2.4T-A95B의 GGUF 양자화 모델과 로컬 실행 가이드를 공개. BF16 4.89TB 원본을 Dynamic 1-bit 기준 397GB까지 줄여 로컬 구동 장벽을 낮춤.

90
GeekNewsAI/ML2026-08-12

llama.cpp: 내 컴퓨터에서 실행하는 오픈소스 AI

llama.cpp: 내 컴퓨터에서 실행하는 오픈소스 AI

llama.cpp는 API 키와 텔레메트리 없이 로컬에서 AI 모델을 실행하는 오픈소스 런타임. 노트북부터 클러스터까지 같은 바이너리와 모델을 쓰며 다양한 CPU·GPU 환경에 맞게 최적화된다.

91
GeekNewsAI/ML2026-08-12

AI가 코드를 쓰는 시대, antirez는 왜 다시 C로 만드는가

AI가 코드를 쓰는 시대, antirez는 왜 다시 C로 만드는가

Redis 창시자 antirez가 Apple Silicon용 멀티모달 추론 엔진 H3-metal을 C, Objective-C, Metal로 구현해 공개함. 범용 프레임워크 대신 하드웨어와 모델 요구에 맞춘 저수준 구현을 택한 사례.

92
GeekNewsAI/ML2026-08-11

H3-metal - Mac용 MiniMax-H3 추론 엔진

H3-metal - Mac용 MiniMax-H3 추론 엔진

antirez의 h3.c를 기반으로 MiniMax-H3를 Apple Silicon Mac에서 네이티브로 실행하는 C/Objective-C/Metal 추론 엔진. 텍스트와 함께 영상·오디오 생성을 지원하며 M3 Max/M5 Max에 맞춰 최적화됨.

93
GeekNewsAI/ML2026-08-11

Apple Silicon macOS VM에서 llama.cpp LLM 추론 가속하기

Apple Silicon macOS VM에서 llama.cpp LLM 추론 가속하기

AppleVirtualization.framework의 가상 GPU가 보수적 Metal 기능만 노출해 llama.cpp가 느린 커널을 선택하던 문제를 우회해 최대 16.36배 가속. 게스트 프로세스 전용 호환성 계층으로 GPU 기능 판정을 바꾸는 방식.

94
GeekNewsAI/ML2026-08-10

Meta Muse Glimmer - 기기에서 실행하는 오픈 웨이트 30B 코딩 모델

Meta Muse Glimmer - 기기에서 실행하는 오픈 웨이트 30B 코딩 모델

Meta가 30B 파라미터의 로컬 에이전트 모델 Muse Glimmer를 Apache 2.0으로 공개함. 단일 소비자용 GPU가 있는 Mac과 PC에서 실행하도록 최적화됐으며 로짓 증류와 장문맥 학습, SFT, 온정책 증류를 사용함.

95
GeekNewsAI/ML2026-08-04

단일 AMD MI300X에서 DeepSeek V4 Flash 실행하기

단일 AMD MI300X에서 DeepSeek V4 Flash 실행하기

304B 파라미터 DeepSeek-V4-Flash-0731을 단일 AMD MI300X에서 운영하기 위한 구성과 패치 제공. 192GB HBM3에 가중치 적재.

96
GeekNewsCloud/Infra2026-07-31

가져갈 수 없는 세션: 추론 API가 만드는 새로운 종속성

가져갈 수 없는 세션: 추론 API가 만드는 새로운 종속성

추론 API가 암호화된 추론 결과와 압축 상태, 서브에이전트 메시지를 공급자 내부에 가두며 세션 이식성을 약화시키고 있음. 사용자는 완전한 대화 기록이 아니라 일부만 보이는 사본에 의존하게 되는 구조가 문제로 지적됨.

97
GeekNewsAI/ML2026-07-31

DeepSeek V4 Flash 0731의 지능·성능·가격 분석

DeepSeek V4 Flash 0731의 지능·성능·가격 분석

최대 추론 기준 AAII 50점으로 Kimi K3(max), GLM-5.2(max)에 이어 3위. 2,840억 파라미터 MoE 모델로 토큰당 130억 개만 활성화하며, 100만 토큰 컨텍스트와 저가 API 요금을 제공함.

98
GeekNewsAI/ML2026-07-31

Kimi K3 로컬 실행 가이드

Kimi K3 로컬 실행 가이드

Moonshot AI의 오픈 웨이트 모델 Kimi K3를 로컬에서 실행하는 방법을 다룸. 전체 2.8T 매개변수, 104B 활성 파라미터, 네이티브 비전, 100만 토큰 문맥을 지원하며 GGUF 양자화로 메모리 요구량을 낮춤.

99
GeekNewsAI/ML2026-07-30

GPT‑5.6, 가격 대비 성능의 한계를 확장

GPT‑5.6, 가격 대비 성능의 한계를 확장

OpenAI가 모델·추론 시스템·에이전트 하네스 효율 개선을 가격과 처리 속도에 반영해 기업용 AI의 단가 대비 성능을 끌어올림. 7월 30일부터 Luna와 Terra의 API 가격을 대폭 인하함.

100
GeekNewsAI/ML2026-07-29

TurboFieldfare - 모든 M 시리즈 Mac에서 Gemma 4 26B를 2GB RAM으로 실행하는 오픈소스 엔진

TurboFieldfare - 모든 M 시리즈 Mac에서 Gemma 4 26B를 2GB RAM으로 실행하는 오픈소스 엔진

Gemma 4 26B-A4B를 약 2GB 메모리로 구동해 8GB Apple Silicon Mac에서도 로컬 추론을 가능하게 함. 전체 모델을 상주시기보다 MoE 전문가 가중치를 SSD에서 스트리밍하는 방식으로 메모리 사용을 줄임.

101
GeekNewsAI/ML2026-07-29

Kimi K3 아키텍처 개요와 설계 노트

Kimi K3 아키텍처 개요와 설계 노트

Kimi Linear를 48B에서 2.8T로 확장한 프로덕션 모델 아키텍처를 정리. LatentMoE와 추론 효율 중심의 구조로 공개 가중치 모델 중 최대 규모를 지향.

102
GeekNewsAI/ML2026-07-29

Kimi Linear: 표현력과 효율을 높인 어텐션 아키텍처(2025)

Kimi Linear: 표현력과 효율을 높인 어텐션 아키텍처(2025)

Kimi Linear가 KDA와 MLA를 결합한 하이브리드 구조로 전체 MLA보다 더 나은 성능을 보였음. 단기·장기 문맥 처리와 강화학습 평가 전반에서 효율 개선을 확인함.

103
GeekNewsDev/Tools2026-07-28

오픈 모델이 예상 밖의 해방감을 준 이유

오픈 모델이 예상 밖의 해방감을 준 이유

opencode를 자체 추론 엔드포인트에 연결하자 데이터 흐름이 노트북과 개인이 소유한 인프라 안에 머물며 통제감이 커졌다는 경험담. Claude와 ChatGPT 같은 구독형 도구 대비 소유감과 자율성이 크게 체감됐다는 내용.

104
GeekNewsAI/ML2026-07-22

Laguna S 2.1 공개

Laguna S 2.1 공개

Poolside가 장기 작업과 추론 성능을 강화한 Laguna S 2.1을 공개함. 118B MoE 모델로 토큰당 8B 파라미터를 활성화하며, thinking과 no-thinking 모드 모두 최대 1M 토큰 컨텍스트를 지원함.

105
GeekNewsAI/ML2026-07-21

Nativ - Mac에서 프런티어급 오픈 모델 로컬 실행

Nativ - 프런티어급 오픈 모델을 Mac에서 로컬 실행

Apple Silicon Mac에서 오픈 AI 모델을 계정이나 클라우드 없이 로컬 실행하는 MIT 라이선스 앱. 하드웨어에 맞는 모델 추천과 로컬 응답 생성을 지원.

106
GeekNewsAI/ML2026-07-21

누가 중국 모델을 두려워하는가?

누가 중국 모델을 두려워하는가?

중국 오픈 웨이트 모델 Kimi K3가 최첨단 성능에 근접. AI 사업 경쟁력은 모델 개발비보다 정답 수준 지능을 제공하는 COGS와 토큰 효율에서 갈림.

107
GeekNewsAI/ML2026-07-20

Transcribe.cpp: 크로스 플랫폼 로컬 음성 인식 라이브러리

Transcribe.cpp: 크로스 플랫폼 로컬 음성 인식 라이브러리

ggml 기반 로컬 음성 인식 라이브러리로, Mac·Windows·Linux 앱에 최신 ASR 모델을 쉽게 내장하도록 설계됨. Vulkan·Metal·CUDA·TinyBLAS 가속을 지원하며 스트리밍과 배치 전사를 모두 처리함.

108
GeekNewsAI/ML2026-07-18

2026년 7월 오픈소스 AI 현황

2026년 7월 오픈소스 AI 현황

오픈 웨이트 모델이 코딩, 지시 이행, 일반 지식에서 폐쇄형 모델과 비슷한 수준에 도달함. 추론 비용 하락과 함께 경쟁 중심이 모델 성능에서 에이전트 하네스로 이동 중.

109
GeekNewsAI/ML2026-07-17

LM Studio Bionic: 오픈 모델을 위한 AI 에이전트

LM Studio Bionic: 오픈 모델을 위한 AI 에이전트

LM Studio Bionic은 로컬 또는 클라우드의 오픈 모델로 코딩·조사·문서 작업을 처리하는 별도 앱이다. 기기 실행, LM Link 연결, Secure Cloud 활용으로 개인정보와 비용 통제를 강화한다.

110
GeekNewsAI/ML2026-07-16

GPU 없이 13년 된 Xeon에서 Gemma 4 26B를 초당 5토큰으로 실행하기

GPU 없이 13년 된 Xeon에서 Gemma 4 26B를 초당 5토큰으로 실행하기

2013년형 듀얼 Xeon E5-2690 v2와 DDR3 서버에서 Gemma 4 26B-A4B Q8_0을 CPU만으로 구동해 디코딩 약 5.2토큰/초, 프롬프트 평가 약 16토큰/초를 기록함. ik_llama.cpp의 고속 경로는 AVX2와 FMA3를 전제로 하지만, AVX1만 지원하는 Ivy Bridge에서도 동작하도록 경로를 조정함.

111
GeekNewsCloud/Infra2026-07-15

소프트웨어가 세상을 먹어 치웠고, 이제 하드웨어가 소프트웨어를 먹고 있다

소프트웨어가 세상을 먹어 치웠고, 이제 하드웨어가 소프트웨어를 먹고 있다

AI 시대에는 가치 중심이 SaaS 애플리케이션에서 반도체, 컴퓨팅, 데이터, 추론 플랫폼으로 이동하고 있다. CoWoS, HBM, 전력 같은 물리적 병목과 데이터 전환 비용으로 애플리케이션 계층은 더 얇아지고 있다.

112
GeekNewsCloud/Infra2026-07-13

AI 토큰은 데이터센터를 어떻게 통과하는가

AI 토큰은 데이터센터를 어떻게 여행하는가

AI 추론이 전체 AI 컴퓨팅의 대부분을 차지하면서 토큰 처리 비용과 지연시간이 인프라 경제성을 좌우하는 핵심 변수가 됨. 요청은 토큰화부터 API 게이트웨이, 라우팅, KV 캐시, GPU·HBM, 네트워크까지 여러 계층을 거치며 비용이 누적됨.

113
GeekNewsAI/ML2026-07-11

Apple Silicon 임원이 말한 Mac mini AI 수요와 온디바이스 미래

Apple Silicon 임원이 말한 Mac mini AI 수요와 온디바이스 미래

AI 에이전트를 장시간 실행할 별도 장비 수요가 늘면서 Mac mini와 Mac Studio가 개발자용 온디바이스 AI 머신으로 부상. 에이전트형 작업은 주 작업 머신과 분리해 24시간 실행 가능한 로컬 시스템을 요구하는 흐름이 커지고 있음.

114
GeekNewsAI/ML2026-07-09

OpenAI GPT 5.6 출시

OpenAI GPT 5.6 출시

OpenAI가 GPT-5.6 패밀리를 GA로 공개함. Sol, Terra, Luna 3개 티어로 효율성과 최대 성능을 나눠 제공하는 구조.

115
GeekNewsAI/ML2026-07-09

Weave Router - 프롬프트마다 최적의 모델로 라우팅하는 에이전트용 모델 라우터

Weave Router - 프롬프트마다 최적의 모델로 라우팅하는 에이전트용 모델 라우터

Anthropic, OpenAI, Gemini를 단일 엔드포인트로 묶는 드롭인 프록시가 소개됨. 요청별로 최적 모델을 자동 선택해 라우팅하며, 엔드포인트 변경만으로 비용을 40~70% 줄일 수 있다고 설명함.

116
GeekNewsAI/ML2026-07-08

Kokoro로 로컬 CPU에서 고품질 TTS 실행하기

Kokoro로 로컬 CPU에서 고품질 TTS 실행하기

전용 GPU 없이도 로컬에서 실용적인 품질의 음성 합성이 가능하다는 내용. Kokoro는 작은 모델 크기에도 다국어와 여러 음성을 지원하며, CPU로 TTS를 처리해 GPU를 LLM 추론에 남길 수 있음.

117
GeekNewsAI/ML2026-07-07

GLM 5.2와 다가오는 AI 추론 마진 붕괴

GLM 5.2와 다가오는 AI 추론 마진 붕괴

오픈 웨이트 모델 GLM 5.2가 Opus·GPT급 에이전트 작업에 근접하며 폐쇄형 프런티어 모델의 추론 마진을 압박할 수 있음. AI 비용의 핵심이 학습비보다 수요에 따라 커지는 추론 비용으로 이동하고 있음.

118
GeekNewsAI/ML2026-07-06

Show GN: Fable5는 비싸지고, 로컬 GPU는 부족하다: LLM 하나를 Mac과 CUDA로 나눠 돌리는 DRIFT

Show GN: Fable5는 비싸지고, 로컬 GPU는 부족하다: LLM 하나를 Mac & CUDA로 나눠 돌리는 DRIFT

Fable5급 고성능 모델과 로컬 GPU 부족 문제를 배경으로, DRIFT가 하나의 LLM을 여러 개인 기기에 레이어 단위로 분산 실행하는 방식을 제안. Mac과 CUDA 장비를 함께 묶어 로컬 추론 부담을 나누는 오픈소스 프로젝트.

119
GeekNewsAI/ML2026-07-04

Jamesob의 최신 수준 LLM 로컬 실행 가이드

Jamesob의 최신 수준 LLM 로컬 실행 가이드

로컬에서 최신 LLM과 음성-텍스트 변환을 돌리기 위한 하드웨어 구성과 Docker 설정을 한 곳에 정리한 가이드. 약 2천 달러 예산으로 2× RTX 3090 기반 48GB VRAM 환경과 Whisper STT 구성이 소개된다.

120
GeekNewsCloud/Infra2026-07-04

달러당 성능은 더 빠르고 저렴해지고 있다

달러당 성능이 더 빠르고 저렴해지고 있음

추론 수요 확대 속에 GPU와 토큰 비용이 오르지만, AMD MI355X가 B300 대비 GPU당 평균 약 2.75배 저렴한 대안으로 부상. AMD MI350 계열은 하드웨어 성능에서 경쟁하지만, NVIDIA는 소프트웨어와 day-0 지원이 강점.

121
GeekNewsAI/ML2026-06-30

Qwen 3.6 27B는 로컬 개발의 최적 지점

Qwen 3.6 27B는 로컬 개발의 최적 지점

Qwen 3.6 27B가 범용 작업에서 로컬 모델의 유력한 선택지로 평가됨. 느리지만 더 강한 dense 모델로서 창작과 코딩에서 제약 조건 준수 성능이 돋보임.

122
GeekNewsAI/ML2026-06-30

Compute-adjusted LTV(연산 비용 반영 LTV) 계산 방법

Compute-adjusted LTV(연산 비용 반영 LTV) 계산하는 방법

AI 구독 서비스는 고객별 추론 비용 편차가 커서 전통적 LTV만으로는 수익성을 정확히 보기 어려움. 고정 매출과 변동 연산 비용을 함께 반영한 Compute-Adjusted LTV로 고객별 마진과 손실을 재계산해야 함.

123
GeekNewsAI/ML2026-06-28

DSpark: Speculative Decoding을 활용한 LLM 추론 가속화 [pdf

DSpark: Speculative decoding을 활용한 LLM 추론 가속화 [pdf]

] 준자기회귀 생성과 신뢰도 스케줄링을 결합한 speculative decoding 프레임워크. 병렬 drafter의 장문 토큰 제안에서 발생하는 acceptance decay 문제를 줄여 LLM 추론 효율을 높임.

124
GeekNewsAI/ML2026-06-25

OpenAI, Broadcom과 만든 첫 자체 추론 칩 Jalapeño 공개

OpenAI, Broadcom과 만든 첫 자체 추론 칩 Jalapeño 공개

OpenAI가 Broadcom과 함께 만든 LLM 추론용 가속기 Jalapeño를 공개. 설계 착수부터 테이프아웃까지 9개월이 걸린 차세대 컴퓨팅 플랫폼의 첫 결과물.

125
GeekNewsCloud/Infra2026-06-25

Cafe24, LLM Router 공개

Cafe24, LLM Router 공개

Claude, Gemini, Qwen, Llama, DeepSeek 등 100개 이상 모델을 단일 엔드포인트로 호출하는 통합 LLM 인프라를 공개함. OpenAI 호환 API로 provider별 명세, 재시도, 스트리밍 차이를 한 번에 흡수하도록 설계.

126
GeekNewsAI/ML2026-06-23

GLM-5.2를 로컬에서 실행하는 방법

GLM-5.2를 로컬에서 실행하는 방법

Z.ai의 오픈 모델 GLM-5.2를 로컬에서 실행하는 방법을 정리. 744B 파라미터, 40B 활성 파라미터, 1M 컨텍스트가 핵심이며 Unsloth의 Dynamic GGUF와 2-bit UD-IQ2_M 설정이 언급됨.

127
GeekNewsAI/ML2026-06-16

CrankGPT

CrankGPT

손과 발의 물리적 동력으로 토큰을 생성하는 완전 로컬·프라이빗 AI 솔루션. 가정용 기본 수동 모델부터 파워 유저·소규모 기업용 페달 모델까지 사용 규모별로 나뉨.

128
GeekNewsDev/Tools2026-06-14

회사처럼 돈 쓰지 않고 집에서 AI 코딩하기

회사처럼 돈 쓰지 않고 집에서 AI 코딩하기

개인용 AI 코딩 비용을 줄이는 방법을 자가 호스팅, 오픈소스 모델 API 대여, 프런티어 구독 최적화로 분류함. 초기 비용과 성능, 운영 부담을 비교해 집에서 저비용으로 쓰는 현실적 선택지를 정리함.

129
GeekNewsAI/ML2026-06-14

murrdb/murr - ML/AI 워크로드용 서브밀리초 캐시

murrdb/murr - ML/AI 워크로드용 서브 밀리초 캐시

AI 추론 워크로드를 겨냥한 RocksDB 기반 NVMe/S3 캐시. Redis 대체를 목표로 배치 처리와 제로카피 읽기·쓰기에 맞춘 데이터 서빙 계층을 제공.

130
GeekNewsAI/ML2026-06-09

MiMo-V2.5-Pro-UltraSpeed: 초당 1000토큰을 생성하는 1T 모델

MiMo-V2.5-Pro-UltraSpeed: 초당 1000토큰을 생성하는 1T 모델

1조 파라미터 모델이 디코딩 속도 1000 tokens/s를 처음 돌파함. 전용 하드웨어 없이 commodity GPU와 단일 8-GPU 노드, FP4 양자화로 1000+ tps 출력을 구현.

131
GeekNewsDev/Tools2026-06-04

Elixir v1.20: 이제 점진적 타입 언어

Elixir v1.20: 이제 점진적 타입 언어

Elixir v1.20에서 모든 프로그램에 타입 추론과 점진적 타입 검사가 적용됨. 어노테이션 없이도 죽은 코드와 런타임 실패 가능 버그를 더 일찍 찾아내는 방향으로 진화함.

132
GeekNewsAI/ML2026-06-04

그들은 가중치로 만들어졌다

그들은 가중치로 만들어졌다

AI 모델의 가중치만으로 언어, 추론, 문법, 기억 같은 기능이 나타난다는 점을 풍자적으로 해석한 글. 다음 토큰 예측과 대규모 부동소수점 연산이 지능처럼 보이는 현상을 비틀어 설명.

133
GeekNewsAI/ML2026-06-02

10년 된 Xeon이면 충분하다

10년 된 Xeon이면 충분하다

2016년형 단일 Intel Xeon E5-2620 v4와 DDR3 128GB, GPU 없는 서버에서 Gemma 4 26B-A4B를 ik_llama.cpp 최적화로 구동함. LLM 디코더 패스는 연산보다 메모리 대역폭이 병목이며, CPU 서버도 읽기 속도 수준의 추론이 가능함.

134
GeekNewsAI/ML2026-06-01

로컬 기기용 1비트 Bonsai Image 4B 이미지 생성

로컬 기기용 1비트 Bonsai Image 4B 이미지 생성

Bonsai Image 4B는 노트북과 휴대폰 같은 로컬 하드웨어에서 고품질 이미지 생성을 돌리도록 설계된 소형 모델군임. FLUX.2 Klein 4B 아키텍처를 기반으로 확산 트랜스포머 가중치를 1-bit 또는 ternary로 표현해 경량화함.

135
GeekNewsCloud/Infra2026-05-27

유휴 Inference GPU Pool을 이용한 GPU Job 스케줄링

유휴 Inference GPU Pool을 이용한 GPU Job 스케줄링

LG AI연구원이 LLM 서비스 운영 중 남는 inference GPU를 연구·실험 작업에 재활용한 사례를 소개함. 운영용 GPU 풀의 유휴 시간을 활용해 자원 효율과 작업 처리율을 높이는 방식이다.

136
GeekNewsAI/ML2026-05-18

Apple Silicon은 OpenRouter보다 비용이 더 든다

Apple Silicon은 OpenRouter보다 비용이 더 든다

로컬 추론 비용은 전기료보다 기기 가격이 더 큰 변수라는 분석. M5 Max MacBook Pro 같은 고가 하드웨어는 전력비가 낮아도 총비용이 높을 수 있음.

137
GeekNewsDev/Tools2026-05-18

whichllm - 내 하드웨어에서 실제로 돌아가고 최고 성능을 내는 로컬 LLM 찾기

whichllm - 내 하드웨어에서 실제로 돌아가고 최고 성능을 내는 로컬 LLM 찾기

하드웨어를 자동 감지해 실측 벤치마크 기준으로 로컬 LLM을 추천하는 CLI 도구. NVIDIA, AMD, Apple Silicon, CPU-only까지 지원해 사용 가능한 모델을 랭킹으로 제시.

138
GeekNewsAI/ML2026-05-17

DeepSeek-V4-Flash로 LLM 조향(Steering)이 다시 흥미로워졌다

DeepSeek-V4-Flash로 LLM 조향(Steering)이 다시 흥미로워졌다

DwarfStar 4가 llama.cpp를 DeepSeek-V4-Flash 전용으로 줄여 로컬 LLM 조향 실험을 쉽게 만듦. 개념 활성 차이를 벡터로 뽑아 추론 중 더해 행동을 바꾸는 방식이 핵심이다.

139
GeekNewsAI/ML2026-05-16

DS4에 대한 몇 마디

DS4에 대한 몇 마디

Metal용 로컬 추론 엔진 DwarfStar 4의 확산이 빠르게 진행됨. DeepSeek v4 Flash급 모델과 2/8비트 양자화 조합이 로컬 AI 수요를 끌어올림.