검색 결과

"inference" · 50개 기사 · GeekNews · AI/ML

1
GeekNewsAI/ML2632026-04-20

로컬 LLM 생태계에는 Ollama가 필요하지 않다

로컬 LLM 생태계에는 Ollama가 필요하지 않다

Ollama가 초기에는 로컬 LLM 실행을 단순화했지만, 이후 출처 은폐와 클라우드 중심 전환으로 신뢰를 잃었다. 핵심 엔진 llama.cpp의 공로를 가리는 구조도 비판받고 있다.

2
GeekNewsAI/ML942026-04-23

vLLM Recipes 개편 - 모델+하드웨어 조합별 설정을 딸각 한방으로

vLLM Recipes 개편 - 모델+하드웨어 조합별 설정을 딸각 한방으로

vLLM Recipes가 개편돼 모델과 하드웨어 조합에 맞는 실행 설정을 인터랙티브하게 찾을 수 있게 됐다. 어떤 모델을 어떤 서버에서 돌릴지 빠르게 확인하는 용도다.

3
GeekNewsAI/ML922026-04-22

Google LiteRT-LM - 엣지 디바이스용 고성능 LLM 추론 프레임워크

Google LiteRT-LM - 엣지 디바이스용 고성능 LLM 추론 프레임워크

Google이 Android, iOS, 웹, 데스크톱, IoT 등 엣지 환경에서 동작하는 온디바이스 LLM 추론 엔진 LiteRT-LM을 공개했다. 프로덕션 수준 성능과 범용 배포를 목표로 한다.

4
GeekNewsAI/ML42026-04-27

Mixture of Experts(MoE)란 무엇인가 — DeepSeek이 왜 1.6조 파라미터인데 싸게 돌아가는지

Mixture of Experts(MoE)란 무엇인가 — DeepSeek이 왜 1.6조 파라미터인데 싸게 돌아가는지

MoE 구조가 모든 파라미터를 매번 쓰지 않고 일부 전문가만 활성화해 추론 비용을 줄이는 방식으로 설명됨. DeepSeek V4의 대규모 파라미터와 낮은 운용비의 배경을 풀어낸 글.

5
GeekNewsAI/ML312026-04-30

GLM-5 대규모 서비스 중 발견한 레이스 컨디션 버그 수정기 — Coding Agent 추론 인프라의 Scaling Pain

GLM-5 대규모 서비스 중 발견한 레이스 컨디션 버그 수정기 — Coding Agent 추론 인프라의 Scaling Pain

GLM-5 기반 Coding Agent를 대규모로 서비스하며 발견한 KV cache 레이스 컨디션 버그 2건의 재현과 수정 과정을 공유. 처리량 최적화와 추론 인프라 확장 과정의 병목도 정리.

6
GeekNewsAI/ML112026-04-24

DeepSeek V4: 100만 토큰 컨텍스트를 지원하는 고효율 대규모 언어 모델

DeepSeek v4 : 100만 토큰 컨텍스트를 지원하는 고효율 대규모 언어 모델

DeepSeek V4가 100만 토큰 컨텍스트와 MoE 구조를 제공하는 대규모 언어 모델로 공개. Pro와 Flash 두 버전으로 나뉘며 고효율 추론을 강조.

7
GeekNewsAI/ML2026-08-17

Qwen 3.8 27B는 뛰어나지만 기본 설정에서 추론 시간이 지나치게 김

Qwen 3.8 27B는 뛰어나지만 기본 설정에서 지나치게 오래 추론함

Alibaba Qwen 3.8 27B는 비전 기능, 262,144토큰 컨텍스트, 17GB 양자화 파일로 노트북에서도 코드 작성과 도구 호출, 이미지 분석을 수행함. 다만 기본 추론 강도 xhigh가 단순 요청에도 과도하게 작동해 응답 지연이 커짐.

8
GeekNewsAI/ML2026-08-15

Qwen3.8-27B, 17~19GB 메모리에서 4-bit 로컬 실행 가능

Qwen3.8-27B, 17~19GB 메모리에서 4-bit 로컬 실행 가능

Qwen3.8-27B가 Unsloth GGUF/NVFP4로 공개되며 개인 장비에서 4-bit 로컬 실행이 가능해짐. 비전, 추론, 256K 컨텍스트를 지원하고 YaRN으로 최대 1M 컨텍스트 확장도 가능.

9
GeekNewsAI/ML2026-08-13

DeepSeek V4 Pro 0813

DeepSeek V4 Pro 0813

OpenRouter가 단일 공급자 호스팅 방식으로 제공. 실제 고객 기준 가중 평균 가격은 입력 100만 토큰당 $0.03508, 출력 $0.8697 수준.

10
GeekNewsAI/ML2026-08-13

Unsloth, Qwen3.8 2.4T를 397GB로 줄여 로컬 실행 지원

Unsloth, Qwen3.8 2.4T를 397GB로 줄여 로컬 실행 지원

Unsloth가 Qwen3.8-2.4T-A95B의 GGUF 양자화 모델과 로컬 실행 가이드를 공개. BF16 4.89TB 원본을 Dynamic 1-bit 기준 397GB까지 줄여 로컬 구동 장벽을 낮춤.

11
GeekNewsAI/ML2026-08-12

llama.cpp: 내 컴퓨터에서 실행하는 오픈소스 AI

llama.cpp: 내 컴퓨터에서 실행하는 오픈소스 AI

llama.cpp는 API 키와 텔레메트리 없이 로컬에서 AI 모델을 실행하는 오픈소스 런타임. 노트북부터 클러스터까지 같은 바이너리와 모델을 쓰며 다양한 CPU·GPU 환경에 맞게 최적화된다.

12
GeekNewsAI/ML2026-08-12

AI가 코드를 쓰는 시대, antirez는 왜 다시 C로 만드는가

AI가 코드를 쓰는 시대, antirez는 왜 다시 C로 만드는가

Redis 창시자 antirez가 Apple Silicon용 멀티모달 추론 엔진 H3-metal을 C, Objective-C, Metal로 구현해 공개함. 범용 프레임워크 대신 하드웨어와 모델 요구에 맞춘 저수준 구현을 택한 사례.

13
GeekNewsAI/ML2026-08-11

H3-metal - Mac용 MiniMax-H3 추론 엔진

H3-metal - Mac용 MiniMax-H3 추론 엔진

antirez의 h3.c를 기반으로 MiniMax-H3를 Apple Silicon Mac에서 네이티브로 실행하는 C/Objective-C/Metal 추론 엔진. 텍스트와 함께 영상·오디오 생성을 지원하며 M3 Max/M5 Max에 맞춰 최적화됨.

14
GeekNewsAI/ML2026-08-11

Apple Silicon macOS VM에서 llama.cpp LLM 추론 가속하기

Apple Silicon macOS VM에서 llama.cpp LLM 추론 가속하기

AppleVirtualization.framework의 가상 GPU가 보수적 Metal 기능만 노출해 llama.cpp가 느린 커널을 선택하던 문제를 우회해 최대 16.36배 가속. 게스트 프로세스 전용 호환성 계층으로 GPU 기능 판정을 바꾸는 방식.

15
GeekNewsAI/ML2026-08-10

Meta Muse Glimmer - 기기에서 실행하는 오픈 웨이트 30B 코딩 모델

Meta Muse Glimmer - 기기에서 실행하는 오픈 웨이트 30B 코딩 모델

Meta가 30B 파라미터의 로컬 에이전트 모델 Muse Glimmer를 Apache 2.0으로 공개함. 단일 소비자용 GPU가 있는 Mac과 PC에서 실행하도록 최적화됐으며 로짓 증류와 장문맥 학습, SFT, 온정책 증류를 사용함.

16
GeekNewsAI/ML2026-08-04

단일 AMD MI300X에서 DeepSeek V4 Flash 실행하기

단일 AMD MI300X에서 DeepSeek V4 Flash 실행하기

304B 파라미터 DeepSeek-V4-Flash-0731을 단일 AMD MI300X에서 운영하기 위한 구성과 패치 제공. 192GB HBM3에 가중치 적재.

17
GeekNewsAI/ML2026-07-31

DeepSeek V4 Flash 0731의 지능·성능·가격 분석

DeepSeek V4 Flash 0731의 지능·성능·가격 분석

최대 추론 기준 AAII 50점으로 Kimi K3(max), GLM-5.2(max)에 이어 3위. 2,840억 파라미터 MoE 모델로 토큰당 130억 개만 활성화하며, 100만 토큰 컨텍스트와 저가 API 요금을 제공함.

18
GeekNewsAI/ML2026-07-31

Kimi K3 로컬 실행 가이드

Kimi K3 로컬 실행 가이드

Moonshot AI의 오픈 웨이트 모델 Kimi K3를 로컬에서 실행하는 방법을 다룸. 전체 2.8T 매개변수, 104B 활성 파라미터, 네이티브 비전, 100만 토큰 문맥을 지원하며 GGUF 양자화로 메모리 요구량을 낮춤.

19
GeekNewsAI/ML2026-07-30

GPT‑5.6, 가격 대비 성능의 한계를 확장

GPT‑5.6, 가격 대비 성능의 한계를 확장

OpenAI가 모델·추론 시스템·에이전트 하네스 효율 개선을 가격과 처리 속도에 반영해 기업용 AI의 단가 대비 성능을 끌어올림. 7월 30일부터 Luna와 Terra의 API 가격을 대폭 인하함.

20
GeekNewsAI/ML2026-07-29

TurboFieldfare - 모든 M 시리즈 Mac에서 Gemma 4 26B를 2GB RAM으로 실행하는 오픈소스 엔진

TurboFieldfare - 모든 M 시리즈 Mac에서 Gemma 4 26B를 2GB RAM으로 실행하는 오픈소스 엔진

Gemma 4 26B-A4B를 약 2GB 메모리로 구동해 8GB Apple Silicon Mac에서도 로컬 추론을 가능하게 함. 전체 모델을 상주시기보다 MoE 전문가 가중치를 SSD에서 스트리밍하는 방식으로 메모리 사용을 줄임.

21
GeekNewsAI/ML2026-07-29

Kimi K3 아키텍처 개요와 설계 노트

Kimi K3 아키텍처 개요와 설계 노트

Kimi Linear를 48B에서 2.8T로 확장한 프로덕션 모델 아키텍처를 정리. LatentMoE와 추론 효율 중심의 구조로 공개 가중치 모델 중 최대 규모를 지향.

22
GeekNewsAI/ML2026-07-29

Kimi Linear: 표현력과 효율을 높인 어텐션 아키텍처(2025)

Kimi Linear: 표현력과 효율을 높인 어텐션 아키텍처(2025)

Kimi Linear가 KDA와 MLA를 결합한 하이브리드 구조로 전체 MLA보다 더 나은 성능을 보였음. 단기·장기 문맥 처리와 강화학습 평가 전반에서 효율 개선을 확인함.

23
GeekNewsAI/ML2026-07-22

Laguna S 2.1 공개

Laguna S 2.1 공개

Poolside가 장기 작업과 추론 성능을 강화한 Laguna S 2.1을 공개함. 118B MoE 모델로 토큰당 8B 파라미터를 활성화하며, thinking과 no-thinking 모드 모두 최대 1M 토큰 컨텍스트를 지원함.

24
GeekNewsAI/ML2026-07-21

Nativ - Mac에서 프런티어급 오픈 모델 로컬 실행

Nativ - 프런티어급 오픈 모델을 Mac에서 로컬 실행

Apple Silicon Mac에서 오픈 AI 모델을 계정이나 클라우드 없이 로컬 실행하는 MIT 라이선스 앱. 하드웨어에 맞는 모델 추천과 로컬 응답 생성을 지원.

25
GeekNewsAI/ML2026-07-21

누가 중국 모델을 두려워하는가?

누가 중국 모델을 두려워하는가?

중국 오픈 웨이트 모델 Kimi K3가 최첨단 성능에 근접. AI 사업 경쟁력은 모델 개발비보다 정답 수준 지능을 제공하는 COGS와 토큰 효율에서 갈림.

26
GeekNewsAI/ML2026-07-20

Transcribe.cpp: 크로스 플랫폼 로컬 음성 인식 라이브러리

Transcribe.cpp: 크로스 플랫폼 로컬 음성 인식 라이브러리

ggml 기반 로컬 음성 인식 라이브러리로, Mac·Windows·Linux 앱에 최신 ASR 모델을 쉽게 내장하도록 설계됨. Vulkan·Metal·CUDA·TinyBLAS 가속을 지원하며 스트리밍과 배치 전사를 모두 처리함.

27
GeekNewsAI/ML2026-07-18

2026년 7월 오픈소스 AI 현황

2026년 7월 오픈소스 AI 현황

오픈 웨이트 모델이 코딩, 지시 이행, 일반 지식에서 폐쇄형 모델과 비슷한 수준에 도달함. 추론 비용 하락과 함께 경쟁 중심이 모델 성능에서 에이전트 하네스로 이동 중.

28
GeekNewsAI/ML2026-07-17

LM Studio Bionic: 오픈 모델을 위한 AI 에이전트

LM Studio Bionic: 오픈 모델을 위한 AI 에이전트

LM Studio Bionic은 로컬 또는 클라우드의 오픈 모델로 코딩·조사·문서 작업을 처리하는 별도 앱이다. 기기 실행, LM Link 연결, Secure Cloud 활용으로 개인정보와 비용 통제를 강화한다.

29
GeekNewsAI/ML2026-07-16

GPU 없이 13년 된 Xeon에서 Gemma 4 26B를 초당 5토큰으로 실행하기

GPU 없이 13년 된 Xeon에서 Gemma 4 26B를 초당 5토큰으로 실행하기

2013년형 듀얼 Xeon E5-2690 v2와 DDR3 서버에서 Gemma 4 26B-A4B Q8_0을 CPU만으로 구동해 디코딩 약 5.2토큰/초, 프롬프트 평가 약 16토큰/초를 기록함. ik_llama.cpp의 고속 경로는 AVX2와 FMA3를 전제로 하지만, AVX1만 지원하는 Ivy Bridge에서도 동작하도록 경로를 조정함.

30
GeekNewsAI/ML2026-07-11

Apple Silicon 임원이 말한 Mac mini AI 수요와 온디바이스 미래

Apple Silicon 임원이 말한 Mac mini AI 수요와 온디바이스 미래

AI 에이전트를 장시간 실행할 별도 장비 수요가 늘면서 Mac mini와 Mac Studio가 개발자용 온디바이스 AI 머신으로 부상. 에이전트형 작업은 주 작업 머신과 분리해 24시간 실행 가능한 로컬 시스템을 요구하는 흐름이 커지고 있음.

31
GeekNewsAI/ML2026-07-09

OpenAI GPT 5.6 출시

OpenAI GPT 5.6 출시

OpenAI가 GPT-5.6 패밀리를 GA로 공개함. Sol, Terra, Luna 3개 티어로 효율성과 최대 성능을 나눠 제공하는 구조.

32
GeekNewsAI/ML2026-07-09

Weave Router - 프롬프트마다 최적의 모델로 라우팅하는 에이전트용 모델 라우터

Weave Router - 프롬프트마다 최적의 모델로 라우팅하는 에이전트용 모델 라우터

Anthropic, OpenAI, Gemini를 단일 엔드포인트로 묶는 드롭인 프록시가 소개됨. 요청별로 최적 모델을 자동 선택해 라우팅하며, 엔드포인트 변경만으로 비용을 40~70% 줄일 수 있다고 설명함.

33
GeekNewsAI/ML2026-07-08

Kokoro로 로컬 CPU에서 고품질 TTS 실행하기

Kokoro로 로컬 CPU에서 고품질 TTS 실행하기

전용 GPU 없이도 로컬에서 실용적인 품질의 음성 합성이 가능하다는 내용. Kokoro는 작은 모델 크기에도 다국어와 여러 음성을 지원하며, CPU로 TTS를 처리해 GPU를 LLM 추론에 남길 수 있음.

34
GeekNewsAI/ML2026-07-07

GLM 5.2와 다가오는 AI 추론 마진 붕괴

GLM 5.2와 다가오는 AI 추론 마진 붕괴

오픈 웨이트 모델 GLM 5.2가 Opus·GPT급 에이전트 작업에 근접하며 폐쇄형 프런티어 모델의 추론 마진을 압박할 수 있음. AI 비용의 핵심이 학습비보다 수요에 따라 커지는 추론 비용으로 이동하고 있음.

35
GeekNewsAI/ML2026-07-06

Show GN: Fable5는 비싸지고, 로컬 GPU는 부족하다: LLM 하나를 Mac과 CUDA로 나눠 돌리는 DRIFT

Show GN: Fable5는 비싸지고, 로컬 GPU는 부족하다: LLM 하나를 Mac & CUDA로 나눠 돌리는 DRIFT

Fable5급 고성능 모델과 로컬 GPU 부족 문제를 배경으로, DRIFT가 하나의 LLM을 여러 개인 기기에 레이어 단위로 분산 실행하는 방식을 제안. Mac과 CUDA 장비를 함께 묶어 로컬 추론 부담을 나누는 오픈소스 프로젝트.

36
GeekNewsAI/ML2026-07-04

Jamesob의 최신 수준 LLM 로컬 실행 가이드

Jamesob의 최신 수준 LLM 로컬 실행 가이드

로컬에서 최신 LLM과 음성-텍스트 변환을 돌리기 위한 하드웨어 구성과 Docker 설정을 한 곳에 정리한 가이드. 약 2천 달러 예산으로 2× RTX 3090 기반 48GB VRAM 환경과 Whisper STT 구성이 소개된다.

37
GeekNewsAI/ML2026-06-30

Qwen 3.6 27B는 로컬 개발의 최적 지점

Qwen 3.6 27B는 로컬 개발의 최적 지점

Qwen 3.6 27B가 범용 작업에서 로컬 모델의 유력한 선택지로 평가됨. 느리지만 더 강한 dense 모델로서 창작과 코딩에서 제약 조건 준수 성능이 돋보임.

38
GeekNewsAI/ML2026-06-30

Compute-adjusted LTV(연산 비용 반영 LTV) 계산 방법

Compute-adjusted LTV(연산 비용 반영 LTV) 계산하는 방법

AI 구독 서비스는 고객별 추론 비용 편차가 커서 전통적 LTV만으로는 수익성을 정확히 보기 어려움. 고정 매출과 변동 연산 비용을 함께 반영한 Compute-Adjusted LTV로 고객별 마진과 손실을 재계산해야 함.

39
GeekNewsAI/ML2026-06-28

DSpark: Speculative Decoding을 활용한 LLM 추론 가속화 [pdf

DSpark: Speculative decoding을 활용한 LLM 추론 가속화 [pdf]

] 준자기회귀 생성과 신뢰도 스케줄링을 결합한 speculative decoding 프레임워크. 병렬 drafter의 장문 토큰 제안에서 발생하는 acceptance decay 문제를 줄여 LLM 추론 효율을 높임.

40
GeekNewsAI/ML2026-06-25

OpenAI, Broadcom과 만든 첫 자체 추론 칩 Jalapeño 공개

OpenAI, Broadcom과 만든 첫 자체 추론 칩 Jalapeño 공개

OpenAI가 Broadcom과 함께 만든 LLM 추론용 가속기 Jalapeño를 공개. 설계 착수부터 테이프아웃까지 9개월이 걸린 차세대 컴퓨팅 플랫폼의 첫 결과물.

41
GeekNewsAI/ML2026-06-23

GLM-5.2를 로컬에서 실행하는 방법

GLM-5.2를 로컬에서 실행하는 방법

Z.ai의 오픈 모델 GLM-5.2를 로컬에서 실행하는 방법을 정리. 744B 파라미터, 40B 활성 파라미터, 1M 컨텍스트가 핵심이며 Unsloth의 Dynamic GGUF와 2-bit UD-IQ2_M 설정이 언급됨.

42
GeekNewsAI/ML2026-06-16

CrankGPT

CrankGPT

손과 발의 물리적 동력으로 토큰을 생성하는 완전 로컬·프라이빗 AI 솔루션. 가정용 기본 수동 모델부터 파워 유저·소규모 기업용 페달 모델까지 사용 규모별로 나뉨.

43
GeekNewsAI/ML2026-06-14

murrdb/murr - ML/AI 워크로드용 서브밀리초 캐시

murrdb/murr - ML/AI 워크로드용 서브 밀리초 캐시

AI 추론 워크로드를 겨냥한 RocksDB 기반 NVMe/S3 캐시. Redis 대체를 목표로 배치 처리와 제로카피 읽기·쓰기에 맞춘 데이터 서빙 계층을 제공.

44
GeekNewsAI/ML2026-06-09

MiMo-V2.5-Pro-UltraSpeed: 초당 1000토큰을 생성하는 1T 모델

MiMo-V2.5-Pro-UltraSpeed: 초당 1000토큰을 생성하는 1T 모델

1조 파라미터 모델이 디코딩 속도 1000 tokens/s를 처음 돌파함. 전용 하드웨어 없이 commodity GPU와 단일 8-GPU 노드, FP4 양자화로 1000+ tps 출력을 구현.

45
GeekNewsAI/ML2026-06-04

그들은 가중치로 만들어졌다

그들은 가중치로 만들어졌다

AI 모델의 가중치만으로 언어, 추론, 문법, 기억 같은 기능이 나타난다는 점을 풍자적으로 해석한 글. 다음 토큰 예측과 대규모 부동소수점 연산이 지능처럼 보이는 현상을 비틀어 설명.

46
GeekNewsAI/ML2026-06-02

10년 된 Xeon이면 충분하다

10년 된 Xeon이면 충분하다

2016년형 단일 Intel Xeon E5-2620 v4와 DDR3 128GB, GPU 없는 서버에서 Gemma 4 26B-A4B를 ik_llama.cpp 최적화로 구동함. LLM 디코더 패스는 연산보다 메모리 대역폭이 병목이며, CPU 서버도 읽기 속도 수준의 추론이 가능함.

47
GeekNewsAI/ML2026-06-01

로컬 기기용 1비트 Bonsai Image 4B 이미지 생성

로컬 기기용 1비트 Bonsai Image 4B 이미지 생성

Bonsai Image 4B는 노트북과 휴대폰 같은 로컬 하드웨어에서 고품질 이미지 생성을 돌리도록 설계된 소형 모델군임. FLUX.2 Klein 4B 아키텍처를 기반으로 확산 트랜스포머 가중치를 1-bit 또는 ternary로 표현해 경량화함.

48
GeekNewsAI/ML2026-05-18

Apple Silicon은 OpenRouter보다 비용이 더 든다

Apple Silicon은 OpenRouter보다 비용이 더 든다

로컬 추론 비용은 전기료보다 기기 가격이 더 큰 변수라는 분석. M5 Max MacBook Pro 같은 고가 하드웨어는 전력비가 낮아도 총비용이 높을 수 있음.

49
GeekNewsAI/ML2026-05-17

DeepSeek-V4-Flash로 LLM 조향(Steering)이 다시 흥미로워졌다

DeepSeek-V4-Flash로 LLM 조향(Steering)이 다시 흥미로워졌다

DwarfStar 4가 llama.cpp를 DeepSeek-V4-Flash 전용으로 줄여 로컬 LLM 조향 실험을 쉽게 만듦. 개념 활성 차이를 벡터로 뽑아 추론 중 더해 행동을 바꾸는 방식이 핵심이다.

50
GeekNewsAI/ML2026-05-16

DS4에 대한 몇 마디

DS4에 대한 몇 마디

Metal용 로컬 추론 엔진 DwarfStar 4의 확산이 빠르게 진행됨. DeepSeek v4 Flash급 모델과 2/8비트 양자화 조합이 로컬 AI 수요를 끌어올림.