검색 결과

"inference" · 69개 기사 · Hacker News · AI/ML

1
해커뉴스AI/ML7893542026-06-16

로컬 모델 실행이 이제는 괜찮아짐

Running local models is good now

로컬 모델 실행 환경이 성숙해졌다는 평가. 성능과 사용성이 개선되며 실사용 기준에 가까워짐.

2
해커뉴스AI/ML6952882026-06-27

DSpark: Speculative decoding이 LLM 추론을 가속화한다 [pdf

DSpark: Speculative decoding accelerates LLM inference [pdf]

] speculative decoding을 활용해 LLM 추론 속도를 높이는 DSpark 연구를 소개. 지연 시간과 처리량 개선을 목표로 한 가속 기법을 제시.

3
해커뉴스AI/ML6392602026-06-01

10년 된 Xeon만으로 충분하다

A 10 year old Xeon is all you need

2016년형 Xeon에서 Gemma 4를 돌린 사례를 다룸. 구형 서버 CPU로도 최신 AI 추론이 가능하다는 점을 보여줌.

4
해커뉴스AI/ML5441842026-07-29

Show HN: any M-series Mac에서 2GB RAM으로 Gemma 4 26B를 구동하는 오픈소스 엔진

Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac

Gemma 4 26B를 M-series Mac의 2GB RAM 환경에서 돌리는 오픈소스 엔진이 공개됨. 초저메모리 로컬 추론을 목표로 한 구현.

5
해커뉴스AI/ML4272922026-06-08

MiMo-v2.5-Pro-UltraSpeed: 초당 1000 토큰 처리하는 1T 모델

MiMo-v2.5-Pro-UltraSpeed: 1T model with 1000 tokens per second

Xiaomi가 MiMo-v2.5-Pro-UltraSpeed를 공개하며 초당 1000 토큰 처리 성능을 내세움. 1T 규모 모델의 고속 추론 경쟁을 강조한 발표.

6
해커뉴스AI/ML4253952026-06-29

로컬 개발을 위한 Qwen 3.6 27B가 적정 지점

Qwen 3.6 27B is the sweet spot for local development

Qwen 3.6 27B를 로컬 개발용으로 쓰기 좋은 균형점으로 평가. 성능과 실행 부담 사이의 타협안으로 주목.

7
해커뉴스AI/ML413932026-08-11

H3-metal – Apple Silicon용 네이티브 MiniMax-H3 추론

H3-metal – Native MiniMax-H3 inference for Apple Silicon

Apple Silicon에서 MiniMax-H3를 네이티브로 구동하는 추론 경로를 소개. Mac 로컬 환경에서의 AI 추론 성능 최적화 흐름에 초점.

8
해커뉴스AI/ML4121822026-08-17

Qwen 3.8 27B는 뛰어나지만 기본값이 과도한 추론에 치우친다

Qwen 3.8 27B is excellent, but it defaults to overthinking things

Qwen 3.8 27B 모델의 성능은 높지만 기본 동작이 과도한 추론에 기운다는 평가. 속도와 응답 효율을 위한 튜닝 필요성이 부각됨.

9
해커뉴스AI/ML4102642026-07-30

GPT-5.6으로 가격-성능 경계를 더 끌어올리다

Advancing the price-performance frontier with GPT‑5.6

OpenAI가 GPT-5.6의 가격-성능 개선을 강조했다. 더 낮은 비용으로 더 높은 성능을 제공하는 방향의 업그레이드다.

10
해커뉴스AI/ML3911232026-05-05

OpenAI가 대규모에서 저지연 음성 AI를 제공하는 방법

How OpenAI delivers low-latency voice AI at scale

OpenAI의 음성 AI 저지연 처리 구조를 설명하는 글. 대규모 실시간 음성 상호작용을 위해 지연을 줄이는 시스템 설계가 핵심.

11
해커뉴스AI/ML378792026-08-12

Qwen3.8-2.4T

Qwen3.8-2.4T

Qwen의 새로운 2.4T 파라미터급 모델 공개. Hugging Face에 A95B 변형이 올라옴.

12
해커뉴스AI/ML3762362026-07-07

GLM 5.2와 다가오는 AI 마진 붕괴

GLM 5.2 and the coming AI margin collapse

GLM 5.2를 계기로 AI 서비스의 수익성 압박을 분석함. 모델 경쟁 심화와 비용 구조 악화가 마진 붕괴로 이어질 수 있다는 전망.

13
해커뉴스AI/ML3631582026-06-23

GLM-5.2 로컬 실행 방법

GLM-5.2 – How to Run Locally

GLM-5.2 모델을 로컬에서 실행하는 방법을 정리한 글. 설치와 실행 환경 구성에 초점이 맞춰짐.

14
해커뉴스AI/ML3531572026-05-05

Gemma 4 가속화: multi-token prediction drafters로 더 빠른 추론

Accelerating Gemma 4: faster inference with multi-token prediction drafters

Google이 Gemma 4 추론 속도를 높이는 multi-token prediction drafters를 소개. 디코딩 병목을 줄여 지연시간과 처리량 개선을 노림.

15
해커뉴스AI/ML339872026-08-04

DeepSeek V4 Flash, 단일 AMD MI300X에서 실행

DeepSeek V4 Flash on a Single AMD MI300X

DeepSeek V4 Flash 모델을 AMD MI300X GPU 단일 장치에서 실행하는 데 성공. 최적화 기법과 벤치마크 결과 공개.

16
해커뉴스AI/ML285882026-05-11

24GB 메모리의 M4에서 local models 실행하기

Running local models on an M4 with 24GB memory

Apple M4와 24GB 메모리 환경에서 로컬 모델 구동 경험을 정리한 글. 온디바이스 추론의 현실적인 한계와 활용 가능성을 다룸.

17
해커뉴스AI/ML2831092026-08-13

GPT-5.6 Sol을 ultrafast로 가속

Accelerating GPT-5.6 Sol Ultrafast

Cerebras가 OpenAI의 GPT-5.6 Sol을 초고속 추론 경로로 가속하는 내용을 공개. 대형 모델 응답 지연을 줄이는 인프라 최적화가 핵심.

18
해커뉴스AI/ML2833722026-06-24

AI의 감당 가능성 위기

AI's Affordability Crisis

AI 사용 비용이 빠르게 쌓이면서 도입 장벽이 높아지고 있음. 대규모 모델 활용에서 비용 구조 재검토가 필요하다는 문제의식이 제기됨.

19
해커뉴스AI/ML2741132026-07-28

DeltaNet 계열 선형 어텐션 변형 살펴보기

A walk through of the DeltaNet family of linear attention variants

DeltaNet 계열의 선형 어텐션 변형을 단계적으로 설명. 긴 컨텍스트 효율성과 구조적 차이를 중심으로 정리.

20
해커뉴스AI/ML2672302026-05-17

Apple Silicon 비용이 OpenRouter보다 더 비쌈

Apple Silicon costs more than OpenRouter

오프라인 LLM 구동 시 Apple Silicon의 전력·운영 비용이 상용 API보다 높을 수 있음을 비교함. 로컬 추론의 경제성이 하드웨어 효율에 크게 좌우됨.

21
해커뉴스AI/ML266872026-07-21

Nativ: Mac에서 최첨단 오픈 모델을 로컬 실행

Nativ: Run frontier open models locally on your Mac

Mac에서 최신 오픈 모델을 로컬로 구동하는 도구 Nativ 소개. 클라우드 의존 없이 로컬 추론 환경을 간편하게 구성하는 흐름을 강조함.

22
해커뉴스AI/ML262492026-07-22

GigaToken: 약 1000배 더 빠른 언어 모델 토크나이제이션

GigaToken: ~1000x faster Language model tokenization

GigaToken이 기존보다 약 1000배 빠른 토크나이제이션을 내세움. 언어 모델 입력 전처리 병목을 크게 줄이려는 프로젝트.

23
해커뉴스AI/ML259852026-07-28

오픈 모델을 쓰는 경험은 놀라울 만큼 좋다

Using an open model feels surprisingly good

오픈 모델 사용 경험과 장점을 긍정적으로 평가. 로컬 실행성과 통제성, 비용 효율이 실제 사용 만족도를 끌어올린다는 관점.

24
해커뉴스AI/ML251212026-04-21

Kimi vendor verifier – 추론 제공자 정확도 검증

Kimi vendor verifier – verify accuracy of inference providers

Kimi가 추론 제공자별 응답 정확도를 검증하는 vendor verifier를 공개. 모델 호출 품질을 공급자 단위로 비교·점검하는 용도다.

25
해커뉴스AI/ML233512026-06-10

DiffusionGemma: 4배 더 빠른 텍스트 생성

DiffusionGemma: 4x Faster Text Generation

Google이 DiffusionGemma를 공개해 텍스트 생성 속도를 크게 끌어올림. 확산 모델 기반 접근으로 생성 효율 개선을 노림.

26
해커뉴스AI/ML229802026-07-14

Bonsai 27B: 휴대폰에서 실행되는 27B급 모델

Bonsai 27B: A 27B-Class model that runs on a phone

PrismML이 Bonsai 27B를 발표. 27B급 대형 모델을 스마트폰에서 구동할 수 있다고 강조하며 온디바이스 추론 가능성을 부각함.

27
해커뉴스AI/ML224712026-07-04

달러당 성능이 더 빠르고 저렴해지고 있다

Performance per dollar is getting faster and cheaper

GLM52와 AMD 조합을 중심으로 성능 대비 비용이 개선되는 흐름을 짚음. 더 빠른 처리 속도와 낮아진 단가가 함께 강조됨.

28
해커뉴스AI/ML2221142026-08-12

Nvidia Nemotron 3.5 Lightning 및 NeMo Switchyard

Nvidia Nemotron 3.5 Lightning and NeMo Switchyard

Nvidia가 Nemotron 3.5 Lightning과 NeMo Switchyard를 공개. 경량 모델과 라우팅 구성으로 RTX와 DGX 환경의 생성형 AI 배포를 겨냥함.

29
해커뉴스AI/ML220302026-06-10

Kolmogorov-Arnold Networks를 통한 FPGAs 기반 초고속 머신러닝

Ultrafast machine learning on FPGAs via Kolmogorov-Arnold Networks

Kolmogorov-Arnold Networks를 FPGA에 올려 초저지연·고처리량 머신러닝을 구현하는 방법을 소개. 하드웨어 가속으로 추론 성능을 끌어올리는 접근.

30
해커뉴스AI/ML216772026-05-31

로컬 디바이스용 1-Bit Bonsai Image 4B 이미지 생성

1-Bit Bonsai Image 4B Image Generation for Local Devices

로컬 디바이스에서 실행 가능한 4B급 이미지 생성 모델 1-Bit Bonsai Image 4B가 소개됨. 저비트 양자화로 온디바이스 활용성과 실행 효율을 강조.

31
해커뉴스AI/ML2141002026-07-03

Jamesob의 SOTA LLM 로컬 실행 가이드

Jamesob's guide to running SOTA LLMs locally

로컬 환경에서 최신 SOTA LLM을 실행하는 방법을 정리한 가이드. 설치, 모델 선택, 운영 팁을 통해 개인 장비에서의 추론 활용성을 높임.

32
해커뉴스AI/ML209412026-05-16

Orthrus-Qwen3: Qwen3에서 최대 7.8배 tokens/forward, 동일한 출력 분포

Orthrus-Qwen3: up to 7.8×tokens/forward on Qwen3, identical output distribution

Orthrus-Qwen3가 Qwen3에서 forward당 처리 토큰 수를 최대 7.8배까지 늘리면서 출력 분포를 동일하게 유지한다고 주장함. LLM 추론 효율 개선을 겨냥한 최적화 기법임.

33
해커뉴스AI/ML206482026-07-07

Ternlight – 브라우저에서 실행되는 7MB 임베딩 모델 (WASM)

Ternlight – 7 MB embedding model that runs in browser (WASM)

브라우저에서 WASM으로 동작하는 초경량 임베딩 모델을 공개. 로컬 추론과 클라이언트사이드 AI의 가능성을 넓힘.

34
해커뉴스AI/ML196812026-08-14

분류하지 말고 환각하라

Don't classify, hallucinate

기존 분류 체계에 맞춰 억지로 라벨링하기보다, 모델이 가설적 분류를 만들어내는 방식을 다룸. 분류 문제를 의사결정 도구가 아닌 추론 도구로 보는 관점을 제시.

35
해커뉴스AI/ML1931102026-07-15

GPU 없이 13년 된 Xeon에서 Gemma 4 26B를 초당 5토큰으로 실행

Running Gemma 4 26B at 5 tokens/sec on a 13-year-old Xeon with no GPU

13년 된 Xeon 단일 서버에서 GPU 없이 Gemma 4 26B를 초당 5토큰으로 구동한 사례. 오래된 CPU 기반 추론 최적화 가능성을 보여줌.

36
해커뉴스AI/ML189882026-05-29

표준 GPU에서 실시간 LLM 추론: 요청당 3k tokens/s

Real-time LLM Inference on Standard GPUs: 3k tokens/s per request

표준 GPU로도 실시간 LLM 추론을 고속 처리하는 방법을 제시. 요청당 초당 3천 토큰 수준의 처리 성능이 핵심.

37
해커뉴스AI/ML188972026-05-10

로컬 AI가 표준이 되어야 함

Local AI needs to be the norm

AI 실행을 클라우드가 아닌 로컬 환경 중심으로 전환해야 한다는 주장. 프라이버시와 비용, 지연시간 측면의 이점을 강조함.

38
해커뉴스AI/ML1872712026-07-10

Apple Silicon 임원이 설명하는 Mac mini AI 수요와 온디바이스 미래

Apple Silicon Exec Explains Mac Mini AI Demand and On-Device Future

Mac mini에 대한 AI 수요가 급증한 배경과 Apple Silicon의 역할을 다룸. 온디바이스 AI가 앞으로의 핵심 방향으로 제시됨.

39
해커뉴스AI/ML183702026-05-30

Liquid AI, 38T로 학습한 8B-A1B MoE 공개

Liquid AI reveals 8B-A1B MoE trained on 38T

Liquid AI가 8B-A1B MoE 모델을 공개함. 38T 토큰으로 학습한 대규모 언어 모델로 소개됨.

40
해커뉴스AI/ML1771142026-06-11

DeepSeek 관련 메모

Notes on DeepSeek

DeepSeek에 대한 관찰과 메모를 정리한 글. 모델 성능, 비용 효율, AI 업계 파급 효과를 다룸.

41
해커뉴스AI/ML172662026-07-03

코드를 이미지로 바꿔 OCR하게 해 Fable 비용 60% 절감

60% Fable cost cut by converting code to images and having the model OCR it

코드를 텍스트로 직접 넣는 대신 이미지로 변환해 모델이 OCR하도록 바꾸며 추론 비용을 60% 줄인 사례. 입력 형식 최적화만으로 비용 효율을 크게 높일 수 있음을 보여줌.

42
해커뉴스AI/ML172452026-05-16

Δ-Mem: 대규모 언어 모델을 위한 효율적 온라인 메모리

Δ-Mem: Efficient Online Memory for Large Language Models

대규모 언어 모델에 적용하는 효율적인 온라인 메모리 기법을 제안. 장기 문맥 유지와 추론 효율 개선을 목표로 함.

43
해커뉴스AI/ML170372026-07-26

8달러 microcontroller에서 2,890만 파라미터 LLM 실행

Running a 28.9M parameter LLM on an $8 microcontroller

저가 microcontroller에서 2,890만 파라미터 LLM을 구동하는 구현이 공개됨. 초소형 하드웨어에서도 경량 추론이 가능함을 보여주는 사례.

44
해커뉴스AI/ML169632026-08-03

AirLLM 70B inference with single 4GB GPU

AirLLM 70B inference with single 4GB GPU

45
해커뉴스AI/ML156542026-06-13

RTX 5080와 RTX 3090 세팅: Qwen 3.6 27B Q8에서 80 tok/s

RTX 5080 and RTX 3090 Setup: 80 Tok/s on Qwen 3.6 27B Q8

RTX 5080과 RTX 3090 조합으로 Qwen 3.6 27B Q8 추론에서 초당 80 토큰 속도를 기록. 하드웨어 세팅과 성능 벤치마크를 공유한 글.

46
해커뉴스AI/ML1451842026-06-29

Tokenmaxxing은 죽었다, Tokenmaxxing 만세

Tokenmaxxing is dead, long live tokenmaxxing

AI 에이전트 시대의 토큰 최적화 담론이 다시 정리됨. 단순한 토큰 절약을 넘어 실제 성능과 비용의 균형이 핵심으로 부각됨.

47
해커뉴스AI/ML143362026-05-03

Show HN: Apple의 SHARP를 ONNX Runtime Web로 브라우저에서 실행

Show HN: Apple's SHARP running in the browser via ONNX runtime web

Apple의 SHARP 모델을 ONNX Runtime Web으로 브라우저에서 구동하는 데모. 로컬 웹 환경에서 머신러닝 추론을 실행하는 구현 사례.

48
해커뉴스AI/ML138402026-04-21

Ternary Bonsai: 1.58비트에서의 최고 지능

Ternary Bonsai: Top Intelligence at 1.58 Bits

극저비트 표현을 활용해 지능형 시스템의 효율과 성능을 탐구하는 제안. ternary 표현으로 모델 압축과 추론 효율을 노린다.

49
해커뉴스AI/ML135282026-06-07

추측적 KV 코딩: KV 캐시를 최대 약 4배 무손실 압축

Speculative KV coding: losslessly compressing KV cache by up to ~4×

LLM 추론의 KV 캐시를 무손실로 최대 약 4배 압축하는 기법을 제안함. 저장 공간과 메모리 대역폭 부담을 줄여 추론 효율 개선을 노림.

50
해커뉴스AI/ML1321242026-06-25

오픈 웨이트 모델의 견디기 힘든 저렴함

The unbearable cheapness of open weight models

오픈 웨이트 모델의 사용 비용이 예상보다 빠르게 낮아지며 고성능 모델 접근성이 크게 넓어짐. 모델 경쟁의 중심이 가격보다 배포, 운영, 제품화로 이동하는 흐름.

51
해커뉴스AI/ML132132026-06-05

Huawei의 vLLM용 KV-cache 양자화 네이티브 백엔드 KVarN

KVarN: Native vLLM backend for KV-cache quantization by Huawei

vLLM에서 KV-cache 양자화를 지원하는 네이티브 백엔드 KVarN을 소개. 메모리 사용량과 추론 효율 개선을 노린 구성.

52
해커뉴스AI/ML132202026-04-27

TurboQuant: 첫 원리부터 따라가는 해설

TurboQuant: A first-principles walkthrough

TurboQuant의 동작 원리를 기초부터 풀어쓴 기술 글. 모델 양자화와 추론 효율 개선을 이해하는 데 초점이 있다.

53
해커뉴스AI/ML131392026-07-21

단 한 번의 편집에는 frontier model 하나면 충분하다

You only need the frontier model for one single edit

작은 편집 작업에서도 고성능 frontier model이 필요한 지점을 짚음. 모델 선택을 작업 단위로 최적화하는 편집 워크플로를 제안.

54
해커뉴스AI/ML124262026-04-25

질문 8개로 만든 3D Body – 사진도, GPU도 없음

A 3D Body from Eight Questions – No Photo, No GPU

사진 없이 8개 질문만으로 3D 신체를 생성하는 방법을 소개. GPU 없이도 동작하는 경량 추정·생성 접근을 강조.

55
해커뉴스AI/ML122362026-07-07

불안정한 네트워크 환경에서 Small AI Models가 주목받다

Small AI Models Gain Traction In places with unreliable networks

네트워크가 불안정한 환경에서 소형 AI 모델의 활용성이 부각됨. 연결 의존도를 낮춘 온디바이스·로컬 추론 수요가 커지는 흐름.

56
해커뉴스AI/ML121302026-04-21

Soul Player C64 - 1MHz Commodore 64에서 동작하는 실제 Transformer

Soul Player C64 – A real transformer running on a 1 MHz Commodore 64

1MHz Commodore 64에서 실제 Transformer를 구동한 프로젝트. 극도로 제한된 하드웨어에서의 추론 최적화와 모델 경량화가 핵심이다.

57
해커뉴스AI/ML120502026-06-17

SubQ 1.1 Small

SubQ 1.1 Small

SubQ 1.1 Small 기술 보고서. 소형 모델의 성능과 효율을 중심으로 한 업데이트를 다룸.

58
해커뉴스AI/ML118562026-07-23

Show HN: Echo – open-weight 모델로 Fable급 결과를 3분의 1 비용으로 구현

Show HN: Echo – Fable-level results at 1/3 the cost using open-weight models

Echo가 open-weight 모델 조합으로 Fable 수준의 결과를 더 낮은 비용에 제공한다고 소개. 생성형 AI 워크플로의 비용 최적화 가능성을 강조함.

59
해커뉴스AI/ML116542026-08-14

AI At Home 1부: 잡동사니 상자

AI At Home Part 1: A Box Of Scraps

가정용 환경에서 AI를 구축하는 과정을 다룬 연재의 첫 글. 제한된 자원과 임시 부품으로 시스템을 구성하는 접근을 소개함.

60
해커뉴스AI/ML116452026-06-02

MAI-Thinking-1

MAI-Thinking-1

Microsoft AI가 추론 중심 모델 MAI-Thinking-1을 공개. 복잡한 사고와 문제 해결 성능을 강조한 신규 모델 라인업.

61
해커뉴스AI/ML114232026-07-07

Kokoro로 로컬 CPU 친화적 고품질 TTS(Text-to-Speech)

Local, CPU-Friendly, High-Quality TTS (Text-to-Speech) with Kokoro

Kokoro는 로컬 CPU에서도 실행 가능한 고품질 TTS 모델로 소개됨. 경량 추론과 음성 품질의 균형이 핵심 포인트.

62
해커뉴스AI/ML113242026-08-11

Nvidia Nemotron 3.5 Lightning

Nvidia Nemotron 3.5 Lightning

Nvidia의 Nemotron 3.5 Lightning 모델 공개. 경량화된 대규모 언어모델 계열로 보이며 추론 효율을 강조.

63
해커뉴스AI/ML112102026-07-26

Inflect-Micro-v2: 936만 파라미터로 구현한 완전한 음성 모델

Inflect-Micro-v2: complete voice in 9.36M parameters

Inflect-Micro-v2가 936만 파라미터 규모에서 완전한 음성 기능을 구현한 모델로 소개됨. 초경량 음성 모델의 효율성과 품질 균형이 주목됨.

64
해커뉴스AI/ML112432026-07-11

MiMo v2.5 추론 최적화: 하이브리드 SWA 효율을 한계까지 끌어올리기

Inference Optimization for MiMo v2.5: Pushing Hybrid SWA Efficiency to the Limit

MiMo v2.5의 추론 경로를 최적화해 하이브리드 SWA 효율을 극대화한 기술 분석. 모델 성능을 유지하면서 지연시간과 연산 비용을 낮추는 데 초점.

65
해커뉴스AI/ML110152026-05-01

LLM용 고급 양자화 알고리즘

Advanced Quantization Algorithm for LLMs

Intel의 auto-round가 LLM 압축을 위한 고급 quantization 알고리즘을 제공함. 추론 효율을 높이고 모델 배포 비용을 줄이는 데 초점을 둠.

66
해커뉴스AI/ML106302026-08-05

Maple-Preview – iPhone에서 초당 120토큰을 처리하는 Ternary 20B MoE

Show HN: Maple-Preview – Ternary 20B MoE running at 120 tok/s on a iPhone

Maple-Preview 공개: 20B MoE 모델이 iPhone에서 120 tok/s로 동작. 삼진 가중치 사용.

67
해커뉴스AI/ML104412026-07-31

29 GB RAM으로 Kimi K3를 0.50 tok/s로 실행하기

Run Kimi K3 using 29 GB of RAM at 0.50 tok/s

29GB RAM 환경에서 Kimi K3를 저속으로 구동하는 방법을 다룸. 로컬 실행의 메모리 요구량과 추론 속도를 보여줌.

68
해커뉴스AI/ML101332026-07-29

Kimi K3 자체 호스팅: 하드웨어 비용 20% 증가, 작업 해결률 20% 향상

Self-hosting Kimi K3: 20% more hardware cost, 20% better task resolution

Kimi K3를 자체 호스팅할 때 하드웨어 비용이 약 20% 늘어나는 대신 작업 해결률이 약 20% 개선된다는 분석. 운영 비용과 성능의 맞교환이 핵심.

69
해커뉴스AI/ML101122026-05-22

Multi-Stream LLMs: 프롬프트, 사고, I/O를 병렬화·분리하는 새 논문

Multi-Stream LLMs: new paper on parallelizing/separating prompts, thinking, I/O

프롬프트 처리, 추론, 입출력 흐름을 분리해 병렬화하는 LLM 아키텍처를 다룬 새 논문. 모델 실행 구조 최적화와 처리 효율 개선을 겨냥.