검색 결과
"inference" · 9개 기사 · Cloud/Infra
Apple Silicon과 macOS VM: llama.cpp로 더 빠른 LLM 추론
Apple Silicon and macOS VMs: Faster LLM Inference with llama.cpp
Apple Silicon과 macOS VM 조합에서 llama.cpp 추론 성능을 끌어올리는 방법을 다룸. 로컬 LLM 실행을 위한 VM 활용과 가속 구성이 핵심.
AMD MI300X에서 DeepSeek-V4-Flash 구동하기
Bringing Up DeepSeek-V4-Flash on AMD MI300X
AMD MI300X에서 DeepSeek-V4-Flash를 실제로 올리고 실행하는 과정을 다룸. 모델 포팅과 하드웨어 최적화 이슈를 중심으로 정리한 기술 글.
GPT-5.6 Sol을 초당 750토큰으로 가속하는 Ultrafast Mode
GPT-5.6 Sol을 초당 750토큰으로 가속하는 Ultrafast Mode
Cerebras와 OpenAI가 API의 새 서비스 계층인 Ultrafast Mode를 일부 고객에게 제한 공개함. GPT-5.6 Sol에서 품질 저하 없이 초당 최대 750개 출력 토큰을 제공한다.
가져갈 수 없는 세션: 추론 API가 만드는 새로운 종속성
가져갈 수 없는 세션: 추론 API가 만드는 새로운 종속성
추론 API가 암호화된 추론 결과와 압축 상태, 서브에이전트 메시지를 공급자 내부에 가두며 세션 이식성을 약화시키고 있음. 사용자는 완전한 대화 기록이 아니라 일부만 보이는 사본에 의존하게 되는 구조가 문제로 지적됨.
소프트웨어가 세상을 먹어 치웠고, 이제 하드웨어가 소프트웨어를 먹고 있다
소프트웨어가 세상을 먹어 치웠고, 이제 하드웨어가 소프트웨어를 먹고 있다
AI 시대에는 가치 중심이 SaaS 애플리케이션에서 반도체, 컴퓨팅, 데이터, 추론 플랫폼으로 이동하고 있다. CoWoS, HBM, 전력 같은 물리적 병목과 데이터 전환 비용으로 애플리케이션 계층은 더 얇아지고 있다.
AI 토큰은 데이터센터를 어떻게 통과하는가
AI 토큰은 데이터센터를 어떻게 여행하는가
AI 추론이 전체 AI 컴퓨팅의 대부분을 차지하면서 토큰 처리 비용과 지연시간이 인프라 경제성을 좌우하는 핵심 변수가 됨. 요청은 토큰화부터 API 게이트웨이, 라우팅, KV 캐시, GPU·HBM, 네트워크까지 여러 계층을 거치며 비용이 누적됨.
달러당 성능은 더 빠르고 저렴해지고 있다
달러당 성능이 더 빠르고 저렴해지고 있음
추론 수요 확대 속에 GPU와 토큰 비용이 오르지만, AMD MI355X가 B300 대비 GPU당 평균 약 2.75배 저렴한 대안으로 부상. AMD MI350 계열은 하드웨어 성능에서 경쟁하지만, NVIDIA는 소프트웨어와 day-0 지원이 강점.
Cafe24, LLM Router 공개
Cafe24, LLM Router 공개
Claude, Gemini, Qwen, Llama, DeepSeek 등 100개 이상 모델을 단일 엔드포인트로 호출하는 통합 LLM 인프라를 공개함. OpenAI 호환 API로 provider별 명세, 재시도, 스트리밍 차이를 한 번에 흡수하도록 설계.
유휴 Inference GPU Pool을 이용한 GPU Job 스케줄링
유휴 Inference GPU Pool을 이용한 GPU Job 스케줄링
LG AI연구원이 LLM 서비스 운영 중 남는 inference GPU를 연구·실험 작업에 재활용한 사례를 소개함. 운영용 GPU 풀의 유휴 시간을 활용해 자원 효율과 작업 처리율을 높이는 방식이다.