전체 기사
51개 기사 · AI/ML
Qwen 3.8 27B
Qwen 3.8 27B
Qwen 3.8 27B 모델이 공개됨. Hugging Face를 통해 FP8 가중치가 배포되며 오픈소스 LLM 라인업이 확장됨.
Opus 5는 왜 작업하기 더 불편하게 느껴지나?
Why does Opus 5 feel worse to work with?
Opus 5를 실제 작업에 쓸 때 불편함이 커진 이유를 분석. 응답 성향과 작업 흐름의 변화가 핵심 쟁점으로 제기됨.
Claude: 시스템 프롬프트
Claude: System Prompts
Claude 플랫폼의 system prompts 관련 릴리스 노트 공개. 모델 동작과 프롬프트 처리 방식에 대한 문서 업데이트가 핵심.
Qwen 3.8 27B는 뛰어나지만 기본값이 과도한 추론에 치우친다
Qwen 3.8 27B is excellent, but it defaults to overthinking things
Qwen 3.8 27B 모델의 성능은 높지만 기본 동작이 과도한 추론에 기운다는 평가. 속도와 응답 효율을 위한 튜닝 필요성이 부각됨.
AI;DR (AI; 읽지 않았다)
AI;DR (AI; Didn't Read)
AI 요약과 자동화된 독해가 본문을 충분히 읽지 않은 채 결론만 소비하게 만든다는 비판을 다룸. 생성형 AI 시대의 정보 소비 습관을 되짚는 글.
AI는 수학자를 앞서 생각하는 게 아니다. 더 잘 기억할 뿐이다
AI Isn't Outthinking Mathematicians. It's Out-Remembering Them
AI의 성능을 추론력보다 방대한 패턴 기억과 재현 능력으로 해석한 글. 수학적 창의성과 일반화 한계를 함께 점검함.
OpenAI의 GPT 5.6 Sol, 역대 최고의 vision 모델
GPT 5.6 Sol is the best "vision" model OpenAI ever released
Roboflow가 OpenAI의 GPT 5.6 Sol을 평가한 글. 이미지 이해 성능에서 OpenAI가 지금까지 내놓은 모델 중 가장 강하다고 소개한다.
Qwen3.8 27B, Artificial Analysis에서 52점 기록
Qwen3.8 27B scores 52 on Artificial Analysis
Qwen3.8 27B가 Artificial Analysis 벤치마크에서 52점을 기록했다. 오픈 모델 성능 경쟁에서 상위권 추격 흐름이 이어지는 모습.
DeepSeek 피크/비피크 요금 업데이트
DeepSeek peak/off-peak pricing update
DeepSeek API의 피크·비피크 시간대 요금 체계를 업데이트함. 수요가 낮은 시간대 활용 시 비용 최적화 여지를 제공.
AI 규제와 메시지 전략
On AI regulation and messaging
AI 규제를 둘러싼 메시지 전달 방식과 대중 설득의 문제를 다룬 글. 규제 논의가 기술 성능보다 커뮤니케이션과 정치적 맥락에 좌우될 수 있음을 시사.
AI와 일하는 일은 코딩보다 리더십에 더 가깝다
Working with AI Feels More Like Leadership Than Coding
AI와의 협업이 단순 구현보다 방향 설정과 조율에 더 가까워졌다는 관점. 프롬프트 작성보다 목표 분해, 검토, 의사결정이 핵심 역량으로 부상함.
Anthropic의 Claude '워터마크' 텍스트 변조는 글쓰기의 왜곡이다
Anthropic's 'watermark' text adulteration in Claude is a perversion of writing
Claude의 출력에 워터마크성 텍스트 변조를 넣는 방식이 논란. 생성형 AI가 문장과 문체를 훼손할 수 있다는 비판이 제기됨.
Claude Code 세션의 가치를 극대화하는 방법
Maximizing the value of your Claude Code sessions
Claude Code 세션을 더 효율적으로 쓰는 실전 팁과 작업 방식 정리. 컨텍스트 활용, 반복 작업 정리, 세션 운영 전략이 중심.
Nvidia, OpenAI 인프라 파이낸싱 보장 규모 대폭 축소
Nvidia dramatically reduces amount of OpenAI infra financing it may guarantee
Nvidia가 OpenAI 데이터센터 관련 보장형 파이낸싱 규모를 크게 줄인 것으로 전해짐. 대규모 AI 인프라 자금조달에 대한 시장 기대를 낮추는 신호로 해석됨.
분류하지 말고 환각하라
Don't classify, hallucinate
기존 분류 체계에 맞춰 억지로 라벨링하기보다, 모델이 가설적 분류를 만들어내는 방식을 다룸. 분류 문제를 의사결정 도구가 아닌 추론 도구로 보는 관점을 제시.
Emerging multi-agent systems의 패턴과 문제점
Patterns and problems in emerging multi-agent systems
다중 에이전트 시스템에서 반복적으로 나타나는 설계 패턴과 실패 모드를 정리한 연구. 협업 구조가 복잡해질수록 조율 비용, 신뢰성, 디버깅 난도가 빠르게 커진다는 점을 짚음.
모델은 의도적으로 더 둔해지고 있다
Models Are Getting Dumber on Purpose
AI 모델이 비용, 안전, 운영 통제를 이유로 일부러 덜 유능하게 설계되고 있다는 문제를 다룸. 고성능보다 제약된 출력과 관리 용이성이 우선되는 흐름을 지적함.
Toast 1 발표
Introducing Toast 1
Mixedbread가 Toast 1을 공개했다. 새로운 AI 제품 또는 모델을 전면에 내세운 출시 소식이다.
신약 개발에서의 AI: 무엇이고, 어디까지 왔으며, 앞으로의 과제
AI in drug discovery – what it is, where we stand and the path forward
AI가 신약 탐색과 후보 물질 발굴에 활용되는 방식과 현재 성과를 정리함. 실제 임상 가치로 이어지기 위한 데이터, 검증, 해석 가능성 과제가 남아 있음.
손으로 만드는 AI
AI by Hand
AI를 직접 만들고 이해하는 과정을 강조한 프로젝트. 자동화된 블랙박스보다 수작업 기반의 실험과 학습에 초점을 둔다.
Anthropic의 오픈소스 AI와의 전쟁
Anthropic's War on open source AI
Anthropic의 오픈소스 AI 대응을 비판하는 글. 공개 모델 생태계와의 경쟁 및 정책 방향을 둘러싼 논쟁을 다룸.
텍스트 AI 워터마크는 항상 쉽게 제거된다
Text AI watermarks will always be trivial to remove
텍스트 생성 AI의 워터마크는 실사용 환경에서 쉽게 제거된다는 주장. 탐지보다 우회가 더 쉬워 방어 수단으로서의 효용이 낮다는 관점.
AI At Home 1부: 잡동사니 상자
AI At Home Part 1: A Box Of Scraps
가정용 환경에서 AI를 구축하는 과정을 다룬 연재의 첫 글. 제한된 자원과 임시 부품으로 시스템을 구성하는 접근을 소개함.
Show HN: ThoughtDAG – LLM 대화를 위한 편집 가능한 컨텍스트 그래프
Show HN: ThoughtDAG – An editable context graph for LLM conversations
LLM 대화 맥락을 DAG 형태로 관리하는 편집 도구가 소개됨. 대화 노드와 연결 관계를 수정하며 컨텍스트 추적성을 높이는 방식.
Claude의 ‘워터마크’가 글쓰기를 왜곡하는 방식
Claude의 ‘워터마크’가 글쓰기를 왜곡하는 방식
Anthropic이 EU 규정 준수를 위해 Claude의 200토큰 초과 생성 텍스트에 워터마크를 적용할 예정. 보이지 않는 문자가 아니라 비밀 키로 토큰 선택 확률을 조정해 글의 스타일과 단어 분포를 바꾸는 방식.
AI 크레딧 재판매 시장 - Token Broker와 Relay는 어떻게 움직이나
AI 크레딧 재판매 시장 - 토큰 브로커와 Relay는 어떻게 움직이나
OpenAI, Anthropic 등 AI API 크레딧을 공식가보다 싸게 재유통하는 시장이 커짐. 남는 크레딧을 사고파는 Token Broker와 여러 계정·API Key를 묶어 단일 Endpoint로 제공하는 Relay 구조가 확산됨.
모델은 의도적으로 더 멍청해지고 있다
모델은 의도적으로 더 멍청해지고 있다
소형·MoE 모델은 적은 활성 파라미터로 수학·코딩 추론을 강화하는 대신 세부 사실 회상은 약해지는 경향이 있음. 사실 지식보다 문제 분해, 검산, 되돌아가기 같은 추론 절차에 용량을 더 쓰는 방향으로 최적화가 이동함.
Qwen 3.8 27B는 뛰어나지만 기본 설정에서 추론 시간이 지나치게 김
Qwen 3.8 27B는 뛰어나지만 기본 설정에서 지나치게 오래 추론함
Alibaba Qwen 3.8 27B는 비전 기능, 262,144토큰 컨텍스트, 17GB 양자화 파일로 노트북에서도 코드 작성과 도구 호출, 이미지 분석을 수행함. 다만 기본 추론 강도 xhigh가 단순 요청에도 과도하게 작동해 응답 지연이 커짐.
Claude 시스템 프롬프트 변경 이력
Claude 시스템 프롬프트 변경 이력
Claude 웹·모바일 앱의 시스템 프롬프트 변경 내역을 추적한 글. 최신 정보 주입, 응답 행동 지침, Markdown 코드 포맷 강제 등 응답 품질 조정 방식이 정리됨.
LLM이 5학년 이후 학습 자료를 전혀 보지 못하면 어떻게 될까?
LLM이 5학년 이후의 학습 자료를 전혀 보지 못하면 어떻게 될까?
LittleLearner를 미국 초등학교 K–5 교육과정으로만 제한한 880억 토큰 말뭉치로 처음부터 학습해, 사전학습 지식의 경계가 모델 능력에 미치는 영향을 검증함. FineWeb-Edu를 Common Core 기준의 5단계 파이프라인으로 필터링하고 5학년 이후 개념·사실·어휘를 명시적으로 제외함.
AI는 수학자보다 더 잘 생각하는 게 아니라 더 많이 기억함
AI는 수학자보다 더 잘 생각하는 게 아니라 더 많이 기억함
AI 수학 성능은 단순한 추론력보다 긴 컨텍스트를 작업 공간처럼 활용해 조건, 중간 계산, 실패한 시도를 함께 유지하는 능력에서 나올 수 있음. 인간은 작업 기억을 청킹과 메모로 보완하지만, AI는 긴 추론 사슬을 넓게 보존하는 방식으로 강점을 보임.
AI와 일하는 방식은 코딩보다 리더십에 가깝다
AI와 일하는 방식은 코딩보다 리더십에 가깝다
AI는 같은 요청에도 다른 답을 낼 수 있어 정확한 명령보다 맥락, 명확성, 피드백이 더 중요함. 컴파일러처럼 통제하기보다 의도를 주고받는 협업 대상으로 다룰 때 활용도가 높아짐.
내가 여전히 회의적인 이유
내가 여전히 회의적인 이유
LLM이 비자명한 소프트웨어 개발에 실제로 효과적인지 아직 입증되지 않았다는 회의론. 4년간의 혁명에도 품질·속도·비용·기능·보안 개선이 뚜렷하지 않았다는 지적.
Graph 엔지니어링 vs Loop 엔지니어링: 실제로 달라진 것은 무엇인가
Graph 엔지니어링 vs Loop 엔지니어링: 실제로 달라진 것은 무엇인가
Graph Engineering은 여러 Agent Loop를 하나의 작업 흐름으로 연결하는 오케스트레이션에 가까움. 병렬 실행, 검증, 작업 인계, 공유 상태, 중단 조건을 명시적으로 설계하는 방식으로 정리됨.
AI by Hand — 손으로 익히는 AI 수학·알고리즘·아키텍처
AI by Hand — 손으로 익히는 AI 수학·알고리듬·아키텍처
AI의 수학, 알고리즘, 아키텍처를 손으로 따라가며 학습하는 콘텐츠를 소개. Qwen 3.6, Gemma 4, OpenClaw, Google Ironwood TPU 등 최신 모델과 미세조정·강화학습 주제도 다룸.
Codex 자동 연구로 기준보다 232배 빠른 GPU 커널 만들기
Codex 자동 연구로 기준보다 232배 빠른 GPU 커널 만들기
GPU Mode qr_v2 대회에서 Codex 기반 반복 최적화로 torch.geqrf 기준 419,000µs를 1,805µs까지 줄여 183명 중 12위를 기록함. 순차 의존성이 큰 Householder QR을 블록 Householder와 WY 표현으로 재구성해 성능을 끌어올림.
DeepSeek 피크·오프피크 API 요금 업데이트
DeepSeek 피크·오프피크 API 요금 업데이트
DeepSeek가 V4 라인업과 함께 피크·오프피크 API 요금제를 도입. 오프피크는 50% 저렴하며, 2026년 8월 16일부터 새 요금이 적용됨.
Qwen 3.8 27B
Qwen 3.8 27B
Qwen3.8-27B-FP8은 이미지·영상 이해와 장기 에이전트 작업을 지원하는 270억 파라미터 밀집형 모델. FP8 양자화 가중치를 제공하며 기본 추론 모드는 요청별로 끌 수 있음.
Qwen3.8-27B, 17~19GB 메모리에서 4-bit 로컬 실행 가능
Qwen3.8-27B, 17~19GB 메모리에서 4-bit 로컬 실행 가능
Qwen3.8-27B가 Unsloth GGUF/NVFP4로 공개되며 개인 장비에서 4-bit 로컬 실행이 가능해짐. 비전, 추론, 256K 컨텍스트를 지원하고 YaRN으로 최대 1M 컨텍스트 확장도 가능.
AI 텍스트 워터마킹의 작동 원리
AI 텍스트 워터마킹의 작동 원리
AI 텍스트 워터마킹은 문자 삽입이 아니라 다음 단어 선택 확률에 비밀 패턴을 심는 방식. Google Gemini와 최신 Claude가 모델 수준 워터마킹을 적용하고 있음.
실전 루프 엔지니어링
실전 루프 엔지니어링
에이전트 루프 설계의 핵심은 자율성 확대보다 완료 조건과 제약을 명확히 두는 것. 어떤 판단을 사람에게 남길지 정하고 반복 실행을 제어해야 안정적으로 동작함.
Suno Studio 2.0 - MIDI와 AI Chat을 결합한 본격적인 음악 제작 도구
Suno Studio 2.0 - MIDI와 AI Chat을 결합한 본격적인 음악 제작 도구
Suno가 Studio 2.0을 공개하며 MIDI 편집, 음량·효과 자동 조절, 신시사이저, 음원 분리 기능을 추가. 단순한 AI 음악 생성기를 넘어 DAW에 가까운 제작 도구로 확장함.
Google, 동형 암호화로 Private AI를 실용화
Google, 동형 암호화로 프라이빗 AI를 실용화
Google이 암호화된 데이터를 복호화하지 않고 AI 추론에 활용하는 오픈소스 컴파일러 HEIR를 Private Computing Toolkit에 추가. 서버가 암호문만 처리해 사용자 데이터 보호와 프라이빗 AI 적용 범위를 넓힘.
GLM-5.3: 포스트 트레이닝 확장으로 프런티어급 코딩·사이버 역량 달성
GLM-5.3: 포스트 트레이닝 확장으로 프런티어급 코딩·사이버 역량 달성
기반 모델은 유지한 채 환경·과제·연산을 늘리는 포스트 트레이닝 확장으로 코딩과 장기 과제 성능을 끌어올림. Terminal Bench 3.0과 DeepSWE v1.1 등에서 유의미한 상승을 보임.
Qwen3.8-27B 출시 예정
Qwen3.8-27B Upcoming release
한국 시간 8월 15일 00시 공개 예정인 Qwen3.8-27B 모델 소개 글. 벤치마크는 아직 미공개이며 확장 토큰 문맥 길이는 100만 토큰으로 표기됨.
Mistral OCR 4.1 공개
Mistral OCR 4.1 공개
Mistral AI의 최신 OCR 서비스가 2026년 7월 16일 Public Preview로 공개됨. 문단 경계 상자, 구조적 블록 레이블, 블록 단위 신뢰도 점수를 기본 제공함.
이해가 새로운 병목이다
이해가 새로운 병목이다
AI 에이전트가 코드를 빠르게 생성하면서 인간의 이해 속도가 새로운 병목으로 부상했다. 단순 검증을 넘어 아이디어를 만들고 프로젝트를 발전시키는 개념적 유창성이 더 중요해지고 있다.
Opus 5는 왜 함께 작업하기 더 불편하게 느껴지는가?
Opus 5는 왜 함께 작업하기 더 불편하게 느껴지는가?
Opus 5는 벤치마크 성능은 높지만 실제 작업에서는 더 세밀한 감독이 필요하다는 평가. 의도 불명확 시 질문하고 계획을 보정하던 이전 모델과 달리 확인 절차가 약해 협업 부담이 커졌다는 지적이다.
하나의 프롬프트를 11개 AI 모델에 실행했더니 나온 서로 다른 결과
하나의 프롬프트를 11개 AI 모델에 실행했더니 나온 서로 다른 결과
Netlify가 동일한 커피숍 웹사이트 프롬프트를 11개 AI 모델에 각각 3회씩 실행해 결과를 비교함. 디자인·콘텐츠 품질과 평균 크레딧 사용량이 모델별로 크게 달라, 실제 생성 결과 기준의 주관적 벤치마크임을 보여줌.
Gemini 3.7 Flash
Gemini 3.7 Flash
Google이 3.6 Flash 출시 3주 만에 Gemini 3.7 Flash를 공개함. 소프트웨어 엔지니어링, 지식 업무, 웹 개발 벤치마크에서 3.6 Flash보다 높은 성능을 보였다.
palmier-pro - AI를 위해 만든 macOS 영상 편집기
palmier-pro - AI를 위해 만든 macOS 영상 편집기
타임라인 안에서 사용자와 에이전트가 함께 영상 생성·편집을 수행하는 오픈소스 macOS 편집기. Swift로 새로 개발됐으며 AI 도구를 워크플로에 깊게 통합하도록 설계.