검색 결과
"ai" · 105개 기사 · AI/ML
Muse Glimmer: 상시 실행 로컬 에이전트 워크플로우에 최적화된 30B 파라미터 모델
Muse Glimmer: 30B-parameter model optimized for always-on local agent workflows
Meta가 로컬에서 항상 동작하는 에이전트 워크플로우를 겨냥한 30B 규모 모델을 소개함. 온디바이스 또는 로컬 환경 중심의 에이전틱 AI 활용을 강화하려는 흐름으로 보임.
Opus 5는 왜 작업하기 더 불편하게 느껴지나?
Why does Opus 5 feel worse to work with?
Opus 5를 실제 작업에 쓸 때 불편함이 커진 이유를 분석. 응답 성향과 작업 흐름의 변화가 핵심 쟁점으로 제기됨.
AI가 소프트웨어 엔지니어링의 중간층을 없애고 있는가?
AI is removing the middle class of software engineering?
AI 도입이 소프트웨어 엔지니어링의 중간 숙련층 역할을 압박하고 있음. 개발 생산성 재편과 직무 구조 변화가 핵심 쟁점으로 부상.
DeepSeek V4 Pro 0813
DeepSeek V4 Pro 0813
DeepSeek V4 Pro 0813 버전이 공개됨. 최신 대형 언어모델 업데이트로 성능과 추론 능력 개선을 노림.
DeepSeek Harness 개발자 프리뷰
DeepSeek Harness developer preview
DeepSeek용 Harness 개발자 프리뷰가 공개됨. 모델 평가, 실험, 워크플로 검증을 위한 도구 접근성이 확대됨.
Show HN: Needle2: 휴대폰, 웨어러블, 스마트홈, 로봇용 14MB agentic LLM
Show HN: Needle2: 14MB agentic LLM for phones, wearables, smart home and robots
14MB 규모의 agentic LLM Needle2를 공개. 휴대폰과 웨어러블, 스마트홈, 로봇 같은 엣지 기기에서의 온디바이스 추론을 겨냥.
Claude: 시스템 프롬프트
Claude: System Prompts
Claude 플랫폼의 system prompts 관련 릴리스 노트 공개. 모델 동작과 프롬프트 처리 방식에 대한 문서 업데이트가 핵심.
H3-metal – Apple Silicon용 네이티브 MiniMax-H3 추론
H3-metal – Native MiniMax-H3 inference for Apple Silicon
Apple Silicon에서 MiniMax-H3를 네이티브로 구동하는 추론 경로를 소개. Mac 로컬 환경에서의 AI 추론 성능 최적화 흐름에 초점.
Claude가 AI 생성 콘텐츠를 표시하는 방식
How Claude marks AI-generated content
Claude가 AI 생성 콘텐츠를 어떻게 표기하고 구분하는지 설명한 문서. 생성형 AI의 투명성 표시 기준과 사용자 고지 방식이 핵심.
GLM-5.3: Emergent cyber capabilities를 가진 frontier 코딩 모델
GLM-5.3: Frontier coding with emergent cyber capabilities
GLM-5.3의 코딩 성능과 새로 드러난 cyber 관련 능력을 소개하는 모델 발표 글. 고난도 개발 작업 대응력을 강조함.
덴마크, AI 부정행위 대응 위해 학생 필기 과제에 구술 دفاع 요구
Denmark Requires Oral Defenses for Students' Written Work to Counter AI Cheating
덴마크가 AI 부정행위 억제를 위해 학생들의 서면 과제에 구술 دفاع를 요구. 제출물 진위 확인을 강화하는 교육 정책 변화.
DeepMind의 WeatherNext 모델, 사이클론 예측에서 돌파구 달성
DeepMind's WeatherNext model achieves breakthrough forecasting cyclones
DeepMind의 WeatherNext가 사이클론 예측 정확도 향상에서 의미 있는 성과를 보였다는 내용. AI 기반 기상 예보의 실용화 가능성을 넓히는 사례.
AI;DR (AI; 읽지 않았다)
AI;DR (AI; Didn't Read)
AI 요약과 자동화된 독해가 본문을 충분히 읽지 않은 채 결론만 소비하게 만든다는 비판을 다룸. 생성형 AI 시대의 정보 소비 습관을 되짚는 글.
이해가 새로운 병목
Understanding is the new bottleneck
AI 시대에 모델 사용보다 문제 이해가 더 큰 병목이 되고 있음을 지적. 복잡한 시스템에서 맥락 파악과 해석 능력의 중요성을 강조.
Grok 4.6
Grok 4.6
xAI가 Grok 4.6을 공개했음. 새 모델의 성능과 기능 개선이 주목 포인트.
AI는 수학자를 앞서 생각하는 게 아니다. 더 잘 기억할 뿐이다
AI Isn't Outthinking Mathematicians. It's Out-Remembering Them
AI의 성능을 추론력보다 방대한 패턴 기억과 재현 능력으로 해석한 글. 수학적 창의성과 일반화 한계를 함께 점검함.
GPT-5.6 Sol을 ultrafast로 가속
Accelerating GPT-5.6 Sol Ultrafast
Cerebras가 OpenAI의 GPT-5.6 Sol을 초고속 추론 경로로 가속하는 내용을 공개. 대형 모델 응답 지연을 줄이는 인프라 최적화가 핵심.
OpenAI의 GPT 5.6 Sol, 역대 최고의 vision 모델
GPT 5.6 Sol is the best "vision" model OpenAI ever released
Roboflow가 OpenAI의 GPT 5.6 Sol을 평가한 글. 이미지 이해 성능에서 OpenAI가 지금까지 내놓은 모델 중 가장 강하다고 소개한다.
Grok Bot
Grok Bot
xAI의 Grok 봇 소개 페이지. 대화형 AI 봇을 통해 X 생태계와 연동되는 사용 경험을 전면에 내세움.
Grok 4.6, Artificial Analysis Intelligence Index에서 61점 기록
Grok 4.6 scores 61 on the Artificial Analysis Intelligence Index
Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 기록함. 최신 모델 성능 비교에서 경쟁력 있는 수치를 제시하며 벤치마크 관심을 끌고 있음.
Meta, 다시 오픈 모델로 돌아가며 '폐쇄형' AI 경쟁사를 공격
Mark Zuckerberg attacks 'closed' AI rivals as Meta returns to open models
Mark Zuckerberg가 폐쇄형 AI 전략을 비판하며 Meta의 오픈 모델 기조 복귀를 강조함. AI 생태계 주도권을 둘러싼 경쟁 구도가 재점화됨.
AI 규제와 메시지 전략
On AI regulation and messaging
AI 규제를 둘러싼 메시지 전달 방식과 대중 설득의 문제를 다룬 글. 규제 논의가 기술 성능보다 커뮤니케이션과 정치적 맥락에 좌우될 수 있음을 시사.
Nvidia Nemotron 3.5 Lightning 및 NeMo Switchyard
Nvidia Nemotron 3.5 Lightning and NeMo Switchyard
Nvidia가 Nemotron 3.5 Lightning과 NeMo Switchyard를 공개. 경량 모델과 라우팅 구성으로 RTX와 DGX 환경의 생성형 AI 배포를 겨냥함.
LLM은 어떤 수학을 잘하는가?
What sort of maths are LLMs good at?
LLM이 강한 수학 문제 유형과 약한 유형을 구분해 분석한 글. 추론, 패턴 인식, 계산 능력의 한계를 짚음.
AI와 일하는 일은 코딩보다 리더십에 더 가깝다
Working with AI Feels More Like Leadership Than Coding
AI와의 협업이 단순 구현보다 방향 설정과 조율에 더 가까워졌다는 관점. 프롬프트 작성보다 목표 분해, 검토, 의사결정이 핵심 역량으로 부상함.
WorldClaw 에이전틱 3D 오픈월드 생성 at scale
WorldClaw Agentic 3D open-world generation at scale
Tencent Hunyuan의 WorldClaw가 대규모 3D 오픈월드 생성을 다룸. 에이전틱 방식으로 복잡한 월드 제작을 자동화하는 접근을 제시함.
Anthropic의 Claude '워터마크' 텍스트 변조는 글쓰기의 왜곡이다
Anthropic's 'watermark' text adulteration in Claude is a perversion of writing
Claude의 출력에 워터마크성 텍스트 변조를 넣는 방식이 논란. 생성형 AI가 문장과 문체를 훼손할 수 있다는 비판이 제기됨.
Claude Code 세션의 가치를 극대화하는 방법
Maximizing the value of your Claude Code sessions
Claude Code 세션을 더 효율적으로 쓰는 실전 팁과 작업 방식 정리. 컨텍스트 활용, 반복 작업 정리, 세션 운영 전략이 중심.
Nvidia, OpenAI 인프라 파이낸싱 보장 규모 대폭 축소
Nvidia dramatically reduces amount of OpenAI infra financing it may guarantee
Nvidia가 OpenAI 데이터센터 관련 보장형 파이낸싱 규모를 크게 줄인 것으로 전해짐. 대규모 AI 인프라 자금조달에 대한 시장 기대를 낮추는 신호로 해석됨.
Mistral OCR 4.1
Mistral OCR 4.1
Mistral의 OCR 4.1 모델이 공개됨. 문서 인식과 텍스트 추출 성능을 높인 최신 OCR 모델로 소개.
인간은 루프 안에 있다
The Human Is the Loop
자동화와 AI 활용에서도 최종 판단과 책임은 사람에게 남아 있어야 한다는 관점을 다룸. 인간 개입을 약점이 아닌 시스템의 핵심 안전장치로 보는 시각을 제시함.
OpenAI의 윤리 책임자, 합류 1년이 채 안 돼 퇴사
OpenAI’s head of ethics leaves less than a year after joining
OpenAI의 윤리 책임자가 합류 1년이 지나기 전에 회사를 떠남. AI 거버넌스와 내부 통제 체계에 대한 관심이 다시 커짐.
모델은 의도적으로 더 둔해지고 있다
Models Are Getting Dumber on Purpose
AI 모델이 비용, 안전, 운영 통제를 이유로 일부러 덜 유능하게 설계되고 있다는 문제를 다룸. 고성능보다 제약된 출력과 관리 용이성이 우선되는 흐름을 지적함.
AI 모델 선택: 하나의 프롬프트, 11개 모델, 서로 다른 결과
Choosing an AI model: one prompt, 11 models, different results
같은 프롬프트라도 모델에 따라 출력 품질과 스타일 차이가 크게 벌어짐. 모델 선택이 성능만큼 결과 일관성에도 직접적인 영향을 줌.
Toast 1 발표
Introducing Toast 1
Mixedbread가 Toast 1을 공개했다. 새로운 AI 제품 또는 모델을 전면에 내세운 출시 소식이다.
LFM2.5 2.6B 모델, 4배 큰 모델들과 경쟁력 보임
LFM2.5 2.6B model competitive with 4x larger models
Liquid AI의 2.6B급 LFM2.5가 더 큰 모델들과 비슷한 성능을 보인다는 소개. 소형 모델 효율성과 성능 균형이 다시 주목받는 흐름.
신약 개발에서의 AI: 무엇이고, 어디까지 왔으며, 앞으로의 과제
AI in drug discovery – what it is, where we stand and the path forward
AI가 신약 탐색과 후보 물질 발굴에 활용되는 방식과 현재 성과를 정리함. 실제 임상 가치로 이어지기 위한 데이터, 검증, 해석 가능성 과제가 남아 있음.
Launch HN: Discovered Materials (YC P26) – 새로운 물질을 발견하는 AI agents
Launch HN: Discovered Materials (YC P26) – AI agents to discover new materials
Discovered Materials가 새로운 물질 탐색을 위한 AI agents를 공개. 재료 과학 연구의 후보 탐색과 발견 속도 향상을 목표로 함.
Kinney Drugs, 수백 건의 고객 불만 이후 AI 전화 비서 철회
Kinney Drugs pulls back AI phone assistant after hundreds of customer complaints
Kinney Drugs가 고객 불만이 수백 건 접수되자 AI 전화 비서 서비스를 축소함. 자동 응대 품질과 고객 경험 문제가 드러남.
손으로 만드는 AI
AI by Hand
AI를 직접 만들고 이해하는 과정을 강조한 프로젝트. 자동화된 블랙박스보다 수작업 기반의 실험과 학습에 초점을 둔다.
Anthropic의 오픈소스 AI와의 전쟁
Anthropic's War on open source AI
Anthropic의 오픈소스 AI 대응을 비판하는 글. 공개 모델 생태계와의 경쟁 및 정책 방향을 둘러싼 논쟁을 다룸.
텍스트 AI 워터마크는 항상 쉽게 제거된다
Text AI watermarks will always be trivial to remove
텍스트 생성 AI의 워터마크는 실사용 환경에서 쉽게 제거된다는 주장. 탐지보다 우회가 더 쉬워 방어 수단으로서의 효용이 낮다는 관점.
AI At Home 1부: 잡동사니 상자
AI At Home Part 1: A Box Of Scraps
가정용 환경에서 AI를 구축하는 과정을 다룬 연재의 첫 글. 제한된 자원과 임시 부품으로 시스템을 구성하는 접근을 소개함.
공유지의 비극, AI 버전
The tragedy of the commons, AI edition
AI 확산이 공유 자원과 인프라에 부담을 주는 구조를 다룸. 개인의 이익은 커지지만 비용은 분산되는 전형적 공유지 문제를 AI 산업에 대입함.
Nvidia Nemotron 3.5 Lightning
Nvidia Nemotron 3.5 Lightning
Nvidia의 Nemotron 3.5 Lightning 모델 공개. 경량화된 대규모 언어모델 계열로 보이며 추론 효율을 강조.
My Agent Setup
My Agent Setup
개인용 AI 에이전트 환경 구성과 작업 흐름을 정리한 글. 에이전트 도구 선택, 설정 방식, 실사용 패턴을 중심으로 다룬 것으로 보임.
조직은 AI를 어떻게 사용하는가: ChatGPT의 증거 [pdf
How Organizations Use AI: Evidence from ChatGPT [pdf]
] 조직 내 ChatGPT 사용 사례를 실증 데이터로 분석한 보고서. 업무 생산성, 활용 패턴, 도입 효과를 중심으로 AI 사용 실태를 다룸.
John C. Lilly의 solid state intelligence와 인간의 소멸(1978)
John C. Lilly on solid state intelligence and the elimination of man (1978)
John C. Lilly의 1978년 글을 통해 기계 지능과 인간의 미래를 둘러싼 초기 사유를 소개함. 오래된 기술 철학 텍스트를 재조명하는 아카이브 성격의 글.
AI 크레딧 재판매 시장 - Token Broker와 Relay는 어떻게 움직이나
AI 크레딧 재판매 시장 - 토큰 브로커와 Relay는 어떻게 움직이나
OpenAI, Anthropic 등 AI API 크레딧을 공식가보다 싸게 재유통하는 시장이 커짐. 남는 크레딧을 사고파는 Token Broker와 여러 계정·API Key를 묶어 단일 Endpoint로 제공하는 Relay 구조가 확산됨.
LLM이 5학년 이후 학습 자료를 전혀 보지 못하면 어떻게 될까?
LLM이 5학년 이후의 학습 자료를 전혀 보지 못하면 어떻게 될까?
LittleLearner를 미국 초등학교 K–5 교육과정으로만 제한한 880억 토큰 말뭉치로 처음부터 학습해, 사전학습 지식의 경계가 모델 능력에 미치는 영향을 검증함. FineWeb-Edu를 Common Core 기준의 5단계 파이프라인으로 필터링하고 5학년 이후 개념·사실·어휘를 명시적으로 제외함.
AI는 수학자보다 더 잘 생각하는 게 아니라 더 많이 기억함
AI는 수학자보다 더 잘 생각하는 게 아니라 더 많이 기억함
AI 수학 성능은 단순한 추론력보다 긴 컨텍스트를 작업 공간처럼 활용해 조건, 중간 계산, 실패한 시도를 함께 유지하는 능력에서 나올 수 있음. 인간은 작업 기억을 청킹과 메모로 보완하지만, AI는 긴 추론 사슬을 넓게 보존하는 방식으로 강점을 보임.
AI와 일하는 방식은 코딩보다 리더십에 가깝다
AI와 일하는 방식은 코딩보다 리더십에 가깝다
AI는 같은 요청에도 다른 답을 낼 수 있어 정확한 명령보다 맥락, 명확성, 피드백이 더 중요함. 컴파일러처럼 통제하기보다 의도를 주고받는 협업 대상으로 다룰 때 활용도가 높아짐.
AI by Hand — 손으로 익히는 AI 수학·알고리즘·아키텍처
AI by Hand — 손으로 익히는 AI 수학·알고리듬·아키텍처
AI의 수학, 알고리즘, 아키텍처를 손으로 따라가며 학습하는 콘텐츠를 소개. Qwen 3.6, Gemma 4, OpenClaw, Google Ironwood TPU 등 최신 모델과 미세조정·강화학습 주제도 다룸.
AI 텍스트 워터마킹의 작동 원리
AI 텍스트 워터마킹의 작동 원리
AI 텍스트 워터마킹은 문자 삽입이 아니라 다음 단어 선택 확률에 비밀 패턴을 심는 방식. Google Gemini와 최신 Claude가 모델 수준 워터마킹을 적용하고 있음.
Suno Studio 2.0 - MIDI와 AI Chat을 결합한 본격적인 음악 제작 도구
Suno Studio 2.0 - MIDI와 AI Chat을 결합한 본격적인 음악 제작 도구
Suno가 Studio 2.0을 공개하며 MIDI 편집, 음량·효과 자동 조절, 신시사이저, 음원 분리 기능을 추가. 단순한 AI 음악 생성기를 넘어 DAW에 가까운 제작 도구로 확장함.
Google, 동형 암호화로 Private AI를 실용화
Google, 동형 암호화로 프라이빗 AI를 실용화
Google이 암호화된 데이터를 복호화하지 않고 AI 추론에 활용하는 오픈소스 컴파일러 HEIR를 Private Computing Toolkit에 추가. 서버가 암호문만 처리해 사용자 데이터 보호와 프라이빗 AI 적용 범위를 넓힘.
GLM-5.3: 포스트 트레이닝 확장으로 프런티어급 코딩·사이버 역량 달성
GLM-5.3: 포스트 트레이닝 확장으로 프런티어급 코딩·사이버 역량 달성
기반 모델은 유지한 채 환경·과제·연산을 늘리는 포스트 트레이닝 확장으로 코딩과 장기 과제 성능을 끌어올림. Terminal Bench 3.0과 DeepSWE v1.1 등에서 유의미한 상승을 보임.
Mistral OCR 4.1 공개
Mistral OCR 4.1 공개
Mistral AI의 최신 OCR 서비스가 2026년 7월 16일 Public Preview로 공개됨. 문단 경계 상자, 구조적 블록 레이블, 블록 단위 신뢰도 점수를 기본 제공함.
이해가 새로운 병목이다
이해가 새로운 병목이다
AI 에이전트가 코드를 빠르게 생성하면서 인간의 이해 속도가 새로운 병목으로 부상했다. 단순 검증을 넘어 아이디어를 만들고 프로젝트를 발전시키는 개념적 유창성이 더 중요해지고 있다.
하나의 프롬프트를 11개 AI 모델에 실행했더니 나온 서로 다른 결과
하나의 프롬프트를 11개 AI 모델에 실행했더니 나온 서로 다른 결과
Netlify가 동일한 커피숍 웹사이트 프롬프트를 11개 AI 모델에 각각 3회씩 실행해 결과를 비교함. 디자인·콘텐츠 품질과 평균 크레딧 사용량이 모델별로 크게 달라, 실제 생성 결과 기준의 주관적 벤치마크임을 보여줌.
palmier-pro - AI를 위해 만든 macOS 영상 편집기
palmier-pro - AI를 위해 만든 macOS 영상 편집기
타임라인 안에서 사용자와 에이전트가 함께 영상 생성·편집을 수행하는 오픈소스 macOS 편집기. Swift로 새로 개발됐으며 AI 도구를 워크플로에 깊게 통합하도록 설계.
Grok 4.6, AAII 61점으로 비용 효율에서 선두권 진입
Grok 4.6, AAII 61점으로 비용 효율에서 선두권 진입
Grok 4.6이 AAII 61점으로 GPT-5.6 Sol과 동점을 기록하며 상위권에 올라섬. 에이전트 성능도 빠르게 개선돼 비용 대비 경쟁력이 부각됨.
인간이 루프의 중심이어야 한다
인간이 루프의 중심이어야 한다
AI 사용이 생산성보다 의존성과 피로를 키울 수 있다는 반성이 제기됨. 여러 에이전트와 대화를 병행하는 방식은 미완성 작업과 인지 부담을 늘린다는 문제의식이 강조됨.
Show GN: JPyRust – Java에서 Python AI 모델을 subprocess 대신 shared memory로 호출해본 결과
Show GN: JPyRust – Java에서 Python AI 모델을 subprocess 대신 공유메모리로 호출해봤습니다. (390배 향상된 속...
Java 백엔드에서 Python AI 모델을 호출하는 방식을 shared memory 기반으로 바꿔 성능을 크게 끌어올린 실험. 기존 subprocess 방식 대비 최대 390배 향상을 주장함.
에이전틱 코드 리뷰에서 인간-AI 시너지: 인간과 AI는 다르게 리뷰한다
에이전틱 코드 리뷰에서 인간-AI 시너지 : 인간과 AI는 다르게 리뷰한다
300개 GitHub 프로젝트의 27만여 개 인라인 코드 리뷰 대화를 분석해 인간과 AI의 피드백 패턴을 비교함. AI는 문제를 찾아 즉시 수정안을 제시하는 경향이 강했고, 인간은 구현 이유와 테스트, 프로젝트 관례를 묻는 상호작용에 더 집중함.
Unsloth Desktop - 로컬 AI 모델 실행/학습/에이전트를 하나로 묶은 오픈소스 앱
Unsloth Desktop - 로컬 AI 모델 실행/학습/에이전트를 하나로 묶은 오픈소스 앱
Unsloth가 로컬에서 LLM과 diffusion, embedding, vision, TTS/STT 모델을 실행·학습할 수 있는 Desktop 앱을 공개. GGUF, MLX, safetensors를 지원하고 Mac, Windows, Linux, WSL 및 다양한 GPU 환경을 포괄함.
Show GN: 흩어진 AI 소식을 실시간 한국어 요약으로 모아 보기
Show GN: 흩어진 AI 소식을 실시간 한국어 요약으로 모아 보기
공식 기술 블로그, YouTube, Reddit, X, GitHub, Hugging Face, 논문 등으로 흩어진 AI 소식을 한곳에 모아 한국어로 요약하는 서비스 소개. 이전에 공개된 aitrends.kr의 후속 소개글.
Grok Bot
Grok Bot
데스크톱과 iOS에서 동료에게 지시하듯 업무를 맡기면 처음부터 끝까지 수행하는 AI 팀원. 여러 Bot을 동시에 배치해 프로젝트와 운영 업무를 병렬 처리하고, 승인 필요 시 스레드로 되돌아오는 구조.
llama.cpp: 내 컴퓨터에서 실행하는 오픈소스 AI
llama.cpp: 내 컴퓨터에서 실행하는 오픈소스 AI
llama.cpp는 API 키와 텔레메트리 없이 로컬에서 AI 모델을 실행하는 오픈소스 런타임. 노트북부터 클러스터까지 같은 바이너리와 모델을 쓰며 다양한 CPU·GPU 환경에 맞게 최적화된다.
Grok 4.6 공개, 파라미터 확장 대신 사후학습에 투자한 모델
Grok 4.6 공개, 파라미터 확장 대신 사후학습에 투자한 모델
xAI가 Grok 4.6을 공개하고 Cursor와 Grok Build에서 즉시 사용 가능하게 했다. 대규모 파라미터 확장보다 사후학습 강화에 집중한 모델로, 여러 벤치마크 합산 지표에서 GPT-5.6 Sol과 동률을 주장했다.
AI가 소프트웨어 엔지니어링의 중산층을 없애고 있음
AI가 소프트웨어 엔지니어링의 중산층을 없애고 있음
AI가 구현 속도의 병목을 크게 줄이면서, 복잡한 프로젝트가 붕괴 가능한 수준의 난이도에 더 빨리 도달함. 사람의 검토·이해 속도는 그대로여서 잘못된 설계와 추상화가 더 쉽게 누적됨.
Xirp - Spotify가 만든 조직 컨텍스트 기반 AI 코딩 환경
Xirp - Spotify가 만든 조직 컨텍스트 기반 AI 코딩 환경
AI 코딩 도구의 병목이 코드 생성이 아니라 조직 맥락 검색임을 지적. Slack 대화, 담당자 기억, 오래된 README, Confluence 등에 흩어진 정보를 찾아 에이전트가 운영상 올바른 결정을 내리도록 하는 환경을 다룸.
LLM Evals에 대해 알아야 할 모든 것
LLM Evals에 대해 알아야 할 모든 것
700명 넘는 엔지니어와 PM에게 AI 평가를 가르친 경험을 바탕으로 실무형 FAQ를 정리. 벤치마크 점수보다 실제 응답 품질을 어떻게 검증하고 평가 체계를 설계할지에 초점.
코드가 아니라 아이디어를 통제하라
코드가 아니라 아이디어를 통제하라
AI 시대의 프로그래머는 생성된 코드를 한 줄씩 검토하기보다 소프트웨어가 담아야 할 아이디어와 설계를 통제해야 한다고 주장. LLM은 국소 최적 코드 작성에는 강하지만 큰 설계에서는 한계가 있다고 봄.
OpenAI 윤리 책임자, 합류 1년도 안 돼 퇴사
OpenAI 윤리 책임자, 합류 1년도 안 돼 퇴사
OpenAI AI 윤리 책임자 Chloé Bakalar가 2025년 8월 합류 후 1년도 되지 않은 2026년 7월 퇴사함. 최근 안전 시스템 책임자 Johannes Heidecke와 최고 미래 책임자 Joshua Achiam도 회사를 떠난 것으로 전해짐.
AI가 코드를 쓰는 시대, antirez는 왜 다시 C로 만드는가
AI가 코드를 쓰는 시대, antirez는 왜 다시 C로 만드는가
Redis 창시자 antirez가 Apple Silicon용 멀티모달 추론 엔진 H3-metal을 C, Objective-C, Metal로 구현해 공개함. 범용 프레임워크 대신 하드웨어와 모델 요구에 맞춘 저수준 구현을 택한 사례.
Mark Zuckerberg, Meta의 개방형 모델 복귀와 함께 ‘폐쇄형’ AI 경쟁사 비판
Mark Zuckerberg, Meta의 개방형 모델 복귀와 함께 ‘폐쇄형’ AI 경쟁사 비판
Meta가 Muse Glimmer의 가중치를 공개하고 더 강력한 Muse Spark도 수주 내 공개하기로 하며 오픈 모델 전략으로 복귀. Mark Zuckerberg는 강력한 AI가 기업과 정부에 집중돼서는 안 된다고 강조하며 폐쇄형 경쟁사를 비판.
AI 제품의 가격을 책정하는 방법
AI 제품의 가격을 책정하는 방법
AI 제품은 토큰 비용이 사용량에 비례해 누적돼 기존 SaaS의 좌석 기반 과금보다 사용량·성과 기반 가격 모델이 중요해짐. AI 우선 기업의 총마진은 50~60% 수준으로 전통 SaaS보다 낮아 비용과 고객 가치의 균형 설계가 핵심임.
OpenChamber - AI 코딩을 위한 에이전트 개발 환경
OpenChamber - AI 코딩을 위한 에이전트 개발 환경
목표 설정부터 다중 모델 실행, 코드 변경 검토, 앱 미리보기, GitHub 워크플로까지 한곳에 묶은 AI 코딩용 개발 환경이 소개됨. Session Goals와 Multi-run/Fusion 기능으로 여러 모델 결과를 비교·통합하며 작업을 이어갈 수 있음.
Needle 2 - 스마트폰·웨어러블·스마트홈·로봇을 위한 14MB 에이전틱 LLM
Needle 2 - 스마트폰·웨어러블·스마트홈·로봇을 위한 14MB 에이전틱 LLM
도구 호출·기기 제어·구조화 추출에 특화된 45M 파라미터 LLM. 전체 크기 14MB, 세션 RAM 최대 28MB로 경량 온디바이스 에이전트 용도에 맞춤.
Show GN: 공공데이터 통합검색 x AI
Show GN: 공공데이터 통합검색 x AI
흩어진 공공데이터를 한 번에 검색하는 서비스. ChatGPT·Claude가 생성한 허위 URL 문제를 줄이기 위해 실제 존재하는 공공자료만 통합 탐색하도록 설계.
Show GN: 프리터뷰 - 가입 없이 포트폴리오부터 채점해보는 AI 모의면접
Show GN: 프리터뷰 - 가입 없이 포트폴리오부터 채점해보는 AI 모의면접
포트폴리오를 입력하면 꼬리질문 중심의 면접을 AI로 모의 진행. 가입 없이 시작해 답변과 준비도를 점검하는 인터뷰 연습 서비스.
Claude가 AI 생성 콘텐츠를 표시하는 방식
Claude가 AI 생성 콘텐츠를 표시하는 방식
Anthropic이 EU AI Act 제50조 2항에 따른 투명성 행동강령에 서명함. 2026년 8월 2일 이후 EU 출시 Claude 모델은 기계 판독 가능한 표시와 보이지 않는 내장 워터마크를 지원할 계획임.
저항에 관한 이메일을 받다
저항에 관한 이메일을 받다
AI와 자동화가 소프트웨어 노동의 가치를 바꾸는 상황에서 변화에 저항하는 태도를 비판하는 글. 프로그래머를 산업혁명기의 숙련 장인에 비유하며 직업적 정체성의 전환을 짚음.
Chat2DB - AI 기반 데이터베이스 클라이언트 및 SQL 워크스페이스
Chat2DB - AI 기반 데이터베이스 클라이언트 & SQL 워크스페이스
개발자, DBA, 분석가를 위한 AI 기반 데이터베이스 클라이언트. 30개 이상 데이터베이스를 지원하고 SQL 워크스페이스와 AI 어시스턴트를 윈도·맥·리눅스에서 제공함.
모든 코드를, 항상 다시 작성하라
모든 코드를, 항상 다시 작성하라
AI로 코드 생성 비용이 낮아지면 프로덕션 코드를 희소 자산으로 볼 이유가 약해진다는 전망임. 장기적으로는 구현보다 요구사항과 명세를 보존하고, 대규모 코드베이스를 주기적으로 재작성하는 흐름이 가능해질 수 있음.
DoorDash가 AI 에이전트-도구 접근을 위한 중앙 게이트웨이를 구축한 방법
DoorDash가 AI 에이전트-도구 접근을 위한 중앙 게이트웨이를 구축한 방법
MCP가 도구 탐색과 호출 표준은 제공하지만 인증, 권한, 자격증명, 감사까지는 해결하지 못한다는 점을 짚음. DoorDash는 모든 도구 호출을 Agent Gateway로 중앙화해 호출자 검증과 접근 통제를 일원화함.
Show GN: AI 음악 생성 플랫폼을 만들었습니다
Show GN: AI 음악 생성 플랫폼을 만들었습니다.
가사 작성부터 곡 생성까지 몇 초 만에 처리하는 AI 음악 생성 서비스 소개. 사용자는 주제나 분위기만 입력해도 곡을 만들 수 있다.
Ask GN: Fable 5가 사실상 반쪽짜리 뇌임
Ask GN: Fable 5가 걍 반쪽짜리 뇌임
Fable 5가 간단한 배열 계산을 틀리고도 정답을 우기다가 나중에야 오류를 인정했다는 사용 후기. 로컬 Qwen 3.6 모델과 비교했을 때 코드와 계산 정확성이 크게 떨어졌다는 평가가 제기됐다.
Show GN: Airy – 쉽게 쓰는 무료 TTS 음성 콘텐츠 제작 툴
Show GN: Airy – 쉽게 쓰는 무료 TTS 음성 콘텐츠 제작툴
무료 TTS 생성과 다운로드를 제공하는 Airy 서비스가 공개됐다. 빠른 생성 속도와 간단한 UX를 내세우며 현재 한국어와 영어를 지원하고 향후 언어와 보이스를 확장할 예정이다.
사무실에서 잃어버린 휴대전화를 Claude가 제안한 Bluetooth 신호 추적으로 찾음
사무실에서 잃어버린 휴대전화를 Claude가 제안한 Bluetooth 신호 추적으로 찾음
Find My가 비활성화된 상황에서 Claude가 Bluetooth 신호 강도 추적 방법을 제안. 측정 도구를 빠르게 만든 뒤 신호 세기를 따라가 휴대전화를 찾음.
덴마크, AI 부정행위 막기 위해 서면 과제 구두 소명 의무화
덴마크, AI 부정행위 막기 위해 서면 과제 구두 소명 의무화
덴마크가 집에서 작성한 과제에 대해 학생의 구두 소명을 의무화해 AI 활용 부정행위를 줄이는 규정을 즉시 시행함. 16세 안팎 상급 중등교육의 2년제 HF 과정 약 9,000명이 대상임.
Kitesurf - V8 격리 환경에서 실행되는 에이전트 우선 브라우저
Kitesurf - V8 격리 환경에서 실행되는 에이전트 우선 브라우저
Cloudflare가 AI 에이전트용 브라우저 Kitesurf를 12주 만에 개발해 Browser Run 베타로 무료 공개함. Engine, PageScript, PageRenderer를 Workers 격리 환경으로 분리해 네트워크 통제와 상태 최소화를 구현함.
AI 시험지는 함정이 9할이다 - LLM 테스트 케이스 설계법
AI 시험지는 함정이 9할이다 - LLM 테스트 케이스 설계법
주문 메시지 판별 파이프라인 검증에서 정상 케이스보다 예외·함정 케이스가 훨씬 중요하다는 사례 제시. 주문 아님, 경계값, 오탐 유발 패턴을 촘촘히 넣어야 실제 사고를 줄일 수 있음.
미국 에너지부, 과학용 오픈 모델 이니셔티브 출범
미국 에너지부, 과학용 오픈 모델 이니셔티브 출범
DOE가 Arcee AI와 함께 과학 연구용 오픈 가중치 모델 생태계를 구축하고 첫 모델 Genesis-Science-1을 공개. 재료, 에너지, 지구 시스템, 핵융합, 생물학, 고에너지 물리 분야를 겨냥한 공용 AI 인프라 성격.
Oracle, 사내 AI 코딩은 장려하면서 OpenJDK에는 AI 생성 코드 기여 금지
Oracle은 자신이 관리하는 오픈소스 Java 프로젝트OpenJDK에서 LLM/확산 모델 등으로 일부라도 생성된 코드, 문서, 이미지 등의 기여를 금지하는 임시 정책을 도입함AI 도구를 코드이해/디버깅/리뷰/연구에 개인적으로 사용하는 것은 허용하지만, 그 도구가 생성...
한 직군 전체가 자신의 경력을 믿지 않게 되면 무슨 일이 벌어질까
AI는 일자리를 위협하는 데 그치지 않고, 고임금 지식 노동자에게 업무와 경력 전체가 무의미할 수 있다는실존적 불안을 일으키고 있음지식 노동은 성취감·공동체·정체성을 직장에서 찾는워크이즘(Workism)에 기대왔지만, AI가 실제 업무를 대신하면서 인간의 ...
OpenAI를 떠나 Jurassic Park를 만들다
ChatGPT basketball의 정렬 안전성을 이끌었다는 화자가Jurassic Park 스타트업을 세워, 되살린 최상위 포식자로 정렬되지 않은 AI에 맞서겠다는 풍자적 계획을 공개함공룡은 1억6,500만 년간 AI 사이버 공격을 받은 기록이 없고 데이터센터도 파괴할 수 있다는 논리로대...
AI가 린 스타트업 플레이북을 무너뜨리고 있는가? [유튜브]
AI로 소프트웨어를 더 빠르고 저렴하게 만들 수 있게 되면서, 좁은 틈새에서 출발하는린 스타트업 방식뿐 아니라 처음부터 차별화된 영역에서 크고 야심 찬 제품을 만드는 선택지도 넓어짐AI에 지식을 맡길 수 있어도 머릿속인지적 L1 캐시에서 꺼내는 편이 훨씬...
AI가 재편하는 차세대 사이버보안 스택
AI가 취약점을 찾아 악용하는 속도가 빨라지면서 평균악용까지 걸리는 시간(TTE)은 공개 9시간 전인-9시간까지 줄었고, 공개 전 제로데이로 악용되는 취약점 비율도 5년 전 약 30%에서 현재 80% 이상으로 증가함보안 조직은 여러 도구를 직접 운용하는 방식에서 벗...
평가 주도 개발 (Eval-driven development)
Airbnb는 비결정적 출력과 주관적 정답, 검색·추론·도구 호출의 연쇄 실패를 다루기 위해 평가를 사후 검증이 아닌핵심 엔지니어링 규율로 취급함평가 주도 개발(EDD)은 실제 오류를 발견해 평가 기준으로 만들고 지속적으로 검사하며, 출시 목표와 게이트를 먼...
2027년 메모리 생산 용량, 이미 매진된 것으로 알려져
Samsung·SK Hynix·Micron의2027년 메모리 생산 용량을 AI 기업들이 모두 사들였다는 보도가 나왔으나, 세 제조사는 아직 확인하지 않음2027년DRAM·HBM 생산 물량은 추가 공급 계획 없이 모두 계약됐으며, 주요 구매자는 생산 전 물량을 최대 5년 장기 계약으로 ...
Show GN: 외부 AI 결과를 여러 SNS에 예약하고 실제 발행 상태를 추적하는 ANKK
SNS 자동화에서 API가 202를 반환한 시점과 실제 게시물이 공개된 시점은 다릅니다. 이 차이를 운영하면서 반복해서 겪어, 외부 AI·스크립트에서 만든 콘텐츠를 여러 SNS에 예약하고accepted → queued → publishing → published/failed를 추적하는 호스팅형 도구 ANKK를 만들었습니다.무료로
Show GN: 만화 이미지의 대사와 말풍선을 번역하는 AI Manga Translate를 만들었습니다
안녕하세요. 이미지 기반 만화를 좀 더 쉽게 번역할 수 있도록 AI Manga Translate를 만들고 있습니다.일반 번역기는 텍스트를 복사해서 입력하는 방식이 대부분인데, 만화는 텍스트가 이미지 안에 있고 말풍선, 세로쓰기, 배경 위의 글자, 작은 폰트 등 때문에 단순 OCR + 번역만으로는 꽤 불편했습니다....
인간은 AI 에이전트 명령 승인 과정에서 위협 3개 중 1개를 놓침
AI 코딩 에이전트 명령을 승인·거부하는 게임의 4만 회 이상 실행과 40만9천 건의 결정을 분석한 결과, 평균 위협 탐지 정확도는66.3%에 그쳐 인간 승인을 최후의 보안 경계로 삼기 어려웠음명백한 파괴 명령의 누락률은 11.7%였지만 자격 증명 접근 같은범위 위반