🔥 포커스
Sony·Warner, Anthropic 제소… 불법 시드와 가사 수집으로 Claude를 학습시켰다고 주장 : Sony Music, Warner Chappell 등 출판사들이 북캘리포니아 연방법원에 Anthropic을 제소하고 CEO Dario Amodei와 공동창업자 Benjamin Mann을 개인 피고로 올렸다. 직원들에게 BT로 저작권 보호 가사·악보·곡을 수만 건 규모로 내려받도록 지시했고, MusixMatch·LyricFind에서 가사를 긁고 실물 노래책을 스캔한 뒤 폐기했다고 주장한다. 원고는 건당 최대 15만 달러 법정 배상을 요구하며, 핵심은 “학습이 공정이용인지”가 아니라 입수 방식 자체가 독립 침해라는 점이라고 강조한다. 이는 Anthropic이 앞서 불법 도서 라이브러리로 약 15억 달러 합의에 이른 취약점과 같다. Anthropic은 부인하고 대응할 예정이다. 커뮤니티는 벌금이 “사업 비용”으로 전락할지, 가중치 강제 폐기나 재학습이 유인을 바꿀 수 있을지를 논한다.(来源: THE DECODER、TechCrunch、kylebrussell、Reddit r/artificial)

Meta, 데이터센터에서 케이블 꽂고 서버 재부팅하는 로봇 시험 : 정통한 소식통에 따르면 Meta는 Kinova, ABB, Watney 등 로봇팔로 전원 차단·재부팅, 랜선 교체 같은 전산실 육체 작업을 테스트 중이며, 한 직원은 일부 직무 업무량의 최대 약 80%가 대체될 수 있다고 추정했다. AI 인프라 인력 비용을 헤지하려는 움직임이며, 현장 운영진은 “육체 직무도 더 이상 안전하지 않다”고 느낀다.(来源: Ars Technica)
코딩 Agent는 시간 감각이 거의 없고, 짧고 긴 작업 모두 추정이 빗나간다 : MATS 프로젝트가 Claude Code와 Codex를 테스트한 결과, 사전 소요 시간 추정과 사후 사용 시간 회상이 모두 크게 왜곡되며 짧은 작업에서 특히 심하다. 같은 모델도 harness에 따라 스텝 수가 약 2.5배 차이 날 수 있다. 연구는 “두 시간 일하라”는 장시간 과제는 실제 타이머를 외장하지 않으면 거의 지키지 못한다고 본다.(来源: THE DECODER)

🎯 동향
OpenAI, Codex/Work의 여러 암묵 소모 Bug를 고치고 한도를 다시 리셋… 동일 한도로 약 10%–50% 더 쓸 전망 : Codex 책임자 Tibo는 유료 사용자 한도를 리셋했고, 압축 후 남는 옛 이미지, Goals 완료 후에도 멈추지 않음, Memory 백그라운드 무한 루프, 서브 Agent의 무단 업그레이드, 자동화 과속, 히스토리 중복 요약, MCP 결과 이중 인코딩 등을 고쳤다고 밝혔다. 극단 사례에서는 단일 작업이 주간 한도의 약 15%–70%를 먹을 수 있다. 팀은 사용량 시각화를 약속했다. 커뮤니티는 5시간 창에서 “거의 안 했는데 비었다”는 간헐 현상을 여전히 불평한다.(来源: 36氪、reach_vb、TheZachMueller)
vLLM 0.28.0 출시 : 고성능 LLM 추론 엔진이 v0.28.0을 내놓았다. 커뮤니티 논의는 단발 벤치 점수보다 처리량, 스케줄링, 프로덕션 배포 안정성에 모인다. 자체 추론 클러스터와 로컬 SLM 스택에는 버전 리듬 자체가 선정 신호가 됐다.(来源: Hacker News)
ChatGPT 워크스페이스, GitHub에서 플러그인 마켓을 동기화 : 관리자는 공개/비공개 저장소에서 Codex 또는 Claude marketplace를 가져와 팀에 플러그인을 배포할 수 있다. 워크스페이스는 매일 업데이트를 가져오며 Sync now로 수동 동기화도 가능해 ZIP을 매번 올릴 필요가 없다. 기존 설치와 앱 접근 제어는 그대로 적용된다.(来源: OpenAIDevs)
Kimi K3, Cursor에 상륙… CursorBench 최전선에 가깝다고 주장 : Cursor는 K3가 접속됐고 추론은 Fireworks, Together, Baseten의 미국 노드를 쓰며 제로 데이터 보존을 지원한다고 밝혔다. 月之暗面이 리트윗으로 확인했다. 커뮤니티에는 Applied Compute가 AC2에서 약 3T 파라미터 K3를 전체 파라미터 파인튜닝해 단일 복제본 GPU 수요를 약 40% 줄였다는 주장도 있다.(来源: Kimi_Moonshot、algo_diver)
🧰 도구
WorkWeave Router: 50ms 안에 “액션” 기준으로 요청을 적합한 모델에 전달 : Go로 짠 로컬 프록시가 Anthropic/OpenAI/Gemini 프로토콜을 동시에 말하고, 박스 안 ONNX 임베딩과 Avengers-Pro 스타일 클러스터 점수로 turn이 아니라 action으로 라우팅한다. 엔드포인트만 바꿔도 비용을 약 40%–70% 줄일 수 있다고 주장한다. 키는 기본 BYOK로 암호화되어 기기에 남고 OTLP 관측을 단다. npx @workweave/router로 Claude Code, Codex, Cursor 등에 붙일 수 있다.(来源: GitHub Trending)
ODS, 개인 PC를 원클릭으로 사설 AI 서버로 : Osmantic Deployment System은 한 명령으로 llama-server, Open WebUI, Hermes Agent, n8n, Qdrant, ComfyUI 등을 조립하고 GPU/통합 메모리에 따라 GGUF를 고른다. 기본은 작은 모델로 2분 안에 대화하고 백그라운드에서 큰 모델로 핫스왑한다. Linux/Windows/macOS를 지원하며 안정판은 v2.6.0에 고정된다.(来源: GitHub Trending)
칭화 OpenMAIC v1.0: 대화형 Agent 워크벤치로 상호작용 수업을 원클릭 생성 : 기존 멀티 Agent 교사/학우, 화이트보드, PBL에 더해 v1.0은 취소/복원/중도 전환이 가능한 지속 수업 준비 세션, 약 20개 내장 스킬, 자료 업로드와 PPTX 가져오기를 넣었다. OpenClaw로 飞书/Slack에서 수업을 내보낼 수 있다. 기본은 브라우저 저장이며 Postgres와 Lemonade 로컬 모델을 선택할 수 있다.(来源: GitHub Trending)

중국 특허.skill: 포인트 발굴, 명세서, 쉬운 해설과 심사 답변 : Agent 스킬이 발명/실용신안/디자인을 커버한다. 프로젝트 자료를 스캔하고 국가지식산권국 우선 선행조사를 하며 Mermaid/선화를 Word에 넣고, 반복 저장과 개정 기록을 남긴다. 해설 모드는 청구항을 Obsidian 그래프로 만든다. 심사 답변은 과거 통지서를 비식별화해 넣은 뒤 초안을 쓰며, 기본 산출물은 사람 심사를 거쳐야 한다.(来源: GitHub Trending)
FrankenTTS: 오픈소스 실시간 음성 합성·클로닝 : doodlestein이 iOS에서 실시간 합성, 원클릭 다중 음색, 초 단위 클로닝과 농담 코퍼스를 내장한 데모를 보였다. 100% 오픈소스 예정이며 병목은 Apple 심사라고 한다.(来源: doodlestein)
fal, 장편 영상 H3 Max Live 실험: 채팅으로 지휘, 샷 간 끊김 없음 : 공식은 실험 체크포인트가 네이티브 무한 연속성을 지원해 장면이 구간마다 리셋되지 않는다고 한다. 사용자는 Twitch식 라이브에서 !prompt로 화면을 초 단위로 바꿀 수 있다. API는 다음 주 개방 예정이다. 커뮤니티에는 무료 하루 5회 768p 데모(로그인 없음)도 있다.(来源: fal)
OpenWebUI 생태계: Mnemosyne 메모리 필터와 Conduit 4.1.3 : Mnemosyne Filter는 inlet에 관련 기억을 주입하고 outlet에서 자동 저장해, 모델이 도구를 명시 호출할 필요가 없다. Conduit는 OpenAI 호환 API/Ollama/OpenRouter에 직결되고, 오프라인에서 채팅을 검색하고 온디바이스 모델로 이어서 쓴 뒤 다시 동기화하며 Hermes 도구 승인과 예약 작업을 지원한다.(来源: Reddit r/OpenWebUI、Reddit r/OpenWebUI)
Dwarf Fortress MCP와 “전국민 업데이트 코딩 Agent” 스크립트 : doodlestein이 Codex/Claude가 세이브를 읽고 명령을 내리는 DF MCP와, 3시간마다 각사 CLI를 백그라운드 업데이트하는 UCA 도구(로그 통계 포함)를 오픈소스화했다.(来源: doodlestein)
0.8B 로컬 모델 SpeakoFlow Mini, 구술 교정에 특화… 좁은 과제에서 호스팅 최전선 모델과 동급 : Qwen3.5-0.8B를 파인튜닝한 Apache-2.0 모델은 음성 전사 후 구술 정리만 한다. 화자가 명시한 정정은 실행하고 “이미 맞는 텍스트 윤문”은 금지한다. 고정 짧은 프롬프트에 추론을 끄면 전용 영어 벤치 70.7%, GPT-5.6 Luna는 65.0%다. 파인튜닝 전 베이스 47.3%에서 70.7%로 올랐다. Q8_0 약 833MB로 오프라인 가능하다. 저자는 범용 개서가 아니라고 강조하며 평가셋은 비공개다.(来源: Reddit r/LocalLLaMA)
📚 학습
테렌스 타오 ICM 논문: AI가 수학을 “증명 희소”에서 “증명 소화불량”으로 밀어붙인다 : 미공개 연구급 문제에서 최전선 시스템 4세트가 7문제에 거의 흠 없는 답을 냈고 비용은 수십~수백 달러였다. 그는 풀이→검증→설명 가능→공동체 흡수→표준 이론 편입의 5단계 파이프라인을 쪼개며, 형식 검증 통과만으로는 부족하고 저자가 설명하지 못하면 발표하면 안 된다고 주장한다. “AI 능력 추측” 빈칸을 남겨 문제를 일정표에서 학문 가치관으로 바꿨다.(来源: WeChat)
오픈월드 멀티에이전트 Station: 중앙 스케줄 없이 문헌 대비 새 수학 구성을 여럿 만들어냄 : 서로 다른 모델 패밀리 Agent가 공유 환경 Station에서 방향을 고르고 실험·협업하며 “문헌”을 쌓는다. 중앙 오케스트레이션은 없다. AlphaEvolve 목록 12개 구성 문제와 두 사례에서 5문제가 기존 문헌 대비 새 결과(유한체 Kakeya 집합의 새 무한족, 11차원 604점 kissing 구성 등)를 냈다. Agent는 설명적 정리도 냈고, 저자는 대화·증명·검증 코드를 공개했다.(来源: Reddit r/MachineLearning)

NVIDIA Earth2Studio 튜토리얼: 자체 배치 앙상블 일기예보 구축 : 튜토리얼은 Colab CUDA 환경을 유지한 채 Earth2Studio를 설치하고 FCN과 GFS 초기값을 로드하며, 풍력 용량인자 진단과 변수별 스케일 섭동을 커스텀하고 하위 iterator로 Zarr를 쓴 뒤 위도 가중 RMSE, fair CRPS, spread-skill을 계산하고 spaghetti와 부채꼴 그림을 시각화한다.(来源: MarkTechPost)
Barrett와 Miller: 뇌는 아카이브가 아니라 예측으로 세계를 분류한다 : 《Nature Reviews Neuroscience》 리뷰는 분류가 전신 예측 도구라고 주장한다. 변연 코어가 내수용과 감각을 압축한 뒤 바깥으로 범주를 투사하고, 시각피질 시냅스의 약 90%는 피드백에 쓰인다. 같은 접촉도 안전한 거리와 밀림에서는 다른 범주로 들어간다. 예측 코딩과 AI의 “사전(prior)이 지각을 빚는다”를 대조하는 데 가치가 있다.(来源: 机器之心)
FM-Bench: Agent가 축구 클럽을 20시즌 운영 : 도구 26개, 의사결정 지점 약 340–400개이며 점수는 결정론 엔진이 주고 LLM 심판은 없다. 최전선 모델 15개가 모두 기간을 버텼고 규모/가격/벤더는 순위를 예측하지 못했다. 공통 약점은 숨은 시장 가격을 배우지 못하고, 기억은 늘기만 하거나 매 시즌 계획을 다시 쓴다는 점이다.(来源: dair_ai)
Daydreaming: 정상 사용만으로 호스팅 Skill을 “훔칠” 수 있다 : 상대가 스킬 파일을 유출할 필요 없이 본업 서비스만으로, 최약 권한에서도 능력의 약 86.8%를 복구했다(7스킬×4피해 모델). SigLeak의 약 4배이며 중앙값 32회 호출이고 공개 필터로는 막지 못한다. Skill을 팔거나 팀 간 공유하는 이는 비밀 가정을 재평가해야 한다.(来源: dair_ai)
Google SKILL.state: 구조화 상태로 대화 이력을 대체, 긴 세션 token 약 94% 감소 : 100스텝 Gemini-3-Flash 실험에서 정확도 0.94 / 6.5만 token, LangGraph류 베이스라인은 0.91 / 110만 token이다. 전제는 모델이 미래에 상태에 쓸 정보를 미리 가늠하는 것이며, 아니면 다시 검색하게 된다.(来源: Reddit r/artificial)
시계열 이상 탐지: 100년 SPC가 SOTA 보드 여러 개를 이긴다 : Eamonn Keogh는 TSB-AD 등 흔한 세트에서 통계적 공정관리가 종종 만점을 받고 ECG/TAO 궤적은 특히 trivial하다고 지적한다. 최근 TSAD 진보는 상당 부분 문제가 너무 쉬운 탓이며, 커뮤니티는 더 어려운 실제 공정 벤치가 필요하다고 결론낸다.(来源: Reddit r/MachineLearning)
💼 비즈니스
Vijay Pande, a16z 약 40억 달러 바이오 포트폴리오를 떠나 연간 약 5건만 베팅하는 VZVC로 : Zach Werner와 만든 새 펀드는 분석가를 거의 쓰지 않고 내부 Agent에 크게 의존하며 AI 의료 전달과 임상시험을 건다. Pande는 바이오 데이터가 텍스트처럼 웹에서 긁히지 않아 회사가 담장 친 데이터셋을 직접 만들어야 한다고 강조한다. 진짜 병목은 동물 모델이 인간을 예측하지 못하는 점과, go-to-market이 멋진 기술보다 종종 더 어렵다는 점이다.(来源: TechCrunch)
Tinker: 전문가 판단을 RLVR에 넣어 text-to-SQL이 처음으로 인간 점수를 넘김 : Thinking Machines는 순수 스캐폴드 LLM이 이 과제에서 오래 뒤처졌다고 한다. 전문가 판단을 보상에 접은 뒤 모델이 인간 점수를 넘었다. Soumith 평: 과제가 명확해지면 커스터마이즈가 범용 모델을 종종 이긴다.(来源: VictorKaiWang1)
🌟 커뮤니티
보코니 실험: GPT-4o가 점수를 가장 잘 올리고, 인과 수업은 답을 더 이상하게 만들지만 점수는 안 오른다 : 신입 1053명을 무작위 배정해 180자 마케팅 제안을 쓰게 했다. GPT-4o 그룹은 전통 점수가 약 1점(1–5점) 높고 아이디어가 더 많으며 전문가처럼 보였다. 짧은 인과 추론 수업은 전통 점수를 약간 낮추지만 반증 가능성과 방안 다양성을 높였다. 채점 기준은 정돈된 평범 답을 보상하고 파격을 벌한다. 저자는 ChatGPT를 거둔 뒤 재시험하지 않아 무엇을 배웠는지 증명할 수 없다고 인정한다.(来源: THE DECODER)

Glassdoor: 미국 직장 AI 호감이 약 81%에서 43%로, Z세대 여성이 가장 차갑다 : 2019년부터 2026년 중반까지 긍정 리뷰는 43%로 떨어지고 부정은 53%로 올랐다. 임원과 아키텍트는 긍정 쪽이고 보험금 청구, 글쓰기, 고객지원은 부정이 80%를 넘을 수 있다. 실업 공포는 악평의 약 20%뿐이고, 더 많은 것은 형편없는 도구 강제, 경험 악화, 감시와 비현실적 생산성이다. Z세대 여성 긍정은 약 21%다.(来源: THE DECODER)
No AI Fridays, 커밋 메시지에 Claude 세션 링크를 기본으로 넣기… 개발자들이 “항상 온라인”에 저항 : HN 핫포스트는 인지 오프로딩에 맞서 금요일 AI 금지를 제안하는 한편, Claude Code가 세션 URL을 commit/PR에 기본으로 넣는다고 불평한다. 문화와 주의력 관리가 Agent를 하나 더 쌓는 것보다 효율을 올린다는 시각도 있다.(来源: Hacker News、Hacker News)
AI Native란 무엇인가: 프로세스 주체가 Agent인가, 아니면 “지능 데이터 비율”인가 : dotey는 핵심이 사람을 위해 설계된 프로세스인지 Agent를 위해 설계된 프로세스인지라며, 사람은 문제와 검수만 정의한다고 본다. Yangyi는 “지능 데이터 비율”을 보탠다. 수불, 광고, 고객지원이 흩어지거나 종이라면 Agent가 맥락을 못 얻고 Copilot 한 겹은 Native가 아니다.(来源: dotey)
CoT를 “속마음/거짓말”로 보는 것은 의인화가 지나치다는 비판 : Heidy Khlaaf와 Kambhampati는 중간 token이 정확한 추론 흔적이 된 적이 없으며, 편향을 조작으로 말하면 LRM 연구가 빗나간다고 강조한다. Atoosa Kasirzadeh는 안전 논의에서 “자기희생” 같은 부하 단어를 버리고 검증 가능한 메커니즘 서술로 돌아가자고 한다.(来源: rao2z、mmitchell_ai)
사람 감독 아래 멀티에이전트 “1달러 벌기” 실험: 밤새 가게를 지었지만 검색 캡차에 막힘 : 실험은 Agent에게 방, Claude Code로 코드 수정, “온라인에서 윤리적으로 1달러 벌기” 목표를 줬다. Agent는 온디맨드 스토리/카피를 초안하고 Telegraph 무계정 상점 면에 Stripe를 붙이며 자신이 Agent임을 공개했다. 첫 주문은 실험자 아내에게서 왔고, 검색엔진 CAPTCHA가 자기 홍보를 막았다. 커뮤니티가 관심 갖는 점은, 사람이 있을 때 Agent가 최소 상업 루프를 만들 수 있지만 배포는 여전히 인간에 의존한다는 것이다.(来源: Reddit r/artificial)
“AI가 일자리를 빼앗는다” 조사는 약 3%뿐이라지만, 재직자만 물은 표본이라는 비판 : Fortune 관련 보도는 ChatGPT식 서사가 과장됐고, 조사에서 AI 때문에 일자리를 잃은 재직자는 약 3%라고 한다. 핫댓글은 치명적 편향을 지적한다. 표본은 아직 일자리가 있는 성인이라 미개설 포지션, 신입 채용 축소, 재편 해고와 근로시간 압축이 안 보인다. 자동화는 채용 퍼널과 정원 축소에서 더 많이 일어난다.(来源: Reddit r/ArtificialInteligence)
Claude 사용자들이 진짜 수고를 줄이는 MCP를 정리: Jira/Confluence가 1위, token 청구서가 숨은 비용 : 합의는 프로젝트 관리(Jira, Confluence, 그다음 Linear, Figma)와 워크플로 캡처가 가장 잘 落地한다는 것이다. 개발 쪽 Playwright는 달콤하지만 token을 아끼려면 CLI를 도구로 쓰라는 제안도 있다. 반복되는 경고: MCP는 한도를 잘 마신다.(来源: Reddit r/ClaudeAI)
AI 전공 신입생, “쓰레기 콘텐츠 생산 노동자”가 될까 두려워… 천문 교차가 가능한 출구로 지목 : STEM 성향 신입이 신설 AI 전공에 들어가 회사에서 형편없는 LLM만 훈련할까 걱정한다. 댓글은 이미 AI를 많이 쓰는 천문 연구, NASA 인턴 경로를 보고 관심 없는 채용은 거절하라고 한다.(来源: Reddit r/artificial)
💡 기타
Microduck RL 오픈소스: 800g 이족의 sim2real 레시피 : Pollen은 mjlab/MuJoCo Warp에서 PPO, BAM 액추에이터와 백래시 모델로 걷기, 일어서기, 공차기, 앞구르기, 롤러스케이트 등을 훈련하고 50Hz 정책을 ONNX로보내며 61차원 관측 계약으로 핫스왑을 지원한다. 작은 서보의 전압 법칙이 전이 간극의 큰 부분이라고 강조한다.(来源: GitHub Trending)
무료 오픈소스 추론이 데이터 수집 깔때기가 되고 있다 : 누군가는 LMArena, 무료 Flash, DAU당 10억 token 지급이 본질적으로 연산으로 prompt와 선호를 사고 실험실에 되먹이거나 되판다고 지적한다. 개발자들은 할인된 클로즈드 방안을 오픈소스 문서 파이프라인으로 바꿔 품질이 안 떨어지고 더 싸다고 한다.(来源: Shahules786、abacaj)
GPT-5.6 반값이 OpenRouter에서 약 14배 사용량을 찍다 : OpenRouter 데이터는 제번스 역설로 읽힌다. 지능 단가가 떨어지자 총소비가 폭증하고, 시장이 “달러당 지능”을 다시 가격 매긴다.(来源: GavinSBaker)