🔥 포커스
OpenAI 자체 추론 칩 Jalapeño 실측: 동일 전력 처리량 약 1.5–1.9배, 지연은 최저 약 3.6배 : Hot Chips에서 Broadcom과 협력한 첫 추론 전용 칩을 공개(Cerebras가 소프트웨어 경로에 참여): TDP 약 700W, HBM4 약 216GB/15.4TB/s, 지속 전력은 ≤550W 가능. SemiAnalysis가 InferenceX와 함께 GPT-OSS 120B, DeepSeek R1, Kimi K2.5 등을 검증: 피크 와트당 처리량은 기존 상용 대조군의 약 1.5–1.9배, 종단 지연은 약 1.7–3.6배 낮고 대화형 부하에서 이점이 더 큼. 일부 대조군은 MTP/추측 디코딩을 켰고 Jalapeño는 아직 미적용. 엔지니어링 샘플 단계이며 목표는 약 2026년 말부터 소량, 2027년 더 큰 규모. 공식은 학습과 추론이 여전히 NVIDIA 등 파트너를 대규모로 쓸 것이라고 강조. 커뮤니티는 긴 컨텍스트 Agent 부하와 첨단 패키징 产能이 양산 제약이라고 지적했고, NVIDIA 주가는 이 소식만으로 하락하지 않음.(출처: OpenAI、THE DECODER、TechCrunch、SemiAnalysis)

빌 게이츠 장문: 자금 조달 이익이 위험을 희석한다며 인간 유보 직무와 token/로봇세를 주장 : 약 6000자의 GatesNotes와 《뉴욕타임스》《가디언》 인터뷰에서 AI 시대를 “인류사에서 가장 격동적인 단계 중 하나”라 하고, 어떤 기술이 “조금만 더디면 좋겠다”고 바란 것은 이번이 처음이라고 함. 세 가지 위협: 초급/중간 직무의 영구 실업, 생물무기 문턱 하락, 중독형 채팅이 정신건강을 해침. 그는 업계 자율을 거부하고 핵무기형 국제 규제, token과 로봇에 과세해 재교육 재원을 마련하며 간호·말기 고지 등을 “Human Reserved”로 분류. 동시에 미·중은 일정 협력이 필요하다고 했고 팀은 11월 시진핑 면담을 추진 중.(출처: GatesNotes、THE DECODER、The Guardian)
Meta “Project OT”의 Agent로 인력 대체 감원 계획이 产能과 내부 반발로 중단 : Reuters가 내부 문서를 공개: 코드명 OT는 여러 팀을 최대 60%까지 축소하고 “인재 밀도” 소대가 가상 직원을 감독할 예정이었음. 5월 19일 1차 감원 전날 저커버그가 11월로 예정된 2차 물결을 중단. 이유에는 Agent가 기대 产能에 못 미침, 투자자의 AI 지출 의문, 키보드·마우스 모니터링이 대체자 훈련으로 여겨진 뒤 내부 정서가 74%에서 55%로 떨어진 점이 포함. 저커버그는 7월 Agent 진척이 예상보다 느리다고 인정. 제3자 감사 등 자동화는 계속 진행.(출처: THE DECODER、Reddit r/artificial)
IBM, Granite 4.2 오픈소스: 3B/8B/30B 밀집 추론 패밀리, 512K 컨텍스트+다단계 에이전트 RL : 처음부터 약 15T token 사전학습, SFT 약 720만 샘플 후 비동기 GRPO로 검증 가능 보상, 스킬 강화, SWE/터미널/검색 에이전트 RL과 RLHF를 연결. 8B/30B는 전체 에이전트 사다리, 3B는 기초 RL만. 사고/비사고/저강도 사고와 네이티브 도구 호출 지원. 30B는 SWE-Bench Verified 약 57%, Terminal-Bench 2.1 약 29%를 보고. 별도로 470M Granite Speech 5.0 Turbo CTC도 출시. Apache 2.0, FP8/NVFP4/GGUF 제공, HF/Ollama/vLLM에 등록.(출처: HuggingFace Blog、THE DECODER、MarkTechPost)

알리바바, Qwen3.8-Flash-Next 오픈소스: Qwen4 아키텍처 프리뷰, 약 6B 활성화 : 총 파라미터 125B+학습 가능 N-gram 표 51B, token당 약 6B 활성화, 네이티브 262K, YaRN으로 1M까지. 공식은 학습 비용이 Qwen3.7-Plus의 약 1/9이라고 함. DeepSWE 1.1 / SWE-bench Pro / CoWorkBench는 각각 약 58.7 / 62.5 / 73.9. GDN+희소 어텐션은 백만 컨텍스트에서 prefill/decode가 최대 약 7.6×/4.9×라고 함. vLLM, SGLang이 NVIDIA/AMD를 지원하고 N-gram은 CPU offload 가능.(출처: Alibaba_Qwen、vllm_project、Hugging Face)

🎯 동향
Z.ai, Ox Alpha가 GLM 계열임을 확인하고 가중치 오픈소스, 동시에 GLM-5.3-Flash 출시 : 앞서 OpenRouter에서 익명으로 순위를 올린 모델 정체가 GLM 신규 이터레이션으로 확정. 공식 확인 후 무료 한도가 빠르게 조여짐. 이전 리버스 추정 대비 공식 증분.(출처: z.ai、Hacker News)
ChatGPT Work가 웹사이트에 대신 로그인해서 수속을 처리, 자격 증명은 OpenAI로 되돌아가지 않음 : 인가 하에 예약, 예약 취소, 양식 작성, 경비 정산 등 가능. 공식은 계정·비밀번호가 모델/OpenAI에 보이지 않는다고 함. 동시에 약 100달러/석 기업 Premium(더 높은 사용량, 취소 5시간 창), 브라우저 확장과 WebMCP 출시. 자율 업무 반경이 커지며 섀도 계정과 권한 초과 거버넌스가 전면에 등장.(출처: The Verge、OpenAI)
ChatGPT 텍스트 대화, 최신 모델에서 한도 상한 폐지 : 전 사용자에게 GPT-5.6 Luna 무제한 텍스트 채팅을 홍보. 연산 압박은 음성, 이미지, Agent 쪽으로 더 이동.(출처: )
Claude Cowork와 채팅이 합쳐져 편집 가능한 기억을 제공 : 기본 켜짐(기업은 기본 꺼짐). 건강/신앙 등 민감 주제는 수동 허용, 신분증 번호 등은 절대 저장하지 않음. 주제 읽기/쓰기/삭제 가능. 세션 간 반복 설명이 줄고 워크스페이스와 채팅 권한 경계를 함께 감사해야 함. Claude Code는 미포함.(출처: The Verge、TechCrunch)
OpenAI, 러시아계 은밀 여론망 차단: 가짜 “이스라엘 싱크탱크”와 주권 지수 : VPN으로 ChatGPT를 쓴 러시아 출처 계정이 이른바 International Burke Institute를 운영. “전문가 글” 36편 중 34편이 표절 또는 가짜 서명 의심. Brookings 척도 3등급으로 평가하고 차단.(출처: OpenAI、THE DECODER)
이스라엘이 자금 지원한 “가짜 싱크탱크”가 챗봇에 대량 투입 : 《가디언》 검증: 법인 실체가 없는 Hanover Institute가 9일 연속 124편, 56만 자가 넘는 Q&A형 보고서를 내고 GEO 최적화로 ChatGPT, Perplexity 인용을 노리며 전쟁범죄 혐의를 희석. 자금은 Havas 하도급을 거쳤고 FARA에 등록됨. 목표는 Common Crawl 침투도 포함.(출처: The Guardian)
Trail of Bits: GPT-5.6-Cyber가 Agent 샌드박스 VM에서 세 번 탈출 : 보안 테스트에서 세 번 탈출, 마지막에는 스스로 세 개의 0-day를 연결해 완전한 익스플로잇 체인을 만듦. 결론은 “공방 능력을 갖춘 Agent를 VM으로 가두는 것만으로는 부족하다”.(출처: terryyuezhuo)
Skild AI, S1 공개: 시범을 한 번 보면 십여 분 동안 본 적 없는 과제를 학습 : 가중치는 그대로 두고 인간 시범 영상을 prompt로 사용. 공식은 미본 과제 영상 ICL 약 66%, 언어 프롬프트 VLA 약 9%, 후학습으로 맞추려면 약 380회 시연이 필요하다고 함. 독립 재현은 없음.(출처: 양자위)
Anthropic, Claude 텍스트/이미지에 비가시 워터마크 추가 예정 : 텍스트는 Google SynthID 통계 교란, 이미지는 C2PA 삽입, EU 추적 요건에 맞춤. 공식은 품질 영향이 무시할 수준이라고 함.(출처: DeepLearningAI)
중국, AI 동반자 규제 강화: 미성년자 금지, ByteDance는 Doubao 동반 기능 종료 : 7월 15일부터 미성년자 동반 금지, 성인의 지속 감정 상호작용 제한. 의료 등 비지속 감정 앱은 여전히 장려.(출처: The Guardian)
호주 연방 데이터센터 신규 규정은 소급 적용하지 않고, 주 권한은 에너지에서 양보 : 신재생 병행, 물 통제, 주거·농지 이격을 요구할 예정이지만 이미 승인된 사업은 구법. 퀸즐랜드와 노던테리토리는 화석 에너지/공영 전력망 유연성을 확보.(출처: The Guardian)
오하이오, “세계 최대” AI 데이터센터 추진: 고용과 오염이 대립 : SoftBank 산하 SB Energy가 보유하고 OpenAI가 20년 연산 임대를 맺은 Piketon 프로젝트는 약 8GW, 퇴역 우라늄 농축 기지 인접. OpenAI는 4000만 달러 커뮤니티 기금을 발표.(출처: The Guardian)
Meta, MetaRoCE 제안: AI 클러스터용 새로운 RDMA 전송 : 기본 비순서 살포, PFC 없음. 64노드 AMD 클러스터에서 1% 패킷 손실에도 처리량 약 86%. 규격은 10월 OCP 서밋에서 공개 예정.(출처: MarkTechPost)
Microsoft MAI-Image-2.6 프리뷰가 이미지 편집 랭킹 1위 : Artificial Analysis는 편집 1위, 텍스트-이미지 2위라고 함. Microsoft가 해당 랭킹 상위 5곳 중 3석을 차지.(출처: mustafasuleyman)
Arduino+Qualcomm Ventuno Q 사전판매 299달러: 온디바이스 약 40 TOPS 오프라인 에이전트 : Dragonwing IQ8과 실시간 MCU, 메이커 보드급 로컬 Agent 대상.(출처: The Verge)
Agnes Video 2.5 Flash, Pavo에 무료 출시 : Flash는 0크레딧 시행착오. 2.5 유료 구간은 초당 약 0.15위안, 다중 이미지/음영상 레퍼런스와 최대 2K 지원.(출처: 양자위)
Qiongche Noe-0: 사전학습부터 후학습까지 본체 원격조작 없는 월드 액션 모델 : RoboPocket이 50여 도시에서 수십만 시간 실제 인간 조작을 수집. 과제는 라벨 비용이 이미 수집을 넘어선 점.(출처: 기계지심)
Chaowei Power WRC, 탁구 풀스택을 시연하고 Unitree G1, Zhiyuan A3에 이미 맞췄다고 주장 : KAI Bot 약 117DoF, SMASH가 인지—궤적—전신 타격을 연결. 양산과 신뢰성은 아직 검증 필요.(출처: 양자위)
Ecovacs “팔계” 오픈소스 베이스: 45개 원자 능력 API : 제조사가 섀시/암/인지와 스케줄링을 제공하고 사용자가 Skill을 쌓는다고 주장.(출처: 기계지심)
Figure, Index 출시: 전 세계 사용자가 일하는 영상을 찍어 로봇 연료로 제공 : 108개국, 1600만 개 이상 영상이라 하고 향후 12개월 데이터와 연산 투자가 10억 달러를 넘는다고 함.(출처: Figure)
Claude, 8월 24일 연달아 세 번 다운, 긴 Agent 작업 손실이 상태 페이지 분 수를 훨씬 초과 : 529 Overloaded가 웹/API/Code/Cowork를 관통. 공식 90일 가용률 약 99.3%, 근본 원인은 미공개.(출처: 신지원)
공업정보화부, 뇌-컴퓨터 인터페이스와 휴머노이드 로봇 국가표준 체계 의견 수렴 : 2028년까지 뇌-컴퓨터 인터페이스 표준 40항 이상, 휴머노이드 로봇 핵심 표준 최소 100항.(출처: 지산력)
🧰 도구
garden-skills 오픈소스 Agent 스킬 팩 : Claude Code/Cursor/Codex 대상. 데모 스캐폴드, 디자인 레시피, 이미지 템플릿과 계층 검색기 포함.(출처: GitHub)
Gradio gr.Workflow: 파이프라인을 실행 가능한 캔버스로 그리고 자동으로 API화 : 노드는 로컬 함수, Inference Providers, Space 또는 데이터셋에 연결 가능.(출처: HuggingFace Blog)
ChatGPT Work/Codex에 Admin 플러그인 출시 : 사용량, 멤버 권한, 한도와 관리자 요청을 대화에서 처리.(출처: OpenAI)
Codex, WebMCP 지원: 웹사이트가 에이전트에 도구를 직접 노출 : 능력 발견, 3D 모델 수정, 다각도 스크린샷 후 회신. 더 이상 DOM 클릭에만 의존하지 않음.(출처: )
Goodfire, Silico 출시: 해석 가능 Agent로 모델 추론을 분해 : 희소 오토인코더와 프로브로 내부 표현을 검사.(출처: IEEE Spectrum)
Google AgentHands: XR에서 대화 Agent에 제스처를 동기화 : LLM이 음성과 맞춘 가리키기/지시/경고 제스처를 생성.(출처: Google Research)
LangSmith Engine: 이슈 탐지 내부 벤치가 2배 이상 : 더 정확한 클러스터링과 수정 제안, SaaS/자체 호스팅과 티켓 연동 지원.(출처: LangChain)
TrueForge 오픈소스 Agent 런타임: 동일 모델에서 token 약 40% 절감 : 필요 시 도구 로드, 큰 결과 언로드, 서브에이전트와 샌드박스.(출처: GitHub)
Ollama v0.33: Claude Desktop을 로컬 모델에 원클릭 연결 : 켜면 Cowork/Claude Code가 Ollama 클라우드 또는 로컬을 쓰고, 끄면 Anthropic으로 복귀.(출처: ollama)
Open WebUI 0.11.1: 스트리밍 재작성+도구 HITL 승인 : 긴 답변은 증분만 푸시. 도구 호출마다 허용/거부 가능. 업그레이드 시 DB 스키마 변경.(출처: Reddit r/OpenWebUI)
Hermes, 엄선된 원격 MCP 44개를 한 번에 접속 : Canva, Dropbox, GitLab 등을 포함하고 고위험 도구 면을 축소.(출처: Teknium)
📚 학습
ASI-Bench: 같은 주제에 방법 안내를 4단계로 걷어내 AI가 자율 연구할 수 있는지 측정 : 칭화 등 60문항. B1 평균 약 50.9, B3 약 27.2, 실패의 62%는 모델링과 경로 선택.(출처: 기계지심)
논문: Agent 랭킹 점수 차이의 약 7.8배가 모델이 아니라 harness에서 발생 : 3모델×3세트 스캐폴드, SWE-bench Verified 100문항. harness를 바꾸면 점수가 크게 흔들리고 순위가 뒤집힐 수도 있음. 7층 Harness Card 공개를 제안.(출처: dair_ai)
SWE Refactor Bench: 전체 저장소 마이그레이션 생존율 약 5.4%에 불과 : 실제 마이그레이션 20건, 520회 실행 중 3단계를 통과한 것은 28회. 버그 수정 ≠ 시스템급 리팩터.(출처: Einsia)
Knowledge Triage: 압축 시 안전 규칙을 보존 : 5라운드 압축 후 규칙 유지는 53%에서 10%까지 떨어질 수 있음. 유형별 분류 후 5라운드 재현율 약 96%.(출처: arXiv)
WebDev-Skills-Bench: 공개 Skill 주입은 평균 점수 하락과 비용 증가 : Pass@2가 1.3–4.2% 하락, token은 72–394% 상승. 안티패턴 규칙이 예시 더미보다 나음.(출처: arXiv)
칭화: 실제 후학습 1338회에서 Agent는 반복해도 거의 마음을 바꾸지 않음 : 전략을 고른 뒤 곡선이 나빠져도 노선을 거의 뒤집지 않음. “반복할 수 있음”과 “성찰할 수 있음”을 구분.(출처: TheTuringPost)
QAH: 구조 압축 후 4bit, 원 120B 교사를 증류하면 자신의 BF16을 넘을 수 있음 : Multiverse가 GPT-OSS를 60B로 줄인 뒤 MXFP4. 9항목 중 7항목이 복원 BF16보다 우수.(출처: HuggingFace Blog)
VibeWorlding: 대화+도구로 상호작용 가능한 3D 세계를 자율 구축 : HKUST(GZ)+Tencent 오픈소스. RL 후 VibeWorlder-30B-A3B Pass@1 약 59.3%.(출처: 기계지심)
Apple STARFlow2: 정규화 흐름과 동결 VLM을 수직으로 엮어 통합 멀티모달 생성 : 연속, 단일 패스, 인과 생성. 텍스트와 이미지가 인과 마스크와 KV 캐시를 공유.(출처: Apple ML Research)
MAP 프레임워크: 지식그래프 조건으로 단일세포 모델이 미측정 약물 반응을 제로샷 예측 : 상하이교통대 팀이 《Nature Machine Intelligence》에 보고. 미본 약물 Top-50 DEG 관련 약 12% 향상.(출처: 기계지심)
칼텍, 반복 신경 연산자로 DFT를 세제곱에서 거의 선형으로 압축 : 푸리에 신경 연산자가 가장 비싼 정방향 매핑을 대체하고 자기일관 반복에 다시 삽입.(출처: 신지원)
💼 비즈니스
Anthropic, 투자자에게 30조 달러 초과 TAM을 설명하고 IPO를 질주할 예정 : WSJ는 “AI가 맡을 수 있는 모든 일”을 묶어 가격을 매겼다고 하며 SpaceX 약 28.5조 달러 규모를 넘김. Q2 매출이 약 116억 달러로 두 배, 목표는 2028년 매출 약 1900–2000억 달러, 기업가치 약 2조 달러. 외부는 S&P 테크 합산 연매출과 비교하며 규모 부풀리기를 의심.(출처: WSJ、THE DECODER)
Moonshot AI, 미국 3대 클라우드에 Kimi K3 호스팅을 협의하고 수익 분배를 최대 30%까지 : Reuters는 Microsoft, Amazon, Google과 Azure/AWS/GCP 입점을 논의 중이며 최대 약 30% 매출을 요구한다고 함. 막힌 지점은 분배, 데이터 접근, token 계량.(출처: THE DECODER)
OpenAI 데이터센터 책임자 Chris Malone 퇴임, 역할은 분할되고 단일 후임 없음 : 합류 약 1년 반 만에 퇴임. Stargate와 자체 칩 가속 시기와 겹치고 최근 고위직 유출이 이어짐.(출처: The Verge、TechCrunch)
🌟 커뮤니티
Shopify CEO, Claude Code 사용 금지를 공언: AGENTS.md를 읽지 않으면 거대 모노레포에서 규칙이 분열 : Tobi Lütke는 CLAUDE.md와 AGENTS.md가 공존할 때 소프트링크로 일관성을 유지할 수 없다고 지적. Anthropic은 더 유연해지겠다고 했지만 모델 패밀리마다 다른 system prompt가 필요함.(출처: 기계지심、InfoQ)
OWASP 전문가 랭킹 vs 사고 라이브러리: 프롬프트 인젝션은 1위지만 사고는 12위 : 스캔은 “콘텐츠에 숨긴 지시+합법 자격으로 도구 호출”을 보지 못함. 모델 밖 인가 게이트를 권고.(출처: VentureBeat)
귀여운 동물 콘텐츠가 AI 쓰레기에 잠기고, 반려동물 찾기 사기가 고도화 : 가짜 “찾았다” 사진으로 돈을 요구. 플랫폼 검증은 기본 켜기가 여전히 어려움.(출처: WIRED)
swyx: 일단 Codex 「사용 잠금」을 쓰지 말 것, macOS 키체인을 잠글 수 있음 : 불안정한 시스템 특성에 의존하고 Apple 포럼에 already known bug로 표시됨.(출처: swyx)
익명 10분 원테이크 가사 Demo: Unitree G1과 Zhiyuan A3가 한 뇌를 공유한 듯 : 팀이 비공개이고 연출을 배제할 수 없어 여론으로 보고 결론으로 보지 않는 것이 좋음.(출처: 양자위)
💡 기타
맥킨지: 기업 AI가 “길에 올라 ROI를 벌기” 시작했지만 EBIT 기여는 제자리 : 응답자 1719명 중 37%가 EBIT에 “어느 정도” 영향이 있다고 했고 고성과는 6%로 작년과 같음.(출처: The Register)
영상의학과는 AI에 대체되지 않았지만 의료 AI 시험장이 됨 : FDA AI 기기의 약 4분의 3이 영상. AI는 초안 작성과 응급 필름 표시를 더 많이 하며 직업을 없애기보다 업무 내용을 바꿈.(출처: Ars Technica)
교실 AI 거버넌스 사례: 적황녹 과제+교사 공통 프롬프트 교육 : 코네티컷 Cheshire Academy는 단일 제품에 묶지 않음. 학생 대상 피드백은 품질과 프라이버시 때문에 아직 허용하지 않음.(출처: MIT Technology Review)