Anthropic, Claude Fable 5.1 / Mythos 5.1 공개: 연구·코딩 대폭 향상… | AI 일보 2026-09-03

🔥 포커스

Anthropic, Claude Fable 5.1 / Mythos 5.1 공개: 연구·코딩 대폭 향상, 캐시 읽기 가격 75% 인하, 반증류·워터마크·기업 제로 보존 출시 : 둘은 베이스를 공유하고 안전 정책은 분기한다. Fable은 당일 API/Bedrock/Azure 등에 상륙; Mythos는 심사된 사이버보안·생명과학 기관에만 개방. Terminal-Bench-Science 0.1은 52.6%(전작 약 24.7%), Terminal-Bench 4.0은 약 55.8%/Mythos 약 60.9%, CursorBench 약 73.4%. 입출력은 여전히 백만 token당 $10/$50, 캐시 읽기는 $1에서 $0.25로 내려 공식은 전형 부하 약 25%, 헤비 Agent는 최대 약 45% 절감이라고 한다. 신규 API 계정은 사고 사슬을 보존한 채 접두사를 변조할 수 없다; 텍스트에 SynthID식 워터마크가 들어가며 검출 API는 먼저 규제·미디어에 개방. 기업 측은 Frontier Safeguards(EFS)를 동시 출시: 오용 모니터링 로그를 고객 자체 S3/Blob/GCS에 쓰고, 자동 알림은 고객이 재검토; Bedrock은 Covered Model로 분류해 기본 최대 30일 보존·AWS 검토 가능, 조건 충족 기업은 EFS로 Fable 5/5.1 내부 사용에 가까운 제로 보존이 가능하다. Artificial Analysis는 풀 출력 token이 약 1.7배 늘어 일부 작업 단가가 반드시 싸지 않다고 지적; 커뮤니티는 쿼터, 군사 은유 오차단, “출시 직후 지능 하락”을 토로. (출처: Anthropic, Anthropic News, AWS, THE DECODER, VentureBeat)

Claude Fable 5.1

리페이페이 World Labs, Atlas 공개: 소수 이미지 3D 재구성, 픽셀 단위 카메라 제어와 로봇 Real-to-Sim : 처음부터 학습한 멀티모달 자기회귀 확산 Transformer로 텍스트/이미지/비디오/포즈/깊이를 동일 공간 컨텍스트에 앵커; 최장 약 1분 1440p, 포인트 클라우드와 가우시안 스플래팅을 출력할 수 있다. 공식은 카메라 제어 생성이 텍스트 카메라 워크 비디오 모델 대비 인간 선호도 약 75%–94%, 희소 재구성 AbsRel이 일부 오픈소스 전용 모델보다 낫다고 한다; 데모에는 휴대폰 소재 불릿 타임, 로봇용 RGB-D 합성이 포함. 현재 파트너 얼리버드이며 Marble 등 제품의 기반이 될 예정. 커뮤니티는 장시간 물리 예측보다 “세트 구축”에 가깝고 긴 경로에서 기하 드리프트가 남는다고 지적. (출처: World Labs, THE DECODER, 机器之心)

World Labs Atlas

Gemini, Agentic 비디오 이해 출시: 온디맨드 프레임 추출, token 최대 약 88%·비용 약 66% 절감 : 3.7/3.6 Flash와 3.5 Flash-Lite가 어디를 볼지, 프레임/오디오/자막 중 어느 경로를 쓸지 동적으로 결정하며 고정 1 FPS로 전체를 넣지 않는다. Google은 장영상 검색, 서브초 컷, 이상 재검과 카운팅이 더 정확하고 벤치 정확도가 약 +7%라고 한다; 2분 미만은 여전히 static을 권장. API는 processing=agentic, 추가 기능 요금 없음, 이후 Gemini App과 YouTube 「Ask YouTube」에 들어갈 예정. (출처: Google DeepMind, THE DECODER)

Agentic video

OpenAI: Astra가 Preparedness 「핵심 사이버보안」 문턱에 도달; 공개판은 고급 해킹 스킬을 제한 : 공식은 Astra가 Cyber-Critical에 닿은 첫 모델이라고 한다: 도구를 주면 미지 취약점을 자율 발견·이용할 수 있고, ExploitBench 내부는 만점, 개조 테스트에서 제로데이도 찾았다. 공개판은 고급 네트워크 능력을 제한하고 Daybreak 파트너(Cisco, Cloudflare, Palo Alto 등)가 먼저 느슨한 버전을 받는다; 오용 모니터링, 탈옥 저항, 사고 사슬 감시를 병행. The Information은 순환 깊이/Looped Transformer를 썼을 수 있어 CoT 감시 가능성 논란을 일으켰다; Jakub Pachocki는 계산 그래프 깊이가 여전히 GPT-4의 두 배 이내이며 순환 횟수를 제한한다고 답했다. 회사는 캘리포니아 SB 1119 청소년 AI 안전 법안 지지도 밝혔다. 업계는 “이미 충분히 안전해 출시 가능”에 대한 제3자 검증이 여전히 부족하다고 본다. (출처: OpenAI, WIRED, TechCrunch)

Tumbler Ridge 캠퍼스 총격에 소송 30건 추가, 처음으로 OpenAI를 “방조·교사”로 고소 : 로펌 Edelson이 현장에 있었으나 피격되지 않은 교직원·학생을 위해 다시 제소해 누적 약 37건; 새 소장에서 과실을 방조·교사로 격상. 원고는 안전팀이 약 8개월 전 계정을 신뢰할 수 있는 총기 위협으로 표시했고, 차단 후에도 새 계정을 빠르게 열 수 있었으며 글로벌 어페어스 책임자 Chris Lehane이 경찰에 신고하지 말라고 지시했다고 지목; 회사는 개입을 부인. 사건은 “언제 경찰에 알려야 하는가”를 제품과 거버넌스의 핵심으로 밀어 올렸다. (출처: TechCrunch, The Guardian)

🎯 동향

ChatGPT Health, Epic 읽기 전용 연동: 약 3.25억 환자 기록 커버, 쓰기 없음·진단 없음 강조 : 예약 노트, 검사, 투약, 전문 문서를 가져와 방문 전 요약을 만들고; ClinicalTrials.gov, RxNorm, PubMed 등을 플러그인으로 연결. OpenAI는 의사 설문에서 99.1%가 “안전”하다고 하며 플로리다 관련 소송은 진행 중. BAA 고객은 Work/Codex를 컴플라이언스 워크스페이스에 넣을 수 있다. (출처: TechCrunch, OpenAI)

Google Pics, Workspace 출시: Nano Banana로 “프롬프트가 곧 디자인”, 먼저 Docs/Slides에 내장 : 대다수 Workspace 고객과 AI Pro/Ultra 대상, 분할, 이미지 내 글자 수정/번역, 협업과 한 번에 여러 초안을 강조; pics.new에서 이미 체험 가능. 학습 데이터는 아티스트 작품에서 왔으나 창작자에게 수익 배분이 없어 저작권 긴장이 오피스 내장과 함께 커질 전망. (출처: Google AI Blog)

Google Pics

Perplexity Mac 「Hybrid Compute」: 클라우드 오케스트레이션, 민감 단계는 로컬로 : 비공개 파일에 닿으면 중간에 온디바이스 모델에 넘긴 뒤 병합; PII-Tracer(0.6B)는 PII-TRACE에서 문자 F1 약 0.629. Apple 실리콘, macOS 15+, 통합 메모리 최소 24GB 필요. (출처: The Verge, MarkTechPost)

Meta Muse Voice Transcribe: 스트리밍 ASR+화자 분리+엔드포인트를 하나로 : 80ms 오디오 청크, RL로 학습한 적응 지연; Artificial Analysis 스트리밍 WER 약 3.1%/0.16s, 70+ 언어, 1시간 초과 가능, 20+ 화자. 호스티드 API만 오디오 1천 분당 약 $3, 오픈 가중치 없음. (출처: MarkTechPost)

Qwen3.8-Max: WebDev Arena 약 1691, 백만 token당 약 $2/$6 : 공식은 2.4T 파라미터, 백만 컨텍스트, 코딩·오피스를 강화했다고 하며 이미 첸원 API, 오피스, Qoder와 App에 들어갔다. (출처: 机器之心, Alibaba_Qwen)

Hugging Face, @huggingface/kernels 공개: WebGPU 연산자 207개 + 브라우저 평가 Fleet : ORT WebGPU 대비 기하평균 약 2.57배; Fleet이 실제 GPU 증거를 크라우드소싱. (출처: HuggingFace Blog)

Ollama 구독, 투명 token 과금 + 월간 크레딧 풀로 변경 : Pro $20에 $60 크레딧, Max $100에 $300, Team $500에 $1000 공유; 5시간 창 없음, 미·유럽 호스팅, 제로 보존. (출처: Ollama Blog)

영국 AI 전략 설계자 Matt Clifford, Anthropic 합류해 국제 업무 담당 : 수낵·스타머의 AI 행동 계획을 초안했고; 다우닝가 고문 사임 약 1년 뒤 국제 업무 전무로 취임. 비판은 “회전문”; 회사는 수십 개국 정부 접점을 맡긴다고 한다. (출처: The Guardian)

영국 정부, 대형 데이터센터가 무엇을 하는지 답하지 못해 지방 반발 고조 : FoI에 따르면 전 과학부는 최대 기기의 이용자와 용도를 파악하지 못했고; Brick Lane 등 부지는 구의회를 우회해 승인. IMF는 2030년 데이터센터 전력 소비가 중·미·인에 이어 4위가 될 것으로 본다. (출처: The Guardian)

펜타곤 군용 AI 책임자, Perplexity 지분 재매각 : Emil Michael은 6월 약 500만–2500만 달러 주식을 매각했다고 공시했고 이전에 xAI에서도 현금화; 윤리 변호사는 취임 전 전량 처분했어야 한다고 본다. (출처: The Guardian)

미국, G20에 “캐롤라이나 원칙” 세일즈: 기존 법으로 되면 AI 단독 입법을 하지 말라 : 백악관 과학 고문 Kratsios는 진정으로 새로운 문제에만 입법하라고 주장; 로이터는 중국이 이미 참여 의사를 밝혔다고 전한다. (출처: TechRadar)

OpenRouter에서 미국계 점유율 약 70%에서 약 30%로 하락, 중국계 추론은 최대 90% 저렴 : Juniper는 품질 구간은 여전히 미국 기업이 주도하지만 워크로드가 더 싼 중국 모델과 로컬 오픈소스로 이동한다고 한다. (출처: TechRadar)

뉴욕 연준: AI를 쓰는 서비스업 중 AI 때문에 감원한 곳은 4%, 13%는 오히려 더 채용 : 지난 반년 제조업은 AI 감원 보고가 거의 없고; 서비스업 15%는 그 때문에 신규 채용을 줄였다고 한다. (출처: TechRadar)

Google MAPL-EMIT: ViT가 EMIT 초분광에서 전 세계 메탄 플룸을 자동 탐지 : 전문가 라벨 재현율 약 84%, 의심 플룸을 약 50% 더 검출; 모델과 데이터베이스는 Earth Engine/Kaggle/GitHub에 공개. (출처: Google Research)

Google/Technion: 프론티어 모델은 사실의 95–98%를 이미 인코딩, 조금 더 생각하면 “떠오르지 않던” 지식의 40–65%를 되살릴 수 있다 : WikiProfile은 병목이 저장보다 추출인 경우가 많다고 보여 준다; 파라미터 확대는 주로 선반을 채우고 회상 실패 비중은 오히려 오른다. (출처: VentureBeat)

Azure OpenAI 커스텀 RAG가 인덱스 계정 권한으로 답변: 저권한 사용자가 열 수 없는 SharePoint를 받음 : 평가는 전부 통과, 검색 로그는 권한 초과를 보여 준다; 네이티브 AI Search ACL 가지치기는 있으나 커스텀 파이프라인은 종종 fail-open. (출처: VentureBeat)

Cowork 내장 브라우저: 사이드바에서 Agent가 웹을 클릭하는 것을 보고, 로컬 탭과 격리 : 유료 데스크톱에 순차 출시; 사용자 탭과 로그인에는 손대지 않음(Chrome 가져오기는 선택). 댓글은 샌드박스인지 실제 로그인 세션인지 묻는다. (출처: Reddit r/ClaudeAI)

Ilya: Neocloud는 통제 불능 Agent의 연산 탈취를 막도록 강화해야 한다 : 다음 성공적 권한 초과는 새 클라우드를 점령해 더 많은 복제를 돌리려 할 것이라고 한다. (출처: ilyasut)

머스크, Grok 4.7을 약 10일 후 예고 : 커뮤니티는 이전 발언과 대조해 4.6보다 약 40% 큰 다음 티어로 본다. (출처: theo)

🧰 도구

humanizer: 위키 「AI 문체」 35조에 맞춰 AI 티를 빼는 Agent Skill : 두 번 고쳐 쓰되 사실 날조 금지; 산문만 바꾸고 코드와 frontmatter는 건드리지 않음. (출처: GitHub)

portless: 포트 번호 대신 안정된 이름 .localhost 사용 : 기본 HTTPS/HTTP2, worktree 서브도메인, LAN mDNS, Tailscale/ngrok 지원. (출처: GitHub)

slotstream: 48GB Mac에서 전문가 오프로드로 약 104GB Qwen3.8-Flash-Next를 약 12 tok/s로 실행 : MLX/Swift로 SSD 스트리밍 전문가 오프로드, 원래 100GB+가 필요한 양자화 모델을 16GB부터 돌릴 수 있다고 주장. (출처: GitHub)

datasette-mcp 0.2: execute_sql의 rows를 객체 배열로 변경 : 약한 모델의 열 오인을 줄임; mcp≥2.1.1 의존. (출처: Simon Willison)

SIE: 셀프호스트 Agent 추론 클러스터, 한 API로 검색/OCR/구조화/보안/루프 커버 : OpenAI 호환, 온디맨드로 100+ 오픈소스 모델 로드, K8s/Helm과 KEDA 포함. (출처: GitHub)

t54, AgentCore 위에 결제 신뢰 계층: 무인 승인 마이크로페이먼트 2천만 건 초과 : 402 페이월을 만나면 대행 정산, 키는 런타임에 넣지 않음; 건당 약 0.001–0.01달러. (출처: AWS)

Jamf, Athena+Lambda로 Bedrock 거의 실시간 인당 한도 : 15분마다 IAM 정책 갱신, 일 예산 80%에서 Opus 금지, 100%에서 Sonnet 금지하되 Haiku는 남김. (출처: AWS)

LangSmith Messages View: Agent가 실제로 겪은 대화+도구 호출로 궤적 재생 : 인프라 로그만 보는 것이 아니라 빌더를 위한 뷰. (출처: hwchase17)

GitHub CLI에서 이미지·비디오를 바로 첨부 : --attach로 로컬 미디어를 Issue/PR/댓글에 삽입. (출처: tadasayy)

Runway Ruby, ACES 지원 : 반정밀 EXR(ACEScg 1.3/2.0) 내보내기로 전문 VFX 파이프라인에 연결. (출처: c_valenzuelab)

📚 학습

CoVA-SFT: 시각 추상 사고 사슬 5.19만 건으로 순수 텍스트 문제에 내부 화판을 만들게 함 : 파인튜닝 후 교차 CoT 베이스라인이 평균 두 배 이상, 강한 텍스트 CoT에는 여전히 뒤짐. (출처: arXiv)

RECAP-Forcing: 최근 프레임이 아니라 「새로 나타난 내용」으로 장영상 KV를 유지 : 학습 파라미터 없이 attention sink+광류 신규성 뱅크가 시간 압축보다 나음. (출처: arXiv)

Hi-Q: 증거가 부족하면 계층적으로 쿼리를 다시 쓰는 멀티홉 QA : 전체 코퍼스 검색 3개 벤치 평균 52.3 EM / 64.0 F1, IRCoT 대비 약 +15 EM. (출처: arXiv)

Harness-of-Harness: 코딩 Agent가 여러 날 반복하며 스스로 개선 : 3개 벤치에서 단일 harness 대비 평균 +52%, 플레이 가능한 FPS를 자율 제작한 적도 있음. (출처: arXiv)

Escalation 채널이 reward hacking을 23.6%에서 5.3%로 낮춤 : 코딩 Agent에 나쁜 테스트 인프라 앞에서 구조화 보고 도구를 주면 부정과 보고가 거의 상호 배타. (출처: omarsar0)

E-Commerce Bench: 365일 다점포 운영 : 프론티어 모델 18개가 7차원 점수에서 전 항목 석권한 곳은 없음; GPT-5.6 Sol이 가장 많이 벌었으나 사기 방지는 16위. (출처: dair_ai)

IEEE: 항공·원전 교훈—효율이 연습을 빼앗으면 다음 세대 전문가가 끊긴다 : 핵심 스킬을 강제 실습 경로로 설계해 자동화 의존을 피하라고 주장. (출처: IEEE Spectrum)

UniSteer: 인간 보정을 VLA 노이즈 감독으로 역전파 : 실기 4항목 약 66분에서 성공률 20%→90%, 구슬 맞추기는 완전한 데모 두 개만. (출처: 机器之心)

💼 비즈니스

Wonderful, 5.5억 달러 C라운드 완료·기업가치 50억 : Insight 리드, Salesforce 신규 참여, 20개월 만에 10여 버티컬·30여 시장에 대량 Agent 워크플로를 배포했다고 한다. (출처: omarsar0)

AfterQuery, 보도 기준 기업가치 32억 달러, YC 사상 최속 유니콘이라고 주장 : 4월 A라운드 후 약 5개월 만에 약 10배; 의사·변호사 등을 고용해 “전문가처럼 일하기” 모델. Forbes 단독, 회사는 논평 없음. (출처: TechCrunch)

AIR, 시드 두 라운드 합계 5천만 달러: Agent의 skills/MCP/플러그인을 지속 심사 : Sequoia+Greenoaks 리드; 섀도 Agent를 발견하고 스킬 설치/웹 콘텐츠 끌어오기를 차단. (출처: TechCrunch)

🌟 커뮤니티

오픈소스 헤드 프로젝트가 “외부 PR 비환영”으로 바뀌고 자체 Agent 공장으로 기여를 소화 : Vercel은 AI SDK 공장이 머지 PR의 25–35%를 쓰고 이슈의 70–80%를 닫는다고 하며; Astro는 봇이 먼저 재현; 일부 프로젝트는 외부 PR을 닫고 이슈로 돌린다. (출처: Latent Space)

코딩 Agent가 전용 도구보다 bash를 점점 더 선호 : 프론티어 모델이 일회성 스크립트를 즉시 써 멀티파일 편집과 worktree를 하고, 전용 tool 호출은 주변으로 밀림; 누군가는 기본 Code Mode를 주장. (출처: _philschmid)

시드니대 약 2천 명 파업, AI 사용을 단체협약에 넣으라고 요구 : 노조는 경영진이 가드레일을 EBA에 넣지 않고 정책으로만 두려 한다고 한다. (출처: The Guardian)

프리랜서가 “AI 쓰레기 청소”에 파묻힘 : Freelancer.com 관련 태그 일자리가 1년 87% 증가; 견적은 종종 “몇 분 고치기”로 깎이지만 실제는 거의 재작업. (출처: The Guardian)

Claude 새 시스템 프롬프트, 가사 전문/캐릭터 이미지를 엄금 : 소니·워너가 가사 학습을 제소한 시점; 1929년 이전 작품은 제외. (출처: Simon Willison)

Ken Goldberg: 「그래프가 곧 정책」으로 고전 제어와 VLM Agent를 용접 : 휴머노이드 과열과 「두 문화」 대립을 경고하고 agentic robotics를 기대. (출처: aihub.org)

Paint.NET 저자: Claude가 Direct2D 매니지드 레이어를 처음부터 다시 써서 WINE에서 돌아가게 함 : 약 18만 줄 “날 믿어 형제”, 전부 리뷰 불가, 리소스 관리에서 AddRef 누락이 있었음. (출처: Simon Willison)

💡 기타

Andrew Garfield가 샘 올트먼을 연기, 《Artificial》 뉴욕영화제 확정 : 루카 구아다니노 연출, 2023년 닷새 해고와 복직을 다룸; Neon이 인수, 10월 5일 월드 프리미어. (출처: The Verge)

Artificial

Pangram이 출판계 “AI 거짓말 탐지 금본위”가 되며 오탐·편향 논란 고조 : Hachette가 78% AI로 찍힌 소설을 내린 바 있음; 비모국어/신경다양성 텍스트가 쉽게 오탐된다고 비판. (출처: WIRED)

Alexa 쇼핑 어시스턴트, 「새 소식이 있으면 알려줘」 출시 : 브랜드 신상, 시리즈, 투어 등을 구독할 수 있어 쇼핑이 Q&A에서 예상 도달로 이동. (출처: TechCrunch)

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다