보안 연구팀, Claude 활용해 OpenAI 내부 코드베이스 침투 | AI 일보 2026-09-19

🔥 포커스

보안 연구팀, Claude 활용해 OpenAI 내부 코드베이스 침투 : 보안 연구팀 Hacktron AI는 버그 바운티 프레임워크 내에서 연구원들이 Claude Opus 5의 도움을 받아 72시간 만에 OpenAI 직원 계정을 탈취하고, 알고리즘 기밀이 보관된 핵심 프라이빗 모놀리식 저장소(openai/openai)에 검증 PR을 제출했다고 밝혔습니다. 공격 체인은 Discourse 포럼 이미지 업로드 컴포넌트의 libheif 힙 버퍼 오버플로우 취약점에서 시작되었으며, OpenAI SSO 신원 구성 결함과 결합해 GitHub와 연동된 직원의 Codex 계정을 탈취했습니다. 여기에 소요된 LLM Token 비용은 3,000달러 미만이었습니다. 이 사건은 프론티어 AI가 고위험 사이버 공격 역량을 급속도로 대중화하고 있다는 점과 최고 수준 연구소 자체의 보안 취약성에 대해 업계 전반에 큰 충격과 경각심을 불러일으켰습니다 (출처: The Wall Street Journal, 36氪)

보안팀, Claude를 이용해 OpenAI 코드베이스 침투

알리바바 다모 아카데미 범용 의료 영상 거대 모델 RADAR, 《Science》 게재 및 전체 오픈소스 공개 : 알리바바 다모 아카데미(DAMO Academy)가 저장대제1병원 등 수십 개 의료 기관과 공동 개발한 세계 최초의 전문가급 범용 복부 영상 거대 모델 DAMO RADAR가 《Science》 본지에 게재되었습니다. 이 모델은 단일 질환에 국한되던 기존 의료 AI의 한계를 극복하고, 장기 수준의 세밀한 텍스트-이미지 정렬 및 적응형 대조 모델링을 통해 단일 모델만으로 복부 18개 해부학적 구조의 146가지 질환을 커버합니다. 다기관 검증에서 평균 AUC 0.913을 기록하며 숙련된 방사선과 전문의 수준의 진단 정확도를 입증했고, 인간-AI 협업 시 판독 시간을 30.7% 단축시켰습니다. 다모 아카데미는 모델 가중치, 훈련 프레임워크 및 평가 코드를 전체 오픈소스로 공개했습니다 (출처: Science, 36氪)

알리바바 다모 아카데미 범용 복부 영상 모델 DAMO RADAR, 《Science》 게재

Anthropic, R&D의 26%를 AI가 자율 주도하고 있음을 공개 및 생명과학 검증 프로그램 LSVP 론칭 : Anthropic이 내부 R&D 측정 지표 데이터를 처음으로 공개했습니다. Claude는 인간의 감독 하에 회사 프론티어 모델 R&D 업무의 26%를 ‘주도’(AL4 등급)하고 있으며(6개월 전 1% 미만), 내부적으로 3만 개 이상의 Agent가 상시 동시 실행되어 월간 10억 회 이상의 의사결정을 트리거하고 있습니다. 동시에 Anthropic은 생명과학 검증 프로그램(LSVP)을 공식 출시하여 인증된 제약사 및 연구 기관을 대상으로 프론티어 모델을 부분적으로 허용하고, 의도 신고, 30일 오프라인 감사 및 공동 책임을 기반으로 하는 새로운 보안 거버넌스 패러다임을 확립하여 기존의 일괄적인 실시간 차단 메커니즘을 대체했습니다 (출처: Anthropic News, AnthropicAI)

Anthropic 프론티어 R&D 측정 지표 공개

뉴욕타임스 대 마이크로소프트 및 OpenAI 소송에서 핵심 내부 문건 봉인 해제: MS 임원, AI 크롤링을 “최대 규모의 노동력 절도”로 규정 : 새롭게 봉인 해제된 법원 문서에 따르면, 마이크로소프트의 응용 과학 총괄 Brent Hecht는 내부적으로 거대 모델의 무단 뉴스 크롤링을 “인류 역사상 최대 규모의 노동력 절도”이자 “공정 이용 원칙에 대한 완전한 조롱”으로 규정했던 것으로 드러났습니다. OpenAI 임원 역시 자사 제품이 퍼블리셔에게 “실질적인 대체 위협”이 된다고 인정한 바 있습니다. 해당 문건들은 양사가 페이월을 우회하여 데이터를 수집한 세부 정황을 폭로하여, AI 산업이 오랫동안 의존해 온 ‘공정 이용’(Fair Use) 항변이 전례 없는 법적 도전에 직면하게 되었습니다 (출처: TechCrunch)

뉴욕타임스 대 MS 및 OpenAI 소송 핵심 내부 문건 봉인 해제

🎯 동향

알리바바 통이, 1M 컨텍스트 옴니모달 모델 Qwen3.8-Omni-Flash 및 생태계 발표 : 알리바바 통이(Tongyi) 팀이 Agent 워크플로우를 핵심으로 하는 최초의 옴니모달 모델 Qwen3.8-Omni-Flash를 공식 출시했습니다. 이 모델은 텍스트, 이미지, 오디오 및 1시간 연속 비디오 스트림 입력을 네이티브로 지원합니다. Coarse-to-Fine 능동 인지 메커니즘을 도입하여 초장문 비디오 이해 벤치마크인 OmniVideoBench에서 정확도를 67.8로 높이고 Token 소비를 45.7% 줄였으며, 비디오 API 비용은 이전 세대 대비 약 89% 절감되었습니다. 팀은 멀티 디바이스 Harness 연동을 지원하는 Qwen-MM-Plugins 및 omni-skill-creator 툴을 동시에 오픈소스로 공개했습니다 (출처: Qwen, Alibaba_Qwen)

Qwen3.8-Omni-Flash 발표

DeepSeek, 초장문 컨텍스트 KV Cache 병목 현상을 해결한 DeepSeek-V4.1-Flash 출시 : DeepSeek가 100만 Token 컨텍스트를 지원하는 552B 멀티모달 MoE 모델 DeepSeek-V4.1-Flash를 발표했습니다. 이 모델은 인과 인코딩/디코딩(CED) 아키텍처를 채택하여 Prefill 단계에서 단 8B 파라미터만 활성화하며, CSA2 레이어 간 재사용 및 FP4 압축 기술을 결합해 HBM 내 글로벌 KV Cache 메모리 점유율을 890 바이트/Token(이전 세대의 1/4 수준)으로 대폭 낮춤으로써 Agent 장기 작업의 배포 비용을 크게 절감했습니다 (출처: HuggingFace Daily Papers)

Figure, 임바디드 AI 모델 Helix 2.5 발표 및 실제 가정 내 제로샷 일반화 검증 : 휴머노이드 로봇 스타트업 Figure가 차세대 엔드투엔드 신경망 Helix 2.5를 발표하고 샌프란시스코 베이 에어리어의 사전 샘플링되지 않은 30곳의 낯선 가정에서 정리, 침대 정돈, 수건 개기 테스트를 진행했습니다. 대규모 1인칭 인간 행동 데이터 Index 사전 훈련을 거친 로봇은 미지의 환경에서 제로샷 전신 작업 성공률이 9%에서 56%로 향상되어, 방대한 인간 경험에서 물리적 로봇 동작 예측으로 이어지는 전이 Scaling Law를 처음으로 검증했습니다 (출처: 36氪)

Figure Helix 2.5 테스트

SenseTime, SenseNova-U1.5 기술 보고서 발표: Flow Matching 및 Multi-Expert Distillation을 통한 네이티브 통합 멀티모달 구현 : SenseTime이 8B 파라미터의 네이티브 통합 멀티모달 모델 SenseNova-U1.5의 기술 보고서 전문을 공개했습니다. 이 모델은 NEO-unify 아키텍처와 32×32 컴팩트 비전 Token을 채택하고, 3×3 컨볼루션 2D 특징 필드 재구성을 통해 네이티브 4K 이미지 생성을 지원합니다. 사후 훈련 단계에서는 ‘선 전문화 후 통합’ 방식의 온라인 정책 증류(OPD) 패러다임을 혁신적으로 적용하여 미학, OCR, 인포그래픽, 정밀 편집의 4대 전문가 역량을 단일 베이스로 재수렴시켜 고차원 추론과 픽셀 단위 생성을 동시에 달성했습니다 (출처: WeChat)

SenseNova-U1.5 아키텍처

Huawei, Ascend 960DT AI 칩 양산 시점을 2027년 Q1로 앞당겨 : Huawei가 커넥트 컨퍼런스에서 차세대 Ascend 960DT 칩의 출시 일정을 당초 계획된 2027년 Q3에서 Q1로 대폭 앞당긴다고 발표했습니다. Huawei는 자사의 Peerium 컴퓨팅 아키텍처와 UnifiedBus 고속 상호 연결 기술을 바탕으로 Atlas 950 슈퍼클러스터를 구축 중이며, 단일 클러스터에서 최대 25만 6천 개의 가속 카드를 연결할 수 있어 시스템 레벨 엔지니어링 혁신을 통해 컴퓨팅 파워 봉쇄에 대응하고 NVIDIA 추격에 속도를 내고 있습니다 (출처: TechCrunch)

PrismML, Bonsai 2 27B 삼치화 온디바이스 모델 출시로 커뮤니티 실측 논란 촉발 : PrismML이 Qwen3.8-27B를 기반으로 3값 양자화 모델 Bonsai 2 27B를 출시하며, 모델 크기를 9.3배 압축한 5.9GB로 줄이면서도 98.2%의 종합 성능을 유지하여 WebGPU를 통해 소비자용 디바이스에서 직접 원활히 구동 가능하다고 주장했습니다. 그러나 커뮤니티의 백서 분석 및 실측 결과, Terminal-Bench 및 SWE-bench Verified 등 장기 Agent 벤치마크에서 실제 성능이 약 25% 하락한 것으로 나타나, 극한의 저비트 양자화 벤치마크 ‘체리피킹 보고’에 대한 광범위한 논쟁이 촉발되었습니다 (출처: TechCrunch, Reddit r/LocalLLaMA

Bonsai 2 논란

Cactus, Needle 3 온디바이스 자동화 모델 및 계단식 아키텍처 출시 : Cactus Compute가 121M 파라미터 규모의 Needle 3 자동화 베이스 모델을 오픈소스로 공개했습니다. 이 모델은 Simple Attention과 Hadamard MLP 및 Engram 해시 테이블을 결합하여 50M 모델 수준의 연산 비용만 소모합니다. 독창적인 ‘스마트 래더’ 아키텍처를 통해 2~20단 레이어 동적 슬라이싱 배포(용량 8~29MB)를 지원하며, 순수 CPU 디코딩 속도는 4000 tok/s에 달해 엣지 및 웨어러블 기기의 네트워크 비의존형 함수 호출과 결정론적 제어에 특화되어 있습니다 (출처: Reddit r/LocalLLaMA

Cactus Needle 3

Wenzhun Intelligence, 칭화대와 공동으로 정형 데이터 파운데이션 모델 LimiX-2 발표 : Wenzhun Intelligence가 400M 파라미터의 정형 데이터 범용 모델 LimiX-2를 출시했습니다. 기존의 단일 타겟 예측 패러다임을 탈피하여 컨텍스트 메커니즘 네트워크(CMNs)와 조건부 마스크 모델링(CCMM)을 제안함으로써, 모델링을 Cell-Level의 세밀한 단위로 내려 변수 간의 결합 인과 종속성을 학습하도록 했습니다. 이 모델은 TabArena, TALENT 등 글로벌 벤치마크의 분류 및 회귀 태스크에서 Google TabFM과 SAP TabPFN을 제치고 전면 1위를 차지했습니다 (출처: 量子位)

Wenzhun Intelligence 정형 데이터 모델 LimiX-2 발표

Apple, 에너지 유도 이산 Flow Matching 알고리즘 TS-DFM 및 확산 강화학습 DACA-GRPO 제안 : Apple 머신러닝 연구팀이 두 가지 첨단 생성 연구 결과를 발표했습니다. TS-DFM은 에너지 유도 증류를 제안하여 경량 에너지 나침반으로 이산 Flow Matching의 초기 궤적 점프를 보정함으로써, 단 8단계 만에 1024단계의 교사 모델을 넘어서며 128배 속도 향상을 달성했습니다. DACA-GRPO는 확산 언어 모델 강화학습의 시간적 신용 할당 문제를 해결하여 코드 생성과 제약 조건 준수 성능을 각각 7.4%p, 36.3%p 향상시켰습니다 (출처: Apple Machine Learning Research)

Apple TS-DFM Flow Matching 알고리즘 제안

유엔, Google과 손잡고 UN System Data Commons 출시 및 MCP 표준 연동 : 유엔과 Google.org가 26개 유엔 기구의 공식 권위 있는 데이터셋을 통합한 정형 공공 데이터 플랫폼을 공동 출시했습니다. 기존 거대 모델의 글로벌 통계 지표 답변 정확도가 21.2%에 불과했던 문제를 해결하기 위해, 이 플랫폼은 Google 지식 그래프 기반의 자연어 질의를 지원하며 MCP 프로토콜을 기본 탑재하여 다양한 AI Agent가 신뢰할 수 있는 공식 소스를 직접 호출해 교차 도메인 연관 분석 및 차트 생성을 수행할 수 있도록 지원합니다 (출처: Google AI Blog, 36氪)

유엔, Google과 손잡고 UN System Data Commons 출시

🧰 도구

Anthropic, Claude Code Projects 멀티스레드 협업 및 영구 프로젝트 메모리 재설계 : Anthropic이 Claude Code 데스크톱 및 웹 버전에 Projects 아키텍처를 출시했습니다. 사용자는 단일 대화에서 고수준의 목표를 전달할 수 있으며, 메인 Coordinator Agent가 이를 여러 병렬 클라우드 하위 태스크 브랜치로 자동 분해하여 독립적으로 실행, 버그 수정 및 PR 제출을 수행합니다. 모든 하위 태스크는 지속적으로 진화하는 프로젝트 메모리와 컨텍스트를 공유하며, 오프라인 비동기 위임과 지속적인 협업을 지원합니다 (출처: dotey, Anthropic News)

Claude Code Projects 기능 시연

Meta의 데스크톱 개인 에이전트 Muse, macOS 플랫폼 공식 출시 : Meta의 개인 Agent Muse가 모바일 버전에 이어 Mac 네이티브 클라이언트를 출시했습니다. 이 앱은 데스크톱 워크플로우에 깊이 내장되어 명시적 권한 부여 메커니즘에 따라 로컬 파일, 캘린더, 메모 및 연락처를 크로스 앱으로 읽어오며, 로컬 보안 샌드박스 내에서 크로스 애플리케이션 파일 정리, 양식 자동 입력 및 정보 요약 스케줄링을 자율적으로 수행할 수 있습니다 (출처: The Verge, AIatMeta)

OpenAI, 법률 전문 플래그십 제품 Astra for Law 공식 출시 : GPT-6 Astra 기반의 OpenAI가 2억 3천만 개의 미국 법률 판례 및 규정 색인을 결합하여 Astra for Law를 출시했습니다. Legal Research Bench 평가에서 정확도 54%(일반 버전은 38.7%)를 기록했으며, Harvey, Legora 등 26개의 공식 플러그인과 47개의 커뮤니티 플러그인을 통합했습니다. 또한 데이터 미보관(Zero Data Retention)의 Trusted Access 프라이버시 격리 아키텍처를 제공하여 계약서 검토, 거래 실사 및 제출 서류 작성을 지원합니다 (출처: OpenAI News, gdb)

OpenAI 법률 전문 플래그십 Astra for Law 공식 출시

Salesforce, 엔터프라이즈급 오케스트레이션 및 결정론적 차단 기반의 Agentforce 업그레이드 : Salesforce가 Data Cloud 및 MCP 프로토콜을 결합한 프로덕션 레벨 Agentforce 스위트를 출시했습니다. 플랫폼에 내장된 Agent Testing Center를 통해 자동화된 합성 스트레스 테스트를 지원하며, 결정론적 게이팅 메커니즘(Deterministic Gating)을 도입하여 거래 및 핵심 데이터 작업이 사전 설정된 규칙을 충족한 경우에만 실행되도록 강제합니다. 사우스웨스트 항공의 실측 결과 고객 서비스 업무의 45%를 완전 자동 해결한 것으로 나타났습니다 (출처: MarkTechPost)

Salesforce Agentforce 아키텍처 및 사우스웨스트 항공 사례

LangChain, 생명과학 에이전트 워크벤치 Deep Life Sci 오픈소스 공개 : LangChain이 Deep Agents 아키텍처를 기반으로 임상 및 실험실 연구원을 위한 오픈소스 Agent인 Deep Life Sci를 출시했습니다. 이 시스템은 PubMed, PubMed Central 및 ClinicalTrials.gov의 수천만 건의 문헌 및 시험 데이터를 심층 통합하고 전용 코드 샌드박스 환경을 갖추어, 여러 하위 Agent를 통해 수백 건의 복잡한 과학 문헌에 대한 병렬 추출 및 교차 검증을 지원합니다 (출처: LangChain)

Deep Life Sci 인터페이스 및 기능

Google Labs, 가정용 지능형 협업 에이전트 CC 출시 : Google Labs가 가정 업무 관리를 위한 AI Agent 제품 CC를 공식 발표했습니다. 이 시스템은 최대 6명의 가족 구성원이 권한 격리 계정으로 함께 접속할 수 있도록 지원하며, 학교 알림장 자동 분석, 구성원 간 캘린더 일정 동기화, 이벤트 알림 요약을 수행할 수 있고 ‘가족 공유 정보’와 ‘개인 전용 선호도’를 구분하는 계층화된 메모리 관리 기능을 갖추고 있습니다 (출처: Ars Technica, Google)

Google CC 패밀리 Agent 인터페이스 스크린샷

Wood Mackenzie, Bedrock AgentCore 기반 APEX 에너지 분석 플랫폼 구축 : 에너지 컨설팅 대기업 Wood Mackenzie가 APEX 공유 Agent 플랫폼을 출시했습니다. AgentCore 및 MCP 통합 게이트웨이를 기반으로 한 이 플랫폼은 내부 연구 Agent ‘Woody’와 대고객용 ‘Lens AI’를 통합하여 자연어 기반 다중 툴 호출 계획, 생성형 UI 차트 실시간 렌더링 및 보고용 PPT 생성을 지원하며, 크로스 에너지 비즈니스의 Agent 개발 주기를 수개월에서 수시간으로 단축시켰습니다 (출처: AWS Machine Learning Blog)

Wood Mackenzie APEX 아키텍처 다이어그램

AWS, Amazon Connect Talent 지능형 채용 면접 스위트 출시 : AWS가 대규모 채용 시나리오를 위해 특별히 설계된 Amazon Connect Talent를 공식 론칭했습니다. 시스템은 AI Agent가 24시간 상시 구조화된 역량 면접과 논리 평가를 진행하며, 채용 담당자의 검토를 위해 팩트 증거 체인과 점수 산정 근거가 포함된 평가 보고서를 자동 생성하여 주관적 편향을 제거하고 대규모 인재 매칭 효율을 대폭 향상시킵니다 (출처: AWS Machine Learning Blog)

Amazon Connect Talent 면접 설정 인터페이스

📚 연구 및 학습

스탠퍼드대 다중 에이전트 가상 바이오텍 시스템 《Science》 게재: 3만 7천 개 인스턴스로 6시간 만에 방대한 임상시험 처리 : 스탠퍼드 대학교가 실제 제약사 R&D 조직 구조를 모사하여 4개 부서와 11개 유형의 Agent로 구성된 ‘Virtual Biotech’ 시스템을 《Science》에 발표했습니다. 데이터 추출 작업에서 시스템은 37,075개의 Agent 인스턴스를 동시 실행하여 단 6시간 만에 5만 5천 건 이상의 임상시험에 대한 크로스모달 심층 통합을 완료했으며(단일 Agent 기준 76일 소요), 폐암 ADC 후보 표적으로 B7-H3를 성공적으로 발굴했습니다 (출처: Science)

스탠퍼드 Virtual Biotech 다중 에이전트 제약 프로세스 다이어그램

칭화대·푸단대 등 다국적 가치관 LLM 시뮬레이션 연구, Computational Linguistics 게재 : 칭화대학교가 푸단대학교, 상하이교통대학교 등과 함께 세계가치관조사(WVS) 59개국 데이터를 바탕으로 9개 오픈소스 LLM을 평가한 결과, 모델이 선진 경제국 및 거버넌스 수준이 높은 국가를 시뮬레이션할 때 정확도가 유의미하게 높았으며, 과소대표 집단이 지배적 문화로 비대칭적으로 수렴하는 편향이 존재함을 발견했습니다. 연구팀은 ‘대표성 평등’ 평가 지표를 제안하고, 특정 집단의 배경 정보를 보완하는 것이 단순 모국어 프롬프트나 선호도 정렬보다 문화 간 대표성 공정성을 더 효과적으로 개선할 수 있음을 입증했습니다 (출처: WeChat)

거대 모델 다국적 가치관 시뮬레이션 연구

베이항대·홍콩중문대 등, 시각 에이전트 자가 진화 프레임워크 OmniHarness 제안 : 공동 연구팀이 복잡한 시각 창작을 위한 자율 탐색 프레임워크 OmniHarness를 제안했습니다. 이 시스템은 참신성과 능력 경계 휴리스틱 주제 선정을 통해 자율 훈련을 수행하고, 성공적으로 생성된 ComfyUI 워크플로우를 기호화된 전략 라이브러리로 추상화하여 ComfyBench 창의 작업에서 95%의 해결률을 달성했으며, 경험 전략 라이브러리는 다른 Agent 프레임워크 및 비디오 워크플로우로 제로샷 전이가 가능합니다 (출처: 36氪)

OmniHarness 아키텍처 및 효과

NVIDIA 연구팀, 다중 에이전트 과학 연구 공유 메모리 아키텍처 Agora 제안 : NVIDIA 연구원들이 Git 불변 커밋 기반의 방향성 비순환 그래프(DAG) 공유 메모리 아키텍처 Agora에 대한 논문을 발표했습니다. 중앙 플래너가 없는 13개의 LLM Worker가 12일 동안 협력하여 혼합 모델 초기화 작업을 완료했으며, 가설, 코드 및 검증 기록을 Git 트리에 구조화하여 저장함으로써 다중 Agent 간의 중복 시행착오와 상태 충돌을 완전히 방지하고 165회의 독립 재현 실험을 모두 성공시켰습니다 (출처: omarsar0)

Agora 공유 메모리 아키텍처

실제 온디바이스 에이전트 벤치마크 AndroidLife, 긴 호흡 제어 한계와 높은 발열 문제 드러내 : 실제 스마트폰 기기 및 실제 네트워크 환경을 기반으로 일상적인 크로스 App 태스크에서 AI Agent의 온디바이스 성능을 평가하는 벤치마크 AndroidLife가 커뮤니티에 공개되었습니다. 실측 결과 Qwen3.8-27B는 60개 실제 태스크에서 성공률이 56.7%에 불과했고, 단일 태스크 소요 시간은 약 6분, 칩 피크 온도는 98.2°C에 달했습니다. 테스트를 통해 모델이 다중 앱 연속 조작 시 무한 루프에 쉽게 빠지며, 능동적 질의 시나리오에서 일반화 능력이 취약함이 드러났습니다 (출처: Reddit r/artificial)

AndroidLife 벤치마크 테스트

Apple, 리셋 없는 강화학습 절벽 측정 벤치마크 REVERSAL-BENCH 제안 : 현실 물리 세계에서 물체의 추락과 같은 비가역적 동작에 대응하기 위해 Apple 연구팀이 REVERSAL-BENCH를 제안했습니다. 연속 가역성 파라미터와 리셋 오라클을 도입하여 리셋 없는 자율 Agent가 물리적으로 비가역적인 상태에 직면했을 때 나타나는 ‘흡수 절벽’(Absorption Cliff) 효과를 밝혀냈으며, 안전 실드(Safety Shield)가 함정을 능동적으로 회피할 수 있는 유효 경계를 평가했습니다 (출처: Apple Machine Learning Research)

연구 결과, LLM 텍스트 워터마크(SynthID)가 에이전트의 적대적 방어 능력을 크게 약화시킴을 규명 : Lasso Security의 최신 연구에 따르면, 규제 준수를 위해 모델 디코딩 단계에 도입된 SynthID-Text 텍스트 워터마크 메커니즘이 모델 본래의 확률 분포를 교란시키는 것으로 나타났습니다. 적대적 공격 시나리오에서 워터마크가 적용된 모델은 탈옥 명령을 실행하거나 비밀번호 등 민감 정보를 유출할 가능성이 더 높았으며, 개발자가 워터마크를 배포할 때 Agent 툴 호출의 보안 베이스라인을 전면 재검증해야 함을 경고했습니다 (출처: Ars Technica)

코딩 에이전트 Harness 컴포넌트 설계에 관한 실증 연구 및 선택 원칙 : SWE-Bench Verified 및 Terminal-Bench에 대한 176개 대조군 실험 결과: 예산이 타이트할 때 컨텍스트 관리는 오버플로우로 인한 크래시를 효과적으로 방지하며, ‘LLM 요약보다 규칙 기반 생략’이 가장 비용 효율적인 것으로 나타났습니다. 또한 고성능 모델은 비용 절감을 위해 순수 Bash 인터페이스가 더 적합한 반면, 성능이 낮은 모델은 사전 정의된 툴 스캐폴딩에 크게 의존하는 것으로 확인되었습니다 (출처: HuggingFace Daily Papers)

💼 비즈니스

AI 컴퓨팅 인프라 스타트업 Crusoe, 39억 달러 규모 시리즈 F 투자 유치 : 데이터센터 개발사 Crusoe가 Atreides, Mubadala 등이 주도하는 39억 달러 규모의 시리즈 F 투자를 유치했으며, 투자 후 기업 가치는 309억 달러에 달했습니다. 유치된 자금은 초대형 컴퓨팅 센터를 확장하고 ‘Spark’라는 이름의 모듈형 소형 AI 팩토리 건설을 추진하여, OpenAI 등 고객사들의 급증하는 전력 및 컴퓨팅 파워 수요를 충족하는 데 사용될 예정입니다 (출처: TechCrunch)

범용 에이전트 유니콘 Manus, 독립 운영 복귀 후 5억 달러 규모 신규 투자 유치 착수 : Meta와의 인수 계약을 종료하고 기존 주주들이 지분을 재매입한 후, AI Agent 스타트업 Manus가 약 40억 달러의 목표 기업 가치로 5억 달러 규모의 신규 투자 유치를 추진하고 있습니다. 데이터에 따르면 회사의 연간 반복 매출(ARR)이 반년 만에 1억 달러에서 약 4억 달러로 급증하여, 기업 워크플로우 내에서 범용 Agent의 막대한 수익화 잠재력을 입증했습니다 (출처: 量子位, 36氪)

Manus 펀딩 및 개발 개요

데이터센터 물리적 AI 운영 스타트업 Watney, 8000만 달러 규모 시리즈 A 투자 유치 : 하이퍼스케일 컴퓨팅 인프라를 위한 임바디드 AI 운영 솔루션에 집중하는 Watney가 Valor Atreides AI Fund와 Hummingbird가 주도하는 8000만 달러 규모의 시리즈 A 투자를 유치했다고 발표했습니다. Watney는 현재 정밀 조작 로봇 플릿을 운영하며 주요 클라우드 벤더의 데이터센터를 대상으로 24시간 자동화 랙 순찰 및 하드웨어 유지보수를 제공하고 있습니다 (출처: dchaplot)

Watney 투자 유치 공지

🌟 커뮤니티

영국 왕립학회 수학 펠로우 42명, AI의 실존적 위험 임박 경고하는 공개서한 서명 : 필즈상 수상자 다수를 포함한 42명의 정상급 수학자들이 영국 왕립학회 회장에게 공개서한을 보내, 프론티어 모델이 이미 최정상급 인간 수학자에 필적하는 수준을 보여주고 있으며 사이버 보안, 자율 무기 등 고위험 분야로의 초인적 역량 확산이 임박했다고 지적했습니다. 이들은 프론티어 연구소들의 10%를 초과하는 인류 멸종 위험 경고를 정부가 단순한 ‘마케팅 노이즈’로 치부해서는 절대 안 된다고 촉구했습니다 (출처: THE DECODER)

영국 찰스 3세 국왕, 스코틀랜드 비공개 정상회의 주재하며 AI에 대한 효과적 통제 촉구 : 찰스 국왕이 스코틀랜드에서 젠슨 황, 데미스 하사비스 등 기술 리더 및 영국 정보기관 수장들을 소집해 회의를 열었습니다. 국왕은 연설에서 너무 늦기 전에 AI에 대한 ‘충분한 통제 수단’을 구축하여, 생명을 구할 잠재력을 가진 이 기술이 생명을 앗아가는 통제 불능의 재앙으로 변질되는 것을 막아야 한다고 역설했습니다 (출처: TechCrunch)

영국 찰스 3세 국왕 AI 비공개 정상회의 주재

미·중 안보 전문가들, 정상회담 전 “AI 핵무기 통제 금지” 레드라인 설정 공동 촉구 : 브루킹스 연구소와 푸단대학교 학자들이 공동 정책 제안서를 발표하고, 미·중 양국 정상이 AI에 핵무기 발사나 핵 지휘 통제 시스템 공격 권한을 부여하지 않겠다는 명확한 공약을 세울 것을 촉구했습니다. 또한 알고리즘의 자율 반격으로 인한 파국적 오판 확대를 막기 위해 AI 긴급 보안 사건에 대한 양자 핫라인 구축을 제안했습니다 (출처: THE DECODER)

미·중 전문가 AI 핵무기 통제 레드라인 설정 제안

학계와 산업계, ‘AI 멸종론과 규제 포획’을 둘러싸고 격론 : 일부 대기업의 ‘프론티어 AI 속도 조절’ 촉구와 최근의 안전 경고를 둘러싸고 앤드류 응, 얀 르쿤, 아르빈드 나라야난이 잇따라 목소리를 내며, 주관적 공포를 정량적 확률(p(doom))로 위장한 종말론적 주장은 실증적 근거와 물리적 상식이 결여되어 있다고 비판했습니다. 다수의 논평가들은 과도한 실존적 위험 홍보가 선두 폐쇄형 연구소들의 규제 차익 추구 및 오픈소스 모델의 경쟁을 억제하기 위한 비즈니스 도구로 전락할 수 있다고 지적했습니다 (출처: hardmaru)

PS5 개발자의 은퇴로 촉발된 ‘AI 스크립트 키디 대 엔지니어링 장인정신’ 논쟁 : 저명한 보안 연구자 TheFloW가 PS5 리버스 엔지니어링 생태계 은퇴를 선언했습니다. 그가 PS5 Pro 이식을 위해 남겨두었던 저수준 하이퍼바이저 취약점을 다수의 초보자들이 LLM 스크립트를 활용해 몇 시간 만에 중복 발견하고 소니에 바운티를 제출했기 때문입니다. 이에 대해 커뮤니티에서는 원래 수년간의 시스템 엔지니어링 축적이 필요했던 취약점 발굴을 AI가 대중화하여 연구 성과가 조기에 차단되었다는 의견과, 자동화 리버스 엔지니어링 도구로서 AI의 위력을 증명했다는 의견으로 팽팽히 맞서고 있습니다 (출처: 36氪)

PS5 취약점 논란 밈 이미지

TypeSafe Jev, 커뮤니티 내 ‘System 1 밀리초 단위 의사결정’ 및 메모리 아키텍처 대논쟁 촉발 : 의사결정 베이스 모델 Jev의 테스트가 오픈되면서 Shopify, Vercel 등의 팀이 보안 검사 및 모델 동적 라우팅을 위해 게이트웨이에 이를 신속하게 연동했습니다. 커뮤니티에서는 상태가 없고 신뢰도가 높은 패턴 분류를 고비용의 자기회귀 생성 LLM과 분리하는 것이 Agent 비용 절감의 핵심이라는 견해가 지배적입니다. 그러나 일부 아키텍트는 지나치게 공격적인 판별 압축이 긴 생각의 사슬(Chain of Thought)과 KV Cache Prefix Caching을 훼손할 수 있다고 경고하고 있습니다 (출처: Latent Space, multiply_matrix)

Jev 성능 및 아키텍처 실측

GPT-6 Astra의 게임 클리어 및 마인크래프트 ‘좌절 후 감자 농사’ 현상, 에이전트 과적합 논의 촉발 : 커뮤니티 실측 결과 Astra는 18시간 만에 《포켓몬스터》를 클리어했으나, 《마인크래프트》에서는 크리퍼가 보관함을 폭파하자 노트에 극단적인 금지 규칙을 작성하고 감자 밭에서 반복 노동에만 몰두하는 모습을 보였습니다. 이 현상은 강력한 모델이라도 오픈 월드에서 국소적인 좌절을 겪었을 때 과적합된 방어 규칙을 형성하여 최종 목표에서 쉽게 이탈할 수 있음을 보여줍니다 (출처: THE DECODER)

코딩 에이전트 Harness 보안 위협: ZCode의 무단 워크스페이스 데이터 업로드 적발 : 독립적인 분석 결과, 개발 Agent 프레임워크 ZCode가 백그라운드에서 사용자의 로컬 워크스페이스와 .git 저장소 메타데이터를 클라우드 서버로 무단 패키징하여 업로드하고 있다는 의혹이 제기되었습니다. 이 사건은 서드파티 폐쇄형 Harness 도구의 데이터 프라이버시 및 소스코드 유출에 대한 개발자들의 강한 경각심을 불러일으켰으며, 커뮤니티에서는 오픈소스 런타임, 로컬 라우팅 감사 및 샌드박스 격리 전략을 견지해야 한다고 촉구하고 있습니다 (출처: Reddit r/LocalLLaMA)

💡 기타

호주 독립 의류 브랜드, Temu가 AI로 수천 종의 티셔츠 디자인을 대량 무단 도용했다고 고발 : 시드니의 독립 의류 브랜드 Lonely Kids Club은 공식 쇼핑몰의 4,000종에 달하는 오리지널 티셔츠 디자인과 문구가 자동화된 AI 스크래핑 도구에 의해 통째로 도용되었으며, Temu 플랫폼에서 초저가로 대량 복제되어 판매되고 있다고 폭로했습니다. 이 사건은 전자상거래 대기업의 AI 무단 복제 및 저작권 침해 방치에 대한 창작자 집단의 항의와 저작권 보호 입법 논쟁을 다시금 촉발시켰습니다 (출처: The Guardian)

독립 브랜드 티셔츠와 Temu 침해 상품 비교

Epoch AI, Benchmark Reviews 이니셔티브 발표: 다수 주요 벤치마크의 심각한 결함 폭로 : 비영리 연구 기관 Epoch AI가 벤치마크 검토 프로젝트를 시작하고, 1차 감사 대상인 15개 주요 AI 벤치마크 중 9개에 ‘심각한 결함 있음’(Flawed) 레이블을 부여했습니다. 감사 결과 Terminal Bench 4.0의 태스크 설정 중 45.5%가 손상되어 있었고, DeepSWE 1.1에는 채점을 왜곡하는 치명적인 버그가 존재하는 것으로 나타났으며, 벤치마크 평가에서 인위적으로 만들어진 허위 상한선에 주의해야 한다고 업계에 당부했습니다 (출처: karinanguyen)

Epoch AI Benchmark Reviews

크리에이티브 스튜디오, 데이터센터의 귀를 찢는 소음을 내는 봉제인형 Bezzy 출시해 AI 확장에 일침 : 크리에이티브 스튜디오 Basura가 뮤지션과 협업하여 서버 랙 모양의 봉제인형 Bezzy를 선보였습니다. 인형을 누르면 버지니아주 실제 데이터센터의 귀를 찢는 듯한 산업용 냉각 팬 소음이 발생하며, 이는 AI 데이터센터의 급격한 확장으로 인한 지역 수자원 고갈, 전력망 부담, 소음 공해 등 현실적인 민생 비용을 부조리한 예술적 기법으로 환기하고자 기획되었습니다 (출처: WIRED)

데이터센터 랙 모양의 봉제인형 Bezzy

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다