🔥 포커스
Xinzhi Embodied, 복단대학과 공동으로 N0 시리즈 모델 및 NeoData 데이터셋 발표 : Xinzhi Embodied와 복단대학이 공동으로 N0 시리즈 구체화된 AI(Embodied AI) 모델 및 NeoData 데이터셋을 발표했다. NeoData는 3만 시간 이상의 시각-촉각 상호작용 데이터를 포함하고 있으며, NeoForce 통합 표상 모델은 서로 다른 촉각 센서의 데이터 융합 문제를 해결했다. N0-VTLA는 향후 50단계의 촉각 변화를 예측하여 작업 성공률을 높이고, N0-TWAM은 세계 모델(World Model)에 촉각 예측을 도입하여 구체화된 AI가 ‘시각 구동’에서 ‘시촉각 융합’으로 진화하도록 촉진한다. (출처: 양자위(QbitAI))

Induction Labs, Photon-1 모델 발표 : Induction Labs가 Photon-1 모델을 출시했다. 이 모델은 106B-A5B 크기의 희소 혼합 전문가(MoE) 모델로, 행동 라벨링이 없는 비디오를 통해 사전 학습을 진행하여 암묵적 정책을 학습한다는 점이 혁신적이다. Photon-1은 컴퓨터 사용 벤치마크 테스트에서 Gemini 3.1 Flash-Lite를 능가했으며, 사전 학습에 필요한 연산 자원 소모를 크게 줄이고 추론 비용을 약 3배 절감했다. 데스크톱 비디오만 학습했음에도 불구하고, 미세 조정(Fine-tuning)된 Photon-1은 체커(Checkers)와 당구 물리 시뮬레이션에서 여전히 우수한 성능을 보였다. (출처: MarkTechPost)
KwaiKAT 팀, KAT-Coder-V2.5 발표 : 콰이쇼우(Kuaishou) KwaiKAT 팀이 실제 실행 가능한 코드 저장소에서 학습된 에이전트 프로그래밍 모델인 KAT-Coder-V2.5를 출시했다. 연구진은 AutoBuilder를 통해 10만 개 이상의 검증 가능한 저장소 환경을 자동 구축했으며, 프로세스 기반 필터링 메커니즘과 비대칭 AFT-PPO 알고리즘을 활용해 강화 학습을 진행했다. KAT-Coder-V2.5는 PinchBench에서 94.9점의 높은 점수로 선두를 달렸으며, 샌드박스 인프라 및 알고리즘 설계 최적화를 통해 장기(Long-range) 프로그래밍 에이전트의 성능을 향상시키는 경로를 제시했다. (출처: MarkTechPost)
MonkeyOCRv2 문서 비전 기반 모델 오픈소스 공개 : 화중과학기술대학교 등 공동 연구팀이 MonkeyOCRv2를 오픈소스로 공개했다. 이 모델은 ‘재구성을 통한 문서 비전 기억’이라는 사전 학습 목표를 도입했다. 백엔드 언어 모델인 Qwen3-1.7B를 동결한 통제 실험에서 MonkeyOCRv2는 8개의 문서 이해 벤치마크에서 가장 강력한 대조군보다 13.2점 앞섰다. 이와 함께 연구팀은 1억 1,300만 장의 이미지가 포함된 MonkeyDoc v2 데이터셋을 오픈소스로 공개하여 커뮤니티에 통합된 문서 비전 사전 학습 실험장을 제공하고, 문서 AI가 의미론적 완성(Semantic Completion)에서 시각적 충실도(Visual Fidelity)로 진화하도록 촉진했다. (출처: 기계지심(Synced))
.jpg)
Valkor, 절강대 등과 공동으로 에이전트 상태 관리 프레임워크 Loom 오픈소스 공개 : AI 프로그래밍 에이전트가 장기 작업 중 ‘디버깅 블랙홀’과 ‘부분 기억 상실’에 빠지기 쉬운 문제를 해결하기 위해, Valkor는 절강대학 및 UCL 팀과 공동으로 오픈소스 프레임워크 Loom을 출시했다. Loom은 복잡한 소프트웨어 인도(Delivery) 작업을 구조화되고 언제든지 복구 가능한 상태 체인으로 분해한다. 테스트가 실패하면 Loom은 이를 대화 기록과 독립된 할 일(To-do) 상태로 캡처하여 개발자가 모델이나 에이전트를 원활하게 전환해 작업을 계속할 수 있도록 지원하며, 실제 프로덕션 환경에서의 AI 프로그래밍을 위한 핵심 상태 인프라를 제공한다. (출처: 기계지심(Synced))
.jpg)
🎯 동향
Sakana AI, 사이버 보안 라우팅 모델 Fugu-Cyber 발표 : Sakana AI가 자사의 Fugu 오케스트레이터(Orchestrator) 기반 사이버 보안 전용 라우팅 모델인 Fugu-Cyber를 출시했다. 이 모델은 CyberGym에서 86.9%의 성공률을 기록하고 CTI-REALM에서 72.1%의 성적을 거두어 GPT-5.5-Cyber 등 최첨단 모델과 경쟁할 수 있는 수준이다. Fugu-Cyber는 TRINITY 및 Conductor 프레임워크를 통해 여러 보안 분야의 서브 에이전트를 동적으로 조율하여 취약점 검증 및 탐지 규칙 생성을 수행하며, 토큰당 지불하는 단계별 요금제 모델을 채택했다. (출처: MarkTechPost)
Open Dreamer, Dreamer 4 세계 모델 JAX 구현체 오픈소스 공개 : 독립 연구 팀 Reactor가 JAX 및 Flax NNX를 기반으로 Dreamer 4 세계 모델 파이프라인을 재현한 Open Dreamer를 오픈소스로 공개했다. 이 모델은 적대적 손실(Adversarial Loss)이 필요 없는 Masked Autoencoder 비디오 토크나이저와 행동 라벨링이 없는 1.6B 매개변수의 시공간 어텐션 역학 모델을 포함한다. 연구팀은 전체 학습 레시피를 공개하고, B200 GPU에서의 비디오 메모리 최적화, Muon 옵티마이저 드리프트 해결 등 안정성 엔지니어링 세부 정보를 공유하여 세계 모델 재현에 귀중한 참고 자료를 제공했다. (출처: MarkTechPost)
InclusionAI, OpenRouter에 Ling-3.0-flash 출시 : 에이전트 워크플로우 실행에 특화된 경량 MoE 모델 Ling-3.0-flash가 OpenRouter에 API 형태로 출시되었다. 이 모델은 총 매개변수 124B, 활성 매개변수 5.1B이며, 256K 컨텍스트를 지원하고 TTFT(첫 번째 토큰 생성 시간)는 100ms 미만이다. 대형 플래너와 함께 작동하는 저비용 고속 실행 노드로 포지셔닝된 이 모델은 장기 도구 호출 및 지시어 이행에 최적화되어 있으며, 전환 가능한 하이브리드 추론 모드를 제공한다. (출처: Reddit)

Abliterated 버전 GLM-5.2 모델 출시 : 커뮤니티에 ‘거부 제거(Abliterated)’ 및 미세 조정된 GLM-5.2 거대 모델이 출시되었다. 이 모델은 안전 거부 방향성을 제거하고, 장기 대적(Adversarial) 및 에이전트 작업에 대해 맞춤형 미세 조정을 거쳐 기술적이거나 민감한 작업을 처리할 때 모델이 이유 없이 중단되는 것을 방지했다. 평가 결과 CyberGym 및 AgentHarm과 같은 보안 및 코드 벤치마크에서 우수한 성능을 보였으며, 기본적으로 데이터를 보존하지 않고 규칙은 시스템 프롬프트를 통해 사용자가 완전히 정의한다. (출처: Reddit)

🧰 도구
Llama.cpp, 네이티브 MCP 지원 병합 : 개발자 ngxson이 주도한 PR이 llama.cpp에 성공적으로 병합되어 WebUI 및 명령줄 도구에서 모델 컨텍스트 프로토콜(MCP)을 네이티브로 지원하게 되었다. 이제 사용자들은 외부 중계 없이 로컬 클라이언트에서 다양한 MCP 서버(예: Serena 코드 어시스턴트)를 직접 구성하고 호출할 수 있어, 완전히 로컬화되고 의존성 없는 에이전트 개발 및 디버깅이 가능해졌다. 이는 로컬 오픈소스 모델을 활용한 에이전트 생태계 구축의 진입 장벽을 크게 낮추었다. (출처: Reddit)
온디바이스 에이전트 프레임워크 Open Minis 오픈소스 공개 : 개발자 Ethan Wang이 모바일 기기에서 로컬로 실행할 수 있는 AI 에이전트 애플리케이션인 Open Minis를 오픈소스로 공개한다고 발표했다. 이 프레임워크는 iOS 및 Android 시스템을 지원하며 로컬 Linux Shell, 브라우저 자동화, 확장 가능한 스킬(Skills) 및 지속성 메모리를 통합했다. 시스템 프롬프트에 스킬의 메타 정보를 로드하고 Prompt Caching을 결합함으로써, 모델은 단일 대화 턴 내에서 도구 선택과 실행을 일관되게 완료할 수 있어 온디바이스 에이전트 개발을 위한 경량화된 참고 사례를 제공한다. (출처: X)
Aethos_Memory, 에이전트의 세션 간 망각 문제 해결 : AI 코딩 어시스턴트가 서로 다른 세션 간에 컨텍스트를 공유하지 못하는 문제를 해결하기 위해, 개발자가 Aethos_Memory 도구를 오픈소스로 공개했다. 이 도구는 에이전트에게 지속성 메모리 레이어를 제공하여 세션 내 핵심 결정, 코드베이스 아키텍처, 버그 수정 기록을 자동으로 추출하고 저장한다. 새로운 세션을 시작할 때 에이전트는 구조화된 메모리를 직접 읽어올 수 있어, 개발자가 수동으로 이전 기록을 복사하여 붙여넣는 번거로운 작업을 피할 수 있다. (출처: Reddit)

Runway, 미디어 라우팅 도구 Media Router 출시 : 비디오 생성 플랫폼 Runway가 생성형 미디어를 위한 최초의 선호도 최적화 라우팅 도구인 Media Router를 출시했다. 기업 팀은 다양한 비디오, 이미지, 오디오 모델이 포함된 프로덕션 파이프라인을 운영할 때 각 요청마다 모델을 수동으로 선택할 필요 없이, Router에 비용, 품질 또는 지연 시간에 대한 선호도를 한 번만 정의하면 라우팅 시스템이 자동으로 토큰 요청을 분배하여 비용과 효과의 최적의 균형을 실현한다. (출처: X)
📚 학습
GPU 커널 설계 및 최적화를 위한 TileLang 도구 발표 : 본 글에서는 TVM 기반의 GPU 커널 설계 DSL 도구인 TileLang을 소개한다. 튜토리얼은 벡터 덧셈, Tensor Core 행렬 곱셈, 융합 Softmax, FlashAttention 등의 커널을 설계하는 방법을 보여주는 완전한 Python 코드를 제공한다. TileLang의 공유 메모리 타일(Tile) 및 레지스터 블로킹을 통해 컴파일러는 스레드 매핑 및 동기화를 자동으로 처리하며, @tilelang.autotune을 통해 고정된 GPU 예산 내에서 최적의 하드웨어 구성을 찾는 것을 지원한다. (출처: MarkTechPost)
FAIRChem v2 및 UMA 원자 시뮬레이션 활용 튜토리얼 발표 : Meta의 FAIRChem v2 프레임워크 및 UMA 범용 머신러닝 원자간 퍼텐셜(MLIP) 사용법을 상세히 소개하는 튜토리얼이 발표되었다. 내용은 Hugging Face를 통해 게이트형(gated) 모델 가중치를 획득하고, ASE(Atomic Simulation Environment)에서 계산기를 구성하여 단일 지점 에너지 예측, 분자 기하학 최적화, 스핀 상태 비교, 반응 에너지 추정, 격자 완화, 상태 방정식 피팅 및 분자 동역학 시뮬레이션 등 일련의 계산 화학 워크플로우를 완료하는 방법을 다룬다. (출처: MarkTechPost)
Relative Representation, 이기종 LLM 벡터 공간 정렬 문제 해결 : 커뮤니티에 상대적 표현법(Relative Representation Method)과 Lowdin 대칭 직교화를 활용하여 서로 다른 LLM 임베딩 공간(예: Llama, Mistral, Phi 혼용)을 정렬하는 기하학적 기술이 공유되었다. 이 방법은 미세 조정 없이 특정 의미론적 영역 내에 참조 앵커(Anchor)를 도입하고 열 방향 Z-score 표준화를 수행함으로써, 서로 다른 차원의 벡터를 통일된 공통 공간에 매핑하여 다중 에이전트 라우팅에서의 비등방성 원뿔(Anisotropic Cone) 및 차원 불일치 문제를 해결한다. (출처: Reddit)

U-Net 손그림 유도 및 계산 과정 다이어그램 : 컴퓨터 비전 학자인 Prof. Tom Yeh가 U-Net 네트워크의 손그림 계산 다이어그램을 발표했다. 튜토리얼은 17단계를 통해 R, G, B 3개 채널을 포함한 이미지를 합성곱(Convolution)과 최대 풀링(Max Pooling)을 거쳐 2×4 크기의 Bottleneck으로 압축한 후, 전치 합성곱(Transposed Convolution)과 건너뛰기 연결(Skip Connection)을 통해 점진적으로 원래 크기로 복원하는 과정을 직관적인 행렬 곱셈 흐름으로 보여주며, 이 확산 모델 핵심 뼈대의 수학적 원리를 설명한다. (출처: X)
💼 비즈니스
Stripe, OpenRouter를 100억 달러에 인수 추진 : 결제 거두 Stripe가 AI 모델 애그리게이터 플랫폼 OpenRouter와 대형 인수 협상을 진행 중이며, 기업 가치는 두 달 전 13억 달러에서 약 8배 급등한 100억 달러에 달한다. 기업들이 리스크 분산을 위해 다중 모델을 사용하는 경향이 강해지면서 OpenRouter의 트래픽과 전략적 가치가 부각되고 있다. Stripe는 한 줄의 결제 코드로 AI 시대에 조용히 막대한 수익을 올리고 있으며, 이전에 Metronome을 인수한 데 이어 이번 인수를 통해 결제 분야에서 AI 생태계의 하부 인프라로 비즈니스를 확장할 계획이다. (출처: 기계지심(Synced))
.jpg)
Moushen Intelligent, 1억 위안 규모의 Pre-A 라운드 추가 투자 유치 완료 : 온디바이스 구체화된 뇌(Embodied Brain) 개발 기업 Moushen Intelligent가 1억 위안(한화 약 190억 원) 규모의 Pre-A 라운드 추가 투자를 유치했다고 발표했다. Pre-A+ 라운드의 약 5억 위안 규모 투자도 마무리 단계에 있으며, 기업 가치는 반년 만에 10배 이상 성장했다. 이 회사는 복단대학의 천타오(Chen Tao) 교수와 전 Intel 과학자 장이민(Zhang Yimin)이 공동 창업했으며, 자사의 STI-WM 시공간 통합 세계 동작 모델은 동작을 토큰화하여 실제 기기 데이터 요구량을 90% 줄였고, HiSilicon, Horizon Robotics 등 중국 국산 칩에서 초저비용 온디바이스 최적화를 구현했다. (출처: 36kr)

수술용 로봇 기업 Vicarious Surgical, 파산 청산 : 빌 게이츠, 제리 양 등으로부터 투자를 받았던 수술용 로봇 유니콘 기업 Vicarious Surgical이 연구 개발 진행 지연과 자금난으로 인해 주주 투표를 통해 운영 중단 및 파산 청산을 결정했다. 이 회사는 누적 20억 위안 이상의 투자를 유치했으나, 급진적인 디커플링 구동 솔루션과 VR 제어 개념이 FDA 승인 및 대량 생산 과정에서 난관에 부딪혔다. 이는 현재 높은 밸류에이션을 받고 있지만 상용화에 어려움을 겪고 있는 구체화된 AI(Embodied AI) 분야에 경종을 울렸다. (출처: 36kr)

🌟 커뮤니티
AI 코딩 어시스턴트, 컴퓨터 과학 교육계의 평가 방식 재구성 유발 : 컴퓨터학회(ACM)가 전 세계 49개국 700여 명의 컴퓨터 과학 교육자를 대상으로 실시한 설문조사에 따르면, 교사의 69%는 AI가 소프트웨어 개발에 필요한 기술을 변화시켰다고 생각하며, 64%는 교육의 중점을 ‘처음부터 코드 작성하기’에서 코드 이해 및 디버깅으로 전환했다. AI로 인한 부정행위와 과도한 의존에 대응하기 위해 교사의 68%는 평가 방식을 조정하여 대면 폐쇄형 시험(Closed-book exam), 구두 발표 및 코드 방어(Code defense) 세션을 추가함으로써 AI 시대의 프로그래밍 기술 평가를 재정의하고 있다. (출처: THE DECODER)

Claude 공유 대화 링크, Google에 인덱싱되어 개인정보 유출 우려 제기 : 사용자가 Claude의 ‘공개 링크 생성’을 통해 공유한 대화와 Artifacts가 Google 등 검색 엔진에 공개적으로 인덱싱되고 있으며, 심지어 이러한 링크를 전문적으로 크롤링하는 제3자 웹사이트까지 등장한 것으로 커뮤니티에서 확인되었다. 유출된 내용에는 암호화폐 개인 키, 회사 기밀, 개인 의료 정보 등이 포함되어 있다. 사용자들은 Anthropic이 공유 페이지에 noindex 메타 태그를 추가하지 않은 점을 지적하며, 이는 보안 설계상의 초보적인 실수라고 비판하고 설정에서 공유된 대화를 즉시 삭제할 것을 권장하고 있다. (출처: Reddit)

실리콘밸리에서 부는 ‘Avoiding AI’ 역방향 디지털 리터러시 워크숍 열풍 : 빅테크 기업들이 다양한 기기에 AI를 강제로 탑재함에 따라, 미국 여러 지역의 도서관에서 시작된 ‘Avoiding AI(AI 피하기)’ 오프라인 워크숍이 소셜 미디어에서 큰 인기를 끌고 있다. 사서들은 시민들에게 Apple Intelligence, Gemini 등 시스템 내장 AI를 완전히 비활성화하는 방법을 직접 안내하고, Google 검색의 AI 개요(AI Overviews)를 차단하는 브라우저 플러그인을 공유하고 있다. 시민들은 이를 통해 대기업의 독점, 개인정보 침해, 데이터 센터의 에너지 소비에 대한 우려를 표명하며 기술적 자율권을 요구하고 있다. (출처: TechCrunch)

Lutnick 상무장관, 중국에 맞서기 위해 오픈소스 AI 지지 표명 : 백악관 출입기자단 만찬에서 하워드 러트닉(Howard Lutnick) 미국 상무장관이 “이번 백악관은 오픈소스 AI를 보호할 것”이라고 직접 밝힌 발언이 커뮤니티에서 뜨거운 관심을 받고 있다. 앞서 APEC이 오픈소스 AI 지지 성명에 서명한 바 있으며, 미국 정부 내부에서는 일률적인 차단 대신 특정 모델을 겨냥한 표적 금지 조치를 통해 미국 오픈소스 생태계가 연산 자원이 제한된 상황에서도 ‘포크(Fork)’ 및 ‘미세 조정’을 통해 폐쇄형 최첨단 모델을 신속히 추격하고 미국의 기술적 주도권을 확보할 수 있도록 돕는 방안을 논의 중이다. (출처: X)
Andrej Karpathy, 개인 프로필 수정으로 퇴사 의혹 제기 : 저명한 AI 학자인 Andrej Karpathy가 자신의 소셜 미디어 계정 프로필에서 ‘Anthropic’ 문구를 삭제하면서 커뮤니티에서 퇴사 여부에 대한 다양한 추측이 나오고 있다. 일부 제보에 따르면 수출 규제로 인해 비미국인 신분으로는 회사의 가장 진보된 모델에 접근할 수 없어 떠나기로 결정했다는 주장이 제기되었으나, 일부 네티즌들은 프로필 수정이 이미 며칠 전에 이루어졌다고 지적했다. 최근 Anthropic이 젠슨 황이 주도한 오픈소스 공개 서한에 서명하지 않으면서, 회사의 보수적인 비즈니스 및 규제 전략이 커뮤니티 내 일부 여론의 반발을 사고 있다. (출처: 기계지심(Synced))
.jpg)
DeepSeek, 투자자 회의록 유출로 2차 투자 유치 잠정 중단 : 소셜 미디어에 유포된 DeepSeek 창업자 량원펑(Liang Wenfeng)과 투자자 간의 대화 회의록으로 인해, DeepSeek 공식 측은 잠재적 투자자들에게 2차 투자 유치 절차를 잠정 보류한다고 긴급 통보했다. 유출된 녹취록에는 미·중 간 연산 자원 격차, 토큰 가격 책정 전략 및 오픈소스 비즈니스 모델에 대한 DeepSeek의 민감한 입장이 포함되어 있다. 커뮤니티에서는 엔지니어링 최적화를 통해 추론 비용을 서구 경쟁사의 3분의 1 수준으로 낮춘 DeepSeek의 ‘토큰 공장’ 모델에 대한 미세 조정 및 배포 논의가 활발히 진행되고 있다. (출처: Hacker News)
💡 기타
ChatGPT, 사용자의 MacBook 내 AtomicStealer 감염 발견 지원 : 한 Mac 사용자가 로컬 거대 모델의 실행 메모리를 최적화하려던 중, ChatGPT를 통해 시스템 프로세스를 분석하다가 시스템 서비스로 위장한 두 개의 LaunchDaemon 파일이 Library 내 숨겨진 스크립트를 가리키고 있는 것을 우연히 발견했다. ChatGPT는 즉시 이를 악성코드로 경고하여, 사용자가 오염된 PDF 오픈소스 라이브러리 설치로 인해 감염된 OSX.AtomicStealer 정보 탈취 목마를 찾아내도록 도왔다. 이는 일상적인 단말기 보안 방어에서 AI가 발휘하는 뜻밖의 역할을 보여주었다. (출처: Reddit)

Decoy Font, 시각적 차이를 이용해 멀티모달 AI 기만 : 디자인 스튜디오 Mixfont가 ‘Decoy Font(미끼 폰트)’를 발표했다. 이 폰트는 일반 글자 위에 가는 선으로 그려진 방해 문자를 겹쳐 놓아, ChatGPT나 Claude와 같이 시각 능력을 갖춘 멀티모달 AI가 OCR 인식을 할 때 잘못된 텍스트(예: “Sorry Robot”)만 읽을 수 있게 만든다. 반면 인간의 눈은 일정 거리 이상에서 실제 텍스트(예: “Happy Human”)를 정상적으로 읽을 수 있어, 새로운 유형의 물리적 수준 AI 크롤링 방지 및 대적 샘플(Adversarial Example) 기술로 주목받고 있다. (출처: Reddit)

뉴욕의 한 고등학교, 휴머노이드 로봇 도입 계획에 교사들 반발 : 뉴욕의 한 공립 고등학교가 교육 보조용으로 교사(校舍) 내에 휴머노이드 로봇을 도입할 계획을 세우자, 교사 노조가 이에 강력히 반대하고 나섰다. 교사들은 교육 예산이 부족하고 교사 이탈이 심각한 상황에서 고가의 휴머노이드 로봇 구매 및 유지 비용은 자원의 잘못된 배분이라고 주장했다. 또한 로봇은 감정적 소통과 개인 맞춤형 지도에서 인간 교사의 핵심 역할을 대체할 수 없으므로, 기술의 학교 도입에는 명확한 경계가 유지되어야 한다고 강조했다. (출처: Reddit)
