AI 일보 – 2025-05-31(조간)
DeepSeek, R1-0528 신규 모델 출시, 성능 대폭 향상으로 관심 집중: DeepSeek이 대규모 언어 모델의 새로운 버전 R1-0528을 출시하여 여러 벤치마크에서 우수한 성과를 거두었으며, 특히 코드 생성(LiveCodeBench), 과학적 추론(GPQA Diamond), 수학 경진대회(AIME 2024) 등 분야에서 현저한 진전을 이루었습니다
AI 일보 – 2025-05-30(석간)
DeepSeek, R1-0528 모델 출시, GPT-4o 및 Gemini 2.5 Pro 성능에 근접하며 오픈소스 1위 등극: DeepSeek-R1-0528은 수학, 프로그래밍, 일반 논리 추론 등 여러 벤치마크 테스트에서 뛰어난 성능을 보였으며, 특히 AIME 2025 테스트에서 정확도가 70%에서 87.5%로 향상되었습니다. 새 버전은 환각율을 현저히 낮
AI 일보 – 2025-05-29(석간)
DeepSeek R1, “작은 업데이트”로 실제로는 큰 도약, 프로그래밍 및 추론 능력 크게 향상: DeepSeek이 R1 추론 모델의 새 버전(0528)을 발표했습니다. 파라미터 수는 6850억 개에 달하는 것으로 알려졌으며, MIT 라이선스를 채택했습니다. 공식적으로는 “작은 업그레이드”라고 밝혔지만, 커뮤니티 실제 테스트 결과 프로그래밍, 수학 및 긴
AI 일보 – 2025-05-29(조간)
LLM+RL 훈련 유효성 의문: 가짜 보상도 모델 추론 능력 향상시켜: 최근 워싱턴 대학교, Allen AI 연구소, 버클리 연구진은 무작위 또는 잘못된 ‘가짜 보상’을 사용하여 Qwen2.5-Math-7B 모델을 훈련해도 MATH-500 등 수학 벤치마크에서 현저한 성능 향상(무작위 보상 21% 향상, 잘못된 보상 25% 향상)을 달성할 수 있으며, 이는
AI 일보 – 2025-05-28(석간)
RLHF/RLAIF의 미래: 무작위/잘못된 보상도 모델 성능을 향상시킬 수 있을까? : Stella Li의 실험에 따르면, 무작위 보상 또는 부정확한 보상으로 Qwen2.5-Math-7B 모델을 훈련했을 때 MATH-500 테스트 세트에서 각각 21%와 25%의 성능 향상을 보여, 실제 보상을 사용했을 때의 28.8% 향상 효과에 근접했습니다. natola
AI 일보 – 2025-05-28(조간)
Omni-R1: 새로운 듀얼 시스템 강화 학습 프레임워크, 전체 모달리티 추론 능력 향상 : Omni-R1은 장시간 비디오-오디오 추론과 픽셀 수준 이해 간의 충돌을 해결하기 위해 혁신적인 듀얼 시스템 아키텍처(글로벌 추론 시스템 + 세부 이해 시스템)를 제안했습니다. 이 프레임워크는 강화 학습(특히 그룹 상대 정책 최적화 GRPO)을 활용하여 글로벌 추론
AI 일보 – 2025-05-27(석간)
AMD와 NVIDIA의 AI 추론 분야 성능 경쟁 논란: SemiAnalysis는 SGLang이 AMD ROCm 플랫폼에서 테스트 문제가 있다고 지적했습니다. 예를 들어 실패한 테스트 삭제, 통과 기준 완화 등이 있으며 MI325X CI가 비활성화되었다는 의혹도 제기했습니다. Anush Elangovan(AMD)은 최신 SGLang에서 MI300X와 H20
AI 일보 – 2025-05-27(조간)
DeepSeek-V3-0526 모델 출시 예정, GPT-4.5 및 Claude 4 Opus와 경쟁: 커뮤니티 소식에 따르면, DeepSeek(深度寻求)이 V3 모델의 최신 업데이트 버전인 DeepSeek-V3-0526을 곧 출시할 것으로 보입니다. Unsloth 문서 페이지 정보에 따르면, 이 모델은 GPT-4.5 및 Claude 4 Opus와 동등한 성능
AI 일보 – 2025-05-26(석간)
Google 창립자 Sergey Brin, Gemini의 강력한 성능 비결과 AI 미래 해석: Google 창립자 Sergey Brin이 인터뷰에서 Gemini 모델의 빠른 부상과 그 이면의 기술적 논리를 심층적으로 논의했습니다. 그는 Language Model이 AI 발전의 주요 동력이 되었으며, 그 해석 가능성(예: 사고 모델이 추론 과정을 통찰할 수