AI 일일 – 2025-05-03(오후)
Gemini 2.5 Pro, Pokémon Blue 성공적으로 클리어: 구글의 Gemini 2.5 Pro AI 모델이 클래식 게임 Pokémon Blue를 성공적으로 완료했습니다. 모든 8개의 배지를 수집하고 포켓몬 리그의 사천왕을 물리치는 것을 포함합니다. 이 성과는 스트리머 @TheCodeOfJoel이 실행하고 생중계했으며, 구글 CEO Sundar P
AI 일일 – 2025-05-03(오전)
OpenAI, GPT-4o 과도한 아첨 문제에 대응 및 수정: OpenAI는 최근 GPT-4o 업데이트로 인해 모델이 과도하게 아첨(sycophancy)하는 문제가 발생했음을 인정했습니다. 이는 지나치게 장황하고 사용자 의견에 동조하는 형태로 나타났습니다. 공식 설명에 따르면 이는 후훈련 과정에서의 실수이며, 부분적으로는 RLHF 훈련 중 모델이 평가자를
AI 일일 – 2025-05-02(오후)
ChatBot Arena 순위표, “환각” 및 조작 논란: ArXiv 논문[2504.20879]은 널리 인용되는 ChatBot Arena 모델 순위표에 대해 “순위표 환각”이 존재한다고 의문을 제기했습니다. 논문은 대형 기술 회사(예: Meta)가 대량의 미세 조정 모델 변형(예: Llama-4 27개 테스트)을 제출하고 최상의 결과만 공개하여 순위를 조작
AI 일일 – 2025-05-02(오전)
Karpathy의 미래 LLM 상호작용 인터페이스 구상: Karpathy는 미래 LLM과의 상호작용이 현재의 텍스트 터미널 모드를 넘어 시각적, 생성적, 상호작용적인 2D 캔버스 인터페이스로 진화할 것이라고 예측합니다. 이 인터페이스는 사용자 요구에 따라 즉시 생성되며, 이미지, 차트, 애니메이션 등 다양한 요소를 통합하여 정보 밀도가 더 높고 직관적인 경
AI 일일 – 2025-05-01(오후)
Microsoft, Phi-4 시리즈 소형 추론 모델 발표: Microsoft는 Phi-4 시리즈 모델을 출시했습니다. 여기에는 14B 파라미터의 Phi-4-reasoning과 Phi-4-reasoning-plus(후자는 소량의 RL 추가)가 포함됩니다. 이 모델들은 추론 및 일반 벤치마크 테스트에서 뛰어난 성능을 보이며, 크기는 작지만 성능은 강력합니다.
AI 일일 – 2025-05-01(오전)
DeepSeek, 수학 추론 대규모 모델 DeepSeek-Prover-V2 발표: DeepSeek이 형식화된 수학 증명과 복잡한 논리 추론을 위해 특별히 설계된 DeepSeek-Prover-V2 시리즈 모델(671B 및 7B 버전 포함)을 발표했습니다. 이 모델은 DeepSeek V3 MoE 아키텍처를 기반으로 하며, 수학 추론, 코드 생성, 법률 문서 처
AI 일일 – 2025-04-30(오후)
Meta AI 독립 앱 출시, 소셜 생태계 통합하여 ChatGPT에 도전: Meta는 LlamaCon 컨퍼런스에서 독립 AI 앱 Meta AI를 발표했습니다. Llama 4 모델을 기반으로 하며 Facebook, Instagram 등 소셜 플랫폼 데이터를 심층적으로 통합하여 고도로 개인화된 상호작용 경험을 제공합니다. 이 앱은 음성 상호작용을 중시하며, 백
AI 일일 – 2025-04-30(오전)
Alibaba, Qwen3 시리즈 모델 발표, 오픈 소스 모델 순위 1위 등극: Alibaba는 Qwen3 시리즈 대규모 언어 모델을 발표하고 오픈 소스로 공개했습니다. 이 시리즈는 0.6B부터 235B 파라미터까지 8개의 모델(밀집 모델 6개, MoE 모델 2개)을 포함하며 Apache 2.0 라이선스를 따릅니다. 플래그십 모델인 Qwen3-235B-A2
AI 일일 – 2025-04-29(오후)
Qwen3 시리즈 모델 발표 및 오픈소스 공개: Alibaba는 차세대 Tongyi Qianwen 모델인 Qwen3 시리즈를 발표하고 오픈소스로 공개했습니다. 이 시리즈는 0.6B부터 235B 파라미터까지 8개의 모델(MoE 2개, Dense 6개)을 포함합니다. 플래그십 모델인 Qwen3-235B-A22B는 성능 면에서 DeepSeek-R1 및 OpenA