화웨이의 새로운 벤치마크, AI 에이전트의 실패를 관찰

DECRYPT ·

화웨이와 세 개의 파트너 기관의 연구자들이 개인 비서 작업에서 AI 에이전트를 평가하는 벤치마크인 Claw-Anything을 발표했다. OpenAI의 주력 모델인 GPT-5.5는 pass@1 지표에서 34.5%의 점수를 기록했으며, 이는 기존 벤치마크의 점수보다 훨씬 낮아 현재 테스트가 잘못된 것을 측정하고 있음을 시사한다. 연구팀은 2,000개의 훈련 환경을 생성하는 자동화된 데이터 파이프라인도 발표했으며, 해당 데이터에서 오픈 웨이트 모델을 미세 조정하면 작업 성공률이 23.7% 향상되었다.

AI 시장 분석

화웨이가 AI 에이전트의 성능을 평가하는 새로운 벤치마크를 공개했습니다. 이 벤치마크는 AI 에이전트가 복잡한 실제 시나리오를 처리하는 데 아직 한계가 있음을 보여줍니다. 즉, 현재 AI 기술 수준으로는 인간의 삶과 같은 복잡한 상황을 완전히 모방하거나 해결하기 어렵다는 것을 시사합니다.

상승 영향

하락 영향

AI가 생성한 분석으로 투자 자문이 아닙니다.

DYAX 투자자 예측

상승(롱) 60% · 하락(숏) 40%

총 336명 참여

관련 뉴스

원문 보기 — DECRYPT