Huaweiの新しいベンチマーク、AIエージェントの失敗を観察する

DECRYPT ·

Huaweiと3つのパートナー機関の研究者は、個人アシスタントタスクにおけるAIエージェントを評価するベンチマークであるClaw-Anythingを発表した。 OpenAIのフラッグシップモデルであるGPT-5.5は、pass@1メトリックで34.5%のスコアを記録し、既存のベンチマークのスコアを大きく下回り、現在のテストが誤ったものを測定していることを示唆している。 チームはまた、2,000のトレーニング環境を生成する自動化されたデータパイプラインを発表し、そのデータでオープンウェイトモデルを微調整することでタスク成功率が23.7%向上した。

AI 시장 분석

Huaweiは、AIエージェントの性能を評価するための新しいベンチマークを発表しました。このベンチマークは、現在のAIエージェントが複雑な現実世界のシナリオを処理する上でまだ大きな限界があることを示しており、人間のような複雑な状況を完全に模倣したり解決したりするには至っていないことを示唆しています。

상승 영향

하락 영향

AI가 생성한 분석으로 투자 자문이 아닙니다.

DYAX投資家予測

上昇(ロング) 60% · 下落(ショート) 40%

合計336人参加

関連ニュース

원문 보기 — DECRYPT