GDPVal-AA
GDPVal-AAは、OpenAIのGDPvalを基にArtificial Analysisが運営する、実務的な知識労働におけるAIモデルの性能をEloレーティングで比較するベンチマーク。
記事4本
最終言及 GDPVal-AAは、AI評価機関のArtificial Analysisが運営するベンチマーク。OpenAIが2025年に公開したGDPvalの課題を基に、モデルに実務的な知識労働を行わせ、成果物をモデル同士で比較してEloレーティングで順位付けする。
GDPvalは、米国経済で大きな比重を占める職業の実際の業務を課題とし、経済的価値のある仕事をAIモデルがどの程度こなせるかを測るベンチマークである。GDPVal-AAは正答率ではなく、モデル間の相対比較の結果をEloレーティングで示す。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
専門業務の評価、GDPval-AA 1,542 1,672
44の職種にまたがる知識労働の評価であるGDPval-AAでは、Claude Sonnet 5.5のスコアは1844で、Claude Opus 5.5の1846に迫り、Claude Sonnet 5の1449を上回っています。
GDPVal-AAのレーティングは高いほど、その評価で優れた結果を示します。