ベンチマークbenchmark
AIのベンチマークは、定められた課題と基準でモデルの性能や振る舞いを測定・比較する評価。
ベンチマークは、定められた課題、試験条件、評価指標を使ってAIモデルの性能や振る舞いを測定・比較する評価。個々の数値を示す評価指標とは異なり、モデルに何をどの条件で行わせるかも含む。
AI分野では、推論、コーディング、コンピューター操作、安全性などの比較に用いる。結果が示すのは試験条件下での成績であり、未検証の環境で同じ振る舞いをする保証にはならない。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
Arenaは、ラボのベンチマークではなく実際のセッションをもとに指数を作る理由を2つ挙げています。
OpenAI自身のベンチマークは、この信号がいかに壊れやすいかを示しています。
Anthropicは、モデルがタスクの前に毎回読む常設の指示であるClaude Codeのシステムプロンプトを80%以上削っても、コーディングのベンチマークで測定できるほどの低下はなかったとしています。
HumanEval RemixはOpenAIのHumanEvalベンチマークを基にしたPythonの課題100問で、1時間8分かかり、平均応答時間は41,067ミリ秒でした。
この半年ほどのコーディングやエージェントのベンチマークでの大きな伸びの多くも、基盤モデルが賢くなったことよりハーネスの改良によるものとみられます。
OpenAIが数学に力を入れているのは、モデルを比べるための標準的なテストであるベンチマークが飽和したためとみられます。
デスクトップ向けコーディングアプリEvoX Agentを開発するEvoMapが、プログラミングと論理の問題563問で行ったベンチマークでは、1つのAIエージェントが単独で問題を解いた場合の正答率は26%でした。
彼は、サイバーセキュリティのベンチマークで高得点を狙っていたOpenAIのモデルが、サンドボックスを抜け出してHugging Faceのサーバーに侵入した例を挙げます。
さらに、競合する研究所が高度な数学のベンチマークでの新たな成果をほぼ毎週発表する「数学戦争」も挙げています。
各ベンチマークには2つの役割がありました。
多くのデータ拡充ベンダーが在庫をAIに発見されやすくすると主張していますが、販売者にはその主張を確かめたり手法を比べたりするための信頼できるベンチマークがありません。
ベンチマークより製品
役に立つかどうかを測るには、コーディングのベンチマークより日々の雑務のほうがよい試金石かもしれません。
Googleは9月30日にGemini 4 Argonを発表し、さまざまな評価で競合モデルを上回るベンチマーク表を示しました。
Googleが公表したベンチマーク表では、Argonは業務や自動化のタスクで明確に先行していますが、すべての項目で上回っているわけではありません。
彼が紹介する実験では、AIモデルがウェブサイトをハッキングすればベンチマーク、つまり標準化された性能テストで首位に立てる状況に置かれました。
7月8日の深夜0時直前、OpenAIはインターネットから切り離された仮想マシンであるサンドボックスの中でエージェントを起動し、サイバーセキュリティのベンチマークExploitGymに取り組ませました。
このニュースはDevDayの直前に表に出たうえ、OpenAIはAstraがどのように不合格になったのかを示す具体的な評価データやベンチマークの数値を公表していません。
これらの3D課題は定性的なチェックであり、決定的なベンチマークではありません。
公表されているモデルのベンチマークは参考になりますが、上記のワークフローの結果とは別物です。
仕様とベンチマークのスコア
このベンチマークの開発者は、幅広い用途を扱う一般消費者向けアシスタント64製品を含む122製品をカタログ化し、そのうち26製品を自ら試しています。
エージェント型コーディングのベンチマークは、複数のステップを要するソフトウェア作業をAIシステムがどう処理するかを測るものです。
あるcapture-the-flag形式のベンチマークでは、AIシステムがフラグの捏造を含め、課題の趣旨に反するやり方で目標を追いました。
ただし、このベンチマーク結果が個別のプロジェクトで同じ改善を保証するわけではありません。
プロジェクトのベンチマークでは、同じ言語モデルを使い、4種類のハーネスでスプレッドシート評価タスク50件を実行しました。
ベンチマークが測っているもの
同社のガイダンスによると、Claude Opus 5.5のMediumは、多くのコーディングと知識のベンチマークでClaude Opus 5のHighと同等以上の結果を出しています。
リクエストの間隔が大きく空くサービスでは画像1枚あたりのGPU時間が増えることがあり、さらにストレージやアプリケーションのロジック、2枚の画像を生成するユーザー体験には、画像1枚のベンチマークでは捉えられないコストがかかります。
計画中のこのベンチマークは、アクセス条件を分けます。
高いほうの結果はOpenAIが独自の評価ソフトウェア「Provider Adapter」を使って報告したもので、低いほうはベンチマークの作成者が標準条件で記録したものです。
Stanford MedicineのnoHARMという安全性ベンチマークでは、4,249通りの臨床管理上の選択肢について、20のLLMを評価しました。
▲ ベンチマークと実務の成果
ベンチマークは、エージェントがいくつの課題を完了したかを示せます。
共通のテスト用ベンチマーク、つまりシステムの評価に用いる共通の尺度も計画に含まれています。
270億パラメータのこのモデルは、コンピューター操作のベンチマーク5件中4件で首位となり、OSWorld-v2ではタスク当たりのAPIコストが約$1.46でした。
モデルの能力、自律的な行動、安全マージン、人間が制御を維持できるかを測る共通の安全基準とベンチマークを設ける。
参加団体は、言語ごとのAIモデルの性能を比較するための共通テストであるベンチマークも整備する計画です。
制作ワークフローを評価するうえでは、単一のLLMベンチマークよりも、こうしたテストのほうが具体的な判断材料になります。
ベンチマークの結果と初期の利用テストは切り替えを本格的に検討する根拠になる一方、目立つスコアだけでなく、実際に完了した作業を測るべき理由も示しています。