どのAIが、実務で当たっていたか
ベンチマークの点数ではなく、実務者が現場基準で判定した結果です。ここに出るのは判定を数えた実測値だけで、推定値や参考値は載せません。どのモデルを業務に使うかの判断に使えます。
人の判定 3 件を集計割合の表示は 1モデルあたり 20 件から
Claude判定 2 件(20件から割合を表示)
正しい・おおむね正しい 0/条件付き 1/誤り・危険 1
バージョン別の内訳(1)
- 2 件 / Opus 4.8現行
GPT判定 1 件(20件から割合を表示)
正しい・おおむね正しい 0/条件付き 0/誤り・危険 1
バージョン別の内訳(1)
- 1 件 / GPT-5現行
「一致」は、人の判定が「正しい」「おおむね正しい」だった割合です。 母数はそのモデルの回答に付いた判定数で、公開済みのケースのみを数えています。 判定は多数決ではなく、確認済みの実務者・専門家の判断を重く見て表示順を決めています。 モデルは頻繁に置き換わるため、集計はファミリー単位(Claude / GPT / Gemini)で行い、 版ごとの内訳を併記しています。