モデル比較

どのAIが、実務で当たっていたか

ベンチマークの点数ではなく、実務者が現場基準で判定した結果です。ここに出るのは判定を数えた実測値だけで、推定値や参考値は載せません。どのモデルを業務に使うかの判断に使えます。

人の判定 3 件を集計割合の表示は 1モデルあたり 20 件から
Claude判定 2 件(20件から割合を表示)

正しい・おおむね正しい 0/条件付き 1/誤り・危険 1

バージョン別の内訳(1
  • 2 件 / Opus 4.8現行
GPT判定 1 件(20件から割合を表示)

正しい・おおむね正しい 0/条件付き 0/誤り・危険 1

バージョン別の内訳(1
  • 1 件 / GPT-5現行

「一致」は、人の判定が「正しい」「おおむね正しい」だった割合です。 母数はそのモデルの回答に付いた判定数で、公開済みのケースのみを数えています。 判定は多数決ではなく、確認済みの実務者・専門家の判断を重く見て表示順を決めています。 モデルは頻繁に置き換わるため、集計はファミリー単位(Claude / GPT / Gemini)で行い、 版ごとの内訳を併記しています。

過去のバージョンとリリース時期を見る →

法人の方へ:自社AIの回答を同じ形式で評価します

自社の採用AI・社内アシスタントの回答を、同じ「主張ごとに人が判定する」形式で評価できます。 公開ベンチマークと同じ基準なので、比較して読めます。