AMAI Mediaz
INDEPENDENT AI TOOL BENCHMARK

AIを、同じ条件で比べる。

ChatGPT、Elicit、Consensusを3つの調査タスクで実測。回答、採点規則、限界まで公開します。

97.5今回の最高総合点
ChatGPT / 100
RESULTS 01

総合結果

各製品1回×3タスク。Benchmark v1.1の回答をv1.2-AIで再採点しました。

順位製品T1 / 30T2 / 35T3 / 35合計 / 100
1ChatGPT全タスクで安定29.033.535.097.5
2Elicit研究情報の統合に強い24.035.028.587.5
3Consensus公式情報の検証に強み24.527.533.685.6

A・Bの評価差は全9件で0〜1点。裁定者Cは不要でした。表示は小数1桁、内部計算は全精度を保持。

01

ChatGPT

調査・統合・検証の全タスクで安定。T3は満点。

02

Elicit

固定研究パケットの統合で満点。メタデータ確認は必要。

03

Consensus

公式情報に沿う検証は強い。網羅性と語数制約で減点。

LIBRARY 02

検証記事 26本

総合順位だけでなく、課題別の差、使い分け、検証手順まで掘り下げます。

METHOD 03

点数より、
測り方を公開する。

01

入力を固定

同じimmutable promptを使用し、回答後の再質問や修正を行いません。

02

決定論的評価

表形式、項目充足、引用、正答、語数などをタスク別ルールで採点します。

03

AI二重審査

製品名を伏せたA・Bが独立評価。差が2点超の場合のみCが裁定します。

04

限界も掲載

各製品1回の結果であり、製品全体の絶対評価ではありません。