ChatGPT
調査・統合・検証の全タスクで安定。T3は満点。
ChatGPT、Elicit、Consensusを3つの調査タスクで実測。回答、採点規則、限界まで公開します。
各製品1回×3タスク。Benchmark v1.1の回答をv1.2-AIで再採点しました。
| 順位 | 製品 | T1 / 30 | T2 / 35 | T3 / 35 | 合計 / 100 |
|---|---|---|---|---|---|
| 1 | ChatGPT全タスクで安定 | 29.0 | 33.5 | 35.0 | 97.5 |
| 2 | Elicit研究情報の統合に強い | 24.0 | 35.0 | 28.5 | 87.5 |
| 3 | Consensus公式情報の検証に強み | 24.5 | 27.5 | 33.6 | 85.6 |
A・Bの評価差は全9件で0〜1点。裁定者Cは不要でした。表示は小数1桁、内部計算は全精度を保持。
調査・統合・検証の全タスクで安定。T3は満点。
固定研究パケットの統合で満点。メタデータ確認は必要。
公式情報に沿う検証は強い。網羅性と語数制約で減点。
総合順位だけでなく、課題別の差、使い分け、検証手順まで掘り下げます。
同じimmutable promptを使用し、回答後の再質問や修正を行いません。
表形式、項目充足、引用、正答、語数などをタスク別ルールで採点します。
製品名を伏せたA・Bが独立評価。差が2点超の場合のみCが裁定します。
各製品1回の結果であり、製品全体の絶対評価ではありません。