AMAI Mediaz
製品レビュー · AI MEDIAZ REPORT

ChatGPTの実測レビュー

97.5点だった回答の強みと、T1で満点を逃した理由を分解します。

公開 2026-09-19 · AI Mediaz編集部 · Benchmark v1.2-AI

総合スコア

ChatGPTはT1 29.0点、T2 33.5点、T3 35.0点で、合計97.5点でした。3種類の課題すべてで大きな崩れがなかったことが首位の理由です。

調査タスクの特徴

T1では条件に合う研究を比較的多く提示し、書誌情報も整理しました。一方、探索課題は検索時点と収録範囲の影響を受けるため、件数そのものを完全性の証明にはできません。

要約と検証の安定性

T2では固定資料だけを使う制約を守り、RCTと観察研究、対象外集団、不確実性を区別しました。細部の省略で1.5点を失いました。

向いている利用者

T3では7主張を公式記録に照らし、支持・反証・不十分を正しく整理して満点でした。汎用AIでも、資料と判定規則を固定すると検証作業に強みが出ます。