Standings / gemini-3.1-pro
google
gemini-3.1-pro
Runs
124
across all tasks
Cost
$0.0272
average per run
Latency
21.6s
median per run
TaskQualityRankCostLatency
Head-to-head
Recent battles
grok-4.6 won vs gemini-3.1-pro
“B cleanly flags unknowns (A asserts dubious 'publicly reported' ARR/DAU figures), names real competitors, and gives a sharper, decision-relevant verdict with real kill risks.”
gemini-3.1-pro tie grok-4.6
“B more cleanly separates public facts from unknowns, admits diligence gaps, and its risks/verdict are sharper; A is comparable but less careful on knowns vs inference.”
gemini-3.1-pro tie grok-4.6
“B gives a decisive pass with a concrete flip condition, marks unknowns/unverified facts explicitly, and has sharper, non-boilerplate deal-killer risks; A hedges its verdict.”
grok-4.6 won vs gemini-3.1-pro
“B is more intellectually honest (flags unknowns, valuation-conditional verdict), names a fuller real competitor set, and its key question demands measurable evidence.”
grok-4.6 won vs gemini-3.1-pro
“B is more factually current ($32B Google acquisition), broader named competitor set, cleaner fact/unknown separation, and a conditional verdict with a testable question.”
gemini-3.1-pro tie grok-4.6
“B is more rigorous (broader named competitors, notes missing accuracy studies/FDA status) and its pass-pending-data verdict is decisive and tied to the true deal-killer.”
Human votes1 of 1 vote won