Back to feed
arXiv cs.LG·

GraphInfer-Bench: Benchmarking LLM's Inference Capability on Graphs

Signal
78
Hype
25
In three linesGraphInfer-Bench is a benchmark of 42,000 samples across 6 real-world graphs assessing whether LLMs can perform complex graph inference (open-ended answers requiring multiple nodes). Four method families tested: graph-token alignment, frontier LLMs, Graph2Text fine-tuning, GNNs. None closes the gap; GNNs outperform LLMs on most tasks.
Read source
Your take?
BenchmarksReasoningRAG

Summary generated by Claude — human-verified