Story
arxiv_llm_reliability ยท Aug 11, 2026 ยท paper
Source brief
Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes
arxiv.orgAug 11, 2026
original source linked
In brief
While Multimodal Large Language Models (MLLMs) demonstrate impressive performance in benign scenarios, their cognitive reliability deteriorates significantly in complex scenes under adverse conditions. In these settin...
Feed lens
evaluation