Multimodal AI ignores non-text clues
A new benchmark reveals multimodal AI models fixate on text, ignoring audio or visual evidence even when it contradicts the answer.
A new benchmark reveals multimodal AI models fixate on text, ignoring audio or visual evidence even when it contradicts the answer.