Paper Detail

Seeing Through Conflicts: Improving Instruction Hierarchy Alignment in Vision-Language Models

Nicholas Sansoterra, Zishuo Zheng, Sachin Kumar

arxiv Score 18.8

Published 2026-09-03 · First seen 2026-09-22

General AI

Abstract

Instruction hierarchy (IH) alignment teaches language models to prioritize higher-level instructions when inputs conflict. While studied primarily in text-only settings, vision-language models (VLMs) introduce new challenges for IH: instructions may be embedded in images, split across modalities, visually transformed, or encountered during agentic tasks. Positing multimodal IH alignment as a reasoning problem, we train VLMs using reinforcement learning with rule-based rewards, comparing text-only, image-only, and mixed-modality supervision. We find that text-only IH training partially transfers to multimodal attacks, failing when models must decode, reconstruct, or reason over instructions across modalities. Image-based training improves robustness beyond text-only supervision, while mixed-modality training performs best overall. Importantly, the benefits generalize beyond the synthetic typographic training setting to real-image and web-agent safety tasks, while largely preserving general multimodal capability, showing that lightweight, verifiable supervision can meaningfully improve VLM robustness under adversarial, cross-modal, and interactive instruction conflicts.

Workflow Status

Review status
pending
Role
unreviewed
Read priority
now
Vote
Not set.
Saved
no
Collections
Not filed yet.
Next action
Not filled yet.

Reading Brief

No structured notes yet. Add `summary_sections`, `why_relevant`, `claim_impact`, or `next_action` in `papers.jsonl` to enrich this view.

Why It Surfaced

No ranking explanation is available yet.

Tags

No tags.

BibTeX

@article{sansoterra2026seeing,
  title = {Seeing Through Conflicts: Improving Instruction Hierarchy Alignment in Vision-Language Models},
  author = {Nicholas Sansoterra and Zishuo Zheng and Sachin Kumar},
  year = {2026},
  abstract = {Instruction hierarchy (IH) alignment teaches language models to prioritize higher-level instructions when inputs conflict. While studied primarily in text-only settings, vision-language models (VLMs) introduce new challenges for IH: instructions may be embedded in images, split across modalities, visually transformed, or encountered during agentic tasks. Positing multimodal IH alignment as a reasoning problem, we train VLMs using reinforcement learning with rule-based rewards, comparing text-onl},
  url = {https://arxiv.org/abs/2609.22234},
  keywords = {cs.CL, cs.CV, cs.LG},
  eprint = {2609.22234},
  archiveprefix = {arXiv},
}

Metadata

{}