Audit & Repair: An Agentic Framework for Consistent Story Visualization in Text-to-Image Diffusion Models

Kiymet Akdemir; Tahira Kazimi; Pinar Yanardag

arXiv:2506.18900·cs.CV·June 24, 2025

Audit & Repair: An Agentic Framework for Consistent Story Visualization in Text-to-Image Diffusion Models

Kiymet Akdemir, Tahira Kazimi, Pinar Yanardag

PDF

TL;DR

This paper introduces a multi-agent framework that autonomously detects and corrects inconsistencies in multi-panel story visualizations generated by diffusion models, improving visual coherence across narrative sequences.

Contribution

It presents a novel collaborative multi-agent system that iteratively refines story images for enhanced consistency without re-generating entire sequences.

Findings

01

Outperforms prior methods in multi-panel consistency.

02

Compatible with various diffusion models.

03

Enhances visual coherence in story visualization.

Abstract

Story visualization has become a popular task where visual scenes are generated to depict a narrative across multiple panels. A central challenge in this setting is maintaining visual consistency, particularly in how characters and objects persist and evolve throughout the story. Despite recent advances in diffusion models, current approaches often fail to preserve key character attributes, leading to incoherent narratives. In this work, we propose a collaborative multi-agent framework that autonomously identifies, corrects, and refines inconsistencies across multi-panel story visualizations. The agents operate in an iterative loop, enabling fine-grained, panel-level updates without re-generating entire sequences. Our framework is model-agnostic and flexibly integrates with a variety of diffusion models, including rectified flow transformers such as Flux and latent diffusion models such…

Peer Reviews

No public reviews on file for this paper yet. If you reviewed it on a platform where reviews are public (OpenReview, ICLR, NeurIPS, ICML), you can paste yours below so the community can read it here.

Videos

No videos yet. Explain this paper in a talk, walkthrough, or lecture? Add one.