multimodalfactbullishDisciplineGen-1M contains 1.2M samples spanning 10 disciplines, supporting text-to-image generation and editing for knowledge-intensive diagramsComputer Vision27 Jul 2026http://arxiv.org/abs/2607.02290v1