Instruction-based image editing enhances image manipulation control and flexibility without detailed descriptions or regional masks, but can struggle. Multimodal large language models (MLLMs) demonstrate potential in cross-modal understanding and visual-aware response generation.
0 likes 0 replies
?