Automatic Generation and Optimization Algorithm for Brand Visual Identity System Based on Multimodal Generative Adversarial Network
Abstract
A Brand Visual Identity System (BVIS) is a crucial carrier for conveying a brand's core values, but traditional manual design struggles to meet the demands of efficient and personalized design in the digital age. Addressing the shortcomings of existing Multimodal Generative Adversarial Networks (MM-GANs) in BVIS design, such as semantic-visual mapping bias, fragmented element styles, and a lack of quantified iteration mechanisms, this study integrates attention mechanisms, perceptual loss, style consistency constraints, and adaptive optimization strategies to construct an improved automatic BVIS generation and optimization framework. The model utilizes publicly available datasets for preprocessing and alignment of text, color, and graphic multimodal data. Text semantic encoding is achieved through Bidirectional Encoder Representations from Transformers (BERT), and multimodal feature fusion is accomplished using an attention matrix. Adversarial training is conducted using an improved U-Net and PatchGAN. The model is then compared and tested with Generative Adversarial Network (GAN) series models, diffusion models, and Contrastive Language-Image Pre-Training (CLIP) guided generative models. Experiments show that the model outperforms the control model in metrics such as Fréchet Inception Distance (FID), Structural Similarity Index Measure (SSIM), and Semantic Matching (SM), demonstrating excellent robustness and generalization ability in scenarios with noise interference, cross-industry collaboration, and modality loss. Ablation experiments prove that multimodal feature alignment is key to improving model performance. The generated visual elements exhibit a consistent style and good semantic matching. This study presents a practical intelligent brand design solution and analyzes the ethical risks of copyright infringement, counterfeiting, and misuse of AI-generated logos, providing insights for compliant technology applications and expanding the engineering application of multimodal generation models in brand visual design.