近日,人工智能领域迎来一项创新成果——MiniMax正式发布其最新研发的音乐生成模型MiniMax-Music3。该模型凭借独特的技术架构,能够根据用户提供的歌词和音乐描述,生成时长最长可达5分钟的完整歌曲,为音乐创作领域带来全新可能。
MiniMax-Music3采用分层自回归架构,由Global LLM(全局语言模型)和Local LLM(局部语言模型)协同工作。其中,Global LLM参数规模达8B,基于Qwen3-8B模型初始化,通过逐帧预测第一个RVQ码本,承担起建模歌曲长程语义与结构变化的重任。在训练过程中,该模型首先适配音乐语义词元的嵌入层和输出层,随后与Local LLM联合建模全部RVQ码本,确保对音乐整体框架的精准把握。
Local LLM则专注于细节处理,其参数规模为0.6B,负责预测每一帧中除第一个码本外的其余声学码本,从而恢复歌曲的细粒度声学信息。这种分工明确的架构设计,使得模型既能把握音乐的整体风格与结构,又能精准呈现每个音符的细节特征。
在输出能力方面,MiniMax-Music3表现卓越。该模型生成的单首歌曲最长可达5分钟,输出格式为32kHz、16-bit立体声WAV文件,能够满足专业音乐制作对音质和时长的要求。无论是流行、摇滚还是古典等不同风格的音乐,该模型都能通过精准的参数控制实现高质量生成。
官方测试数据显示,MiniMax-Music3在长音频生成过程中展现出强大的稳定性。该模型能够始终保持音乐主题的一致性,精准控制节奏变化,并确保歌声身份特征和编曲推进的连贯性。其生成的音乐作品完整覆盖前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾奏等标准音乐结构,为音乐创作者提供了从灵感构思到完整作品的一站式解决方案。






