Skip to content

Music Generation

MLX-Audio music models generate complete songs from a musical caption and structured lyrics.

Model Output Models Key features
MiniMax Music 3 44.1 kHz stereo BF16, 8-bit, 6-bit, 4-bit, MXFP8, MXFP4, NVFP4 Multilingual lyrics, structural tags, long-form generation
python -m mlx_audio.music.generate \
  --model mlx-community/MiniMax-Music3-mxfp8 \
  --caption "Warm acoustic pop with intimate female vocals" \
  --lyrics $'[verse]\nMorning light\n[chorus]\nSing with me' \
  --output song.wav