Record a native speaker for each approved expression in text.json. One clean utterance per file; no music. Store variety, release, transcript key, take, sample rate, loudness, duration, checksum and pronunciation review.