Cartesia Sonic 3
Cartesia
Cartesia's real-time text-to-speech model (late 2025), built on a state-space architecture for extremely low latency (~90ms model latency) with strong emotional expressiveness, multilingual support, and instant voice cloning from short samples - ideal for live voice agents.
Strengths
- Ultra-low latency (~90ms model, ~190ms end-to-end)
- State-space architecture for efficient real-time synthesis
- Strong emotional expressiveness across 40+ languages
- Instant voice cloning from short samples
- Purpose-built for live voice agents
Caveats
- Proprietary - API access only
- Usage-based pricing scales with volume
- Voice cloning gated by consent policies
- Vendor
- Cartesia
- License
- Proprietary
- Modalities
- textaudio
Capabilities
Vision
Audio
Video
Tool Use
Resources
Pricing
Usage-based API pricing by characters/credits with subscription tiers; optimized for real-time voice agents.