Skip to main content
llm.info

Cartesia Sonic 3

Cartesia

Cartesia's real-time text-to-speech model (late 2025), built on a state-space architecture for extremely low latency (~90ms model latency) with strong emotional expressiveness, multilingual support, and instant voice cloning from short samples - ideal for live voice agents.

Strengths

  • Ultra-low latency (~90ms model, ~190ms end-to-end)
  • State-space architecture for efficient real-time synthesis
  • Strong emotional expressiveness across 40+ languages
  • Instant voice cloning from short samples
  • Purpose-built for live voice agents

Caveats

  • Proprietary - API access only
  • Usage-based pricing scales with volume
  • Voice cloning gated by consent policies
Vendor
Cartesia
License
Proprietary
Modalities
text
audio

Capabilities

Vision
Audio
Video
Tool Use

Pricing

Usage-based API pricing by characters/credits with subscription tiers; optimized for real-time voice agents.

Reviews

Comments