LatentSync

Model Information

Display Name: LatentSync

API Model ID: sync-ai/latentsync

Category: Image To Video

Description: LatentSync is an end-to-end lip-sync framework built on audio-conditioned latent diffusion models. Synchronizes a portrait image with target audio to produce seamless lip-synced video without requiring 3D meshes, landmarks, or manual keyframing. **Key Features:** - End-to-end audio-conditioned latent diffusion - No 3D mesh or landmark dependencies - Portrait image + audio input - Multi-language and multi-accent support - Minimum 5 seconds audio required - Minimum billing: 10 seconds ($0.20) **Capabilities:** - Audio-driven lip synchronization - Identity and expression preservation - Cross-language lip-sync support - Various recording condition handling - Natural facial movement synthesis **Best For:** - Lip-syncing existing portraits to new audio - Dubbing and localization of talking heads - Multi-language content adaptation - Quick spokesperson video creation - Podcast and interview visualization **Input Requirements:** - Image: 1 portrait photo (required) - Audio: Audio file URL (required, minimum 5 seconds) - No prompt needed **Technical Specs:** - Architecture: Audio-conditioned Latent Diffusion Model - No 3D mesh or facial landmark detection required - Audio analysis: ffprobe-based duration detection - Output: MP4 video **Pricing:** - Per-second billing based on audio duration - Minimum billable duration: 10 seconds - Minimum charge: $0.20 per generation **Limitations:** - Minimum 5 seconds audio required - Single speaker per generation - No text prompt support (audio-only control) - Best results with clear frontal portraits

How to Use This Model

To use LatentSync via the HInow.ai API, use the model ID: sync-ai/latentsync

API Request Example (Image Generation)


POST https://api.hinow.ai/v1/images
Authorization: Bearer YOUR_API_KEY
Content-Type: application/json

{
  "model": "sync-ai/latentsync",
  "prompt": "Your image description here"
}
              

Pricing

  • total: $0.02

Available Parameters

  • audio: Target audio URL for lip-sync (required). WAV or MP3. Duration detected automatically for billing. Minimum 5 seconds.

Quick Reference

To use this model, set: "model": "sync-ai/latentsync"

Featured: No

Documentation: https://hinow.ai/models/sync-ai/latentsync

API Endpoint: https://api.hinow.ai/v1

Back to Models

LatentSync

sync-ai/latentsync

$0.020
per second

About

LatentSync is an end-to-end lip-sync framework built on audio-conditioned latent diffusion models. Synchronizes a portrait image with target audio to produce seamless lip-synced video without requiring 3D meshes, landmarks, or manual keyframing.

Key Features:

  • End-to-end audio-conditioned latent diffusion
  • No 3D mesh or landmark dependencies
  • Portrait image + audio input
  • Multi-language and multi-accent support
  • Minimum 5 seconds audio required
  • Minimum billing: 10 seconds ($0.20)

Capabilities:

  • Audio-driven lip synchronization
  • Identity and expression preservation
  • Cross-language lip-sync support
  • Various recording condition handling
  • Natural facial movement synthesis

Best For:

  • Lip-syncing existing portraits to new audio
  • Dubbing and localization of talking heads
  • Multi-language content adaptation
  • Quick spokesperson video creation
  • Podcast and interview visualization

Input Requirements:

  • Image: 1 portrait photo (required)
  • Audio: Audio file URL (required, minimum 5 seconds)
  • No prompt needed

Technical Specs:

  • Architecture: Audio-conditioned Latent Diffusion Model
  • No 3D mesh or facial landmark detection required
  • Audio analysis: ffprobe-based duration detection
  • Output: MP4 video

Pricing:

  • Per-second billing based on audio duration
  • Minimum billable duration: 10 seconds
  • Minimum charge: $0.20 per generation

Limitations:

  • Minimum 5 seconds audio required
  • Single speaker per generation
  • No text prompt support (audio-only control)
  • Best results with clear frontal portraits

Capabilities

Image To Video

Parameters

audio

Target audio URL for lip-sync (required). WAV or MP3. Duration detected automatically for billing. Minimum 5 seconds.

Code Examples

curl -X POST https://api.hinow.ai/v1/videos \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $HINOW_API_KEY" \
  -d '{
    "model": "sync-ai/latentsync",
    "prompt": "A cat playing with a ball",
    "images": ["https://example.com/image.jpg"],
    "parameters": {
      "audio": ""
    }
  }'