Multimodal Deepfake Attribution & Localization
Disentangled audio-visual cross-attention with 4-quadrant manipulation attribution, temporal segment localization, and phoneme-viseme synchrony verification.
Click to upload or drag & drop media file
Video (MP4, WebM, AVI, MOV) or Audio (WAV, MP3, FLAC) • Max 50 MB
selected_file.mp4
(12.4 MB)
Running cross-modal disentangled inference...
Demuxing streams • Evaluating VideoMAE & WavLM adapters
Authenticity Quadrant Verdict
FVFA
Dual Synthetic Deepfake
Latency: 184 ms
Clip Duration: 4.00 s
Quadrant Probability Distribution:
RVRA (Real-V / Real-A)
0.0%
RVFA (Audio Dubbed)
0.0%
FVRA (Face Swap)
0.0%
FVFA (Dual Fake)
0.0%
Video Modality
Assessing
Confidence:
0.0%
Decision: --
Raw Prob: --
Audio Modality
Assessing
Confidence:
0.0%
Decision: --
Raw Prob: --
Temporal Manipulation Localization
Dense frame-level forgery intervals
Video Track
No manipulated intervals
0.0s
Audio Track
No manipulated intervals
0.0s
Cross-Modal Synchronization Agreement Curve ($s_t$)
Per-window InfoNCE cosine correlationView Serialized JSON Response Contract (RFC-8259)
Probabilistic Forensic Decision Support:
This detection verdict is an algorithmic probability estimate intended to assist human forensic examiners and analysts. It does not constitute autonomous legal proof of tampering or provenance.