VCS / VCB — Long-Form Video Description Evaluation
Video Comprehension Score (VCS) and Benchmark (VCB) for paragraph-level video description. In preparation, targeting CVPR 2027.
Venue: Targeting CVPR 2027 (main conference). Role: Second author.
Existing caption-evaluation metrics (BLEU, METEOR, BERTScore, CIDEr, etc.) fail on long-form paragraph-level video descriptions where narrative ordering, entity tracking, and reference resolution matter. We propose Video Comprehension Score (VCS), a metric grounded in semantic-unit alignment rather than n-gram overlap, and pair it with VCB, a benchmark suite exercising compositional and long-range comprehension failure modes.
Video Comprehension Score — global, local, and narrative alignment.