multimodalopinionneutralVideo models are generally about 12 months behind language models in capability.Cristobal Valenzuela28 Jul 2026https://x.com/c_valenzuelab/status/2078884449328975990