XPENG Rolls Out TuringViT: An Efficient Visual Encoder
1 week ago / Read about 0 minute
Author:小编   

On July 21, 2026, XPENG made a significant announcement by unveiling the TuringViT, an efficient visual encoder. This innovation marks a pivotal shift in the architecture, data management, and training methodologies of visual encoders, especially pertinent in the era of Vision-Language Models (VLMs) and Vision-Language-Action (VLA) systems. The TuringViT encoder stands out for its remarkable advancements in architecture design, data utilization, and training efficiency. It comes in two distinct versions—18L and 24L—tailored to boost high-resolution inference capabilities, diminish reliance on extensive data sets, seamlessly adapt to dynamic resolution environments, and provide robust support for intelligent driving systems, in-cabin functionalities, and humanoid robot applications.