HF Daily Papers
· Papers
3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering
Recent 3D vision-language models (3D VLMs) construct geometry aware tokens by projecting 2D visual features into world coordinates, enabling spatial reasoning for tasks such as 3D question answering. However, this design generates thousands of tokens per scene, resulting in substantial computational