PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet
DGX agentarXiv:2607.06097v1 Announce Type: cross Abstract: 3D dense captioning, an emerging vision-language task, aims to generate descriptive sentences for each object in the 3D scene. Despite the impressive