The 3D semantic instance prediction task involves detecting and segmenting the object in an 3D scan mesh.

Evaluation and metrics

Our evaluation ranks all methods according to the average precision for each class. We report the mean average precision AP at overlap 0.25 (AP 25%), overlap 0.5 (AP 50%), and over overlaps in the range [0.5:0.95:0.05] (AP). Note that multiple predictions of the same ground truth instance are penalized as false positives.



This table lists the benchmark results for the 3D semantic instance scenario.




Method Infoavg ap 50%bathtubbedbookshelfcabinetchaircountercurtaindeskdoorotherfurniturepicturerefrigeratorshower curtainsinksofatabletoiletwindow
sorted bysort bysort bysort bysort bysort bysort bysort bysort bysort bysort bysort bysort bysort bysort bysort bysort bysort bysort by
AQ3D0.834 11.000 10.932 150.876 120.752 30.948 10.632 20.680 320.761 120.784 20.753 30.826 10.812 21.000 10.859 20.879 80.831 21.000 10.688 3
Volt-SPFormerScanNetpermissive0.827 21.000 10.981 60.975 10.801 10.940 50.426 250.693 300.752 140.762 80.800 10.804 30.855 10.959 490.745 240.879 70.806 80.997 440.710 1
Kadir Yilmaz, Adrian Kruse, Tristan Höfer, Daan de Geus, Bastian Leibe: Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding.
Competitor-MAFT0.816 31.000 10.983 40.872 130.718 70.941 40.588 60.652 430.819 30.776 40.720 80.780 80.769 131.000 10.797 120.813 330.798 101.000 10.659 6
PointRel0.816 31.000 10.971 100.908 70.743 40.923 120.573 100.714 220.695 220.734 120.747 40.725 150.809 31.000 10.814 100.899 50.820 41.000 10.610 21
: Relation3D: Enhancing Relation Modeling for Point Cloud Instance Segmentation. CVPR 2025
Spherical Mask(CtoF)0.812 51.000 10.973 90.852 170.718 80.917 140.574 80.677 330.748 150.729 160.715 110.795 50.809 31.000 10.831 50.854 140.787 141.000 10.638 10
EV3D0.811 61.000 10.968 120.852 170.717 90.921 130.574 90.677 330.748 150.730 150.703 170.795 50.809 31.000 10.831 50.854 140.778 181.000 10.638 11
PointComp0.811 60.850 620.969 110.864 150.739 50.946 30.539 170.671 360.835 20.700 200.742 50.817 20.766 141.000 10.755 220.909 10.808 71.000 10.687 4
VDG-Uni3DSeg0.804 81.000 10.990 10.886 100.688 220.912 160.602 30.703 260.786 80.771 50.708 150.700 200.669 280.981 420.789 180.903 20.772 221.000 10.609 22
SIM3D0.803 91.000 10.967 130.863 160.692 210.924 110.552 140.732 200.667 270.732 140.662 210.796 40.789 111.000 10.803 110.864 110.766 251.000 10.643 8
OneFormer3Dcopyleft0.801 101.000 10.973 80.909 60.698 170.928 90.582 70.668 390.685 230.780 30.687 190.698 240.702 171.000 10.794 140.900 40.784 160.986 570.635 12
Maxim Kolodiazhnyi, Anna Vorontsova, Anton Konushin, Danila Rukhovich: OneFormer3D: One Transformer for Unified Point Cloud Segmentation.
Competitor-SPFormer0.800 111.000 10.986 30.845 190.705 150.915 150.532 180.733 190.757 130.733 130.708 140.698 230.648 400.981 420.890 10.830 240.796 110.997 440.644 7
InsSSM0.799 121.000 10.915 170.710 460.729 60.925 100.664 10.670 370.770 90.766 60.739 60.737 110.700 181.000 10.792 150.829 260.815 50.997 440.625 14
Lei Yao, Yi Wang, Moyun Liu, Lap-Pui Chau: SGIFormer: Semantic-guided and Geometric-enhanced Interleaving Transformer for 3D Instance Segmentation. TCSVT, 2024
DCD0.798 131.000 10.878 250.792 310.693 200.936 60.596 40.685 310.663 290.736 100.717 90.788 70.693 231.000 10.825 80.840 200.837 11.000 10.689 2
TST3D0.795 141.000 10.929 160.918 50.709 120.884 250.596 50.704 250.769 100.734 110.644 260.699 220.751 151.000 10.794 130.876 100.757 280.997 440.550 38
Duc Tran Dang Trung, Byeongkeun Kang, Yeejin Lee: MSTA3D: Multi-scale Twin-attention for 3D Instance Segmentation. ACM Multimedia 2024
MG-Former0.791 151.000 10.980 70.837 220.626 310.897 180.543 160.759 140.800 70.766 70.659 220.769 100.697 211.000 10.791 160.707 540.791 131.000 10.610 20
ExtMask3D0.789 161.000 10.988 20.756 390.706 140.912 170.429 240.647 450.806 60.755 90.673 200.689 250.772 121.000 10.789 170.852 160.811 61.000 10.617 17
UniPerception0.787 171.000 10.909 180.768 360.687 230.947 20.551 150.714 210.843 10.696 210.713 130.773 90.607 460.981 420.690 310.878 90.775 211.000 10.640 9
Queryformer0.787 171.000 10.933 140.601 560.754 20.886 230.558 130.661 410.767 110.665 240.716 100.639 310.808 71.000 10.844 40.897 60.804 91.000 10.624 15
MAFT0.786 191.000 10.894 230.807 260.694 190.893 210.486 200.674 350.740 170.786 10.704 160.727 140.739 161.000 10.707 290.849 180.756 291.000 10.685 5
KmaxOneFormerNetpermissive0.783 200.903 600.981 50.794 300.706 130.931 80.561 120.701 270.706 200.727 170.697 180.731 130.689 251.000 10.856 30.750 450.761 271.000 10.599 26
Mask3D0.780 211.000 10.786 490.716 440.696 180.885 240.500 190.714 220.810 50.672 230.715 110.679 260.809 31.000 10.831 50.833 230.787 141.000 10.602 24
Jonas Schult, Francis Engelmann, Alexander Hermans, Or Litany, Siyu Tang, Bastian Leibe: Mask3D for 3D Semantic Instance Segmentation. ICRA 2023
SPFormerpermissive0.770 220.903 600.903 200.806 270.609 380.886 220.568 110.815 60.705 210.711 180.655 230.652 300.685 261.000 10.789 190.809 340.776 201.000 10.583 30
Sun Jiahao, Qing Chunmei, Tan Junpeng, Xu Xiangmin: Superpoint Transformer for 3D Scene Instance Segmentation. AAAI 2023 [Oral]
SoftGroup++0.769 231.000 10.803 420.937 20.684 240.865 270.213 410.870 20.664 280.571 310.758 20.702 190.807 81.000 10.653 370.902 30.792 121.000 10.626 13
SoftGrouppermissive0.761 241.000 10.808 380.845 190.716 100.862 290.243 380.824 40.655 310.620 250.734 70.699 210.791 100.981 420.716 260.844 190.769 231.000 10.594 28
Thang Vu, Kookhoi Kim, Tung M. Luu, Xuan Thanh Nguyen, Chang D. Yoo: SoftGroup for 3D Instance Segmentaiton on Point Clouds. CVPR 2022 [Oral]
ISBNetpermissive0.757 251.000 10.904 190.731 420.678 250.895 190.458 220.644 470.670 260.710 190.620 310.732 120.650 301.000 10.756 210.778 370.779 171.000 10.614 18
Tuan Duc Ngo, Binh-Son Hua, Khoi Nguyen: ISBNet: a 3D Point Cloud Instance Segmentation Network with Instance-aware Sampling and Box-aware Dynamic Convolution. CVPR 2023
TD3Dpermissive0.751 261.000 10.774 500.867 140.621 330.934 70.404 260.706 240.812 40.605 280.633 290.626 320.690 241.000 10.640 390.820 290.777 191.000 10.612 19
Maksim Kolodiazhnyi, Anna Vorontsova, Anton Konushin, Danila Rukhovich: Top-Down Beats Bottom-Up in 3D Instance Segmentation. WACV 2024
PBNetpermissive0.747 271.000 10.818 340.837 230.713 110.844 310.457 230.647 450.711 190.614 260.617 330.657 290.650 301.000 10.692 300.822 280.765 261.000 10.595 27
Weiguang Zhao, Yuyao Yan, Chaolong Yang, Jianan Ye, Xi Yang, Kaizhu Huang: Divide and Conquer: 3D Instance Segmentation With Point-Wise Binarization. ICCV 2023
GraphCut0.732 281.000 10.788 470.724 430.642 300.859 300.248 370.787 110.618 340.596 290.653 250.722 170.583 531.000 10.766 200.861 120.825 31.000 10.504 44
IPCA-Inst0.731 291.000 10.788 480.884 110.698 160.788 470.252 360.760 130.646 320.511 390.637 280.665 280.804 91.000 10.644 380.778 380.747 311.000 10.561 34
TopoSeg0.725 301.000 10.806 410.933 30.668 270.758 520.272 350.734 180.630 330.549 350.654 240.606 330.697 220.966 480.612 430.839 210.754 301.000 10.573 31
DKNet0.718 311.000 10.814 350.782 320.619 350.872 260.224 390.751 160.569 380.677 220.585 380.724 160.633 420.981 420.515 530.819 300.736 321.000 10.617 16
Yizheng Wu, Min Shi, Shuaiyuan Du, Hao Lu, Zhiguo Cao, Weicai Zhong: 3D Instances as 1D Kernels. ECCV 2022
SSEC0.707 321.000 10.850 270.924 40.648 280.747 550.162 430.862 30.572 370.520 370.624 300.549 360.649 391.000 10.560 480.706 550.768 241.000 10.591 29
HAISpermissive0.699 331.000 10.849 280.820 240.675 260.808 410.279 330.757 150.465 440.517 380.596 350.559 350.600 471.000 10.654 360.767 400.676 360.994 530.560 35
Shaoyu Chen, Jiemin Fang, Qian Zhang, Wenyu Liu, Xinggang Wang: Hierarchical Aggregation for 3D Instance Segmentation. ICCV 2021
SSTNetpermissive0.698 341.000 10.697 660.888 90.556 450.803 420.387 270.626 490.417 490.556 340.585 390.702 180.600 471.000 10.824 90.720 530.692 341.000 10.509 43
Zhihao Liang, Zhihao Li, Songcen Xu, Mingkui Tan, Kui Jia: Instance Segmentation in 3D Scenes using Semantic Superpoint Tree Networks. ICCV2021
DualGroup0.694 351.000 10.799 440.811 250.622 320.817 360.376 280.805 90.590 360.487 430.568 420.525 400.650 300.835 610.600 440.829 250.655 391.000 10.526 40
ODIN - Inspermissive0.693 361.000 10.880 240.647 510.620 340.779 490.336 300.501 640.681 240.577 300.595 360.679 270.683 271.000 10.709 280.816 320.637 430.770 730.557 36
Ayush Jain, Pushkal Katara, Nikolaos Gkanatsios, Adam W. Harley, Gabriel Sarch, Kriti Aggarwal, Vishrav Chaudhary, Katerina Fragkiadaki: ODIN: A Single Model for 2D and 3D Segmentation. CVPR 2024
SphereSeg0.680 371.000 10.856 260.744 400.618 360.893 200.151 440.651 440.713 180.537 360.579 410.430 500.651 291.000 10.389 640.744 480.697 330.991 550.601 25
DANCENET0.680 371.000 10.807 390.733 410.600 390.768 510.375 290.543 570.538 390.610 270.599 340.498 410.632 440.981 420.739 250.856 130.633 460.882 680.454 53
Box2Mask0.677 391.000 10.847 290.771 340.509 540.816 370.277 340.558 560.482 410.562 330.640 270.448 460.700 181.000 10.666 320.852 170.578 530.997 440.488 48
Julian Chibane, Francis Engelmann, Tuan Anh Tran, Gerard Pons-Moll: Box2Mask: Weakly Supervised 3D Semantic Instance Segmentation Using Bounding Boxes. ECCV 2022
OccuSeg+instance0.672 401.000 10.758 580.682 480.576 430.842 320.477 210.504 630.524 400.567 320.585 400.451 450.557 551.000 10.751 230.797 350.563 561.000 10.467 52
Lei Han, Tian Zheng, Lan Xu, Lu Fang: OccuSeg: Occupancy-aware 3D Instance Segmentation. CVPR2020
Mask-Group0.664 411.000 10.822 330.764 380.616 370.815 380.139 480.694 290.597 350.459 470.566 430.599 340.600 470.516 710.715 270.819 310.635 441.000 10.603 23
Min Zhong, Xinghao Chen, Xiaokang Chen, Gang Zeng, Yunhe Wang: MaskGroup: Hierarchical Point Grouping and Masking for 3D Instance Segmentation. ICME 2022
INS-Conv-instance0.657 421.000 10.760 560.667 500.581 410.863 280.323 310.655 420.477 420.473 450.549 450.432 490.650 301.000 10.655 350.738 490.585 520.944 600.472 51
CSC-Pretrained0.648 431.000 10.810 360.768 350.523 520.813 390.143 470.819 50.389 520.422 560.511 490.443 470.650 301.000 10.624 410.732 500.634 451.000 10.375 60
PE0.645 441.000 10.773 520.798 290.538 470.786 480.088 560.799 100.350 560.435 540.547 460.545 370.646 410.933 510.562 470.761 430.556 610.997 440.501 46
Biao Zhang, Peter Wonka: Point Cloud Instance Segmentation using Probabilistic Embeddings. CVPR 2021
RPGN0.643 451.000 10.758 570.582 620.539 460.826 350.046 610.765 120.372 540.436 530.588 370.539 390.650 301.000 10.577 450.750 460.653 410.997 440.495 47
Shichao Dong, Guosheng Lin, Tzu-Yi Hung: Learning Regional Purity for Instance Segmentation on 3D Point Clouds. ECCV 2022
Dyco3Dcopyleft0.641 461.000 10.841 300.893 80.531 490.802 430.115 530.588 540.448 460.438 510.537 480.430 510.550 560.857 530.534 510.764 420.657 380.987 560.568 32
Tong He; Chunhua Shen; Anton van den Hengel: DyCo3D: Robust Instance Segmentation of 3D Point Clouds through Dynamic Convolution. CVPR2021
GICN0.638 471.000 10.895 220.800 280.480 580.676 600.144 460.737 170.354 550.447 480.400 620.365 570.700 181.000 10.569 460.836 220.599 481.000 10.473 50
PointGroup0.636 481.000 10.765 530.624 530.505 560.797 440.116 520.696 280.384 530.441 490.559 440.476 430.596 501.000 10.666 320.756 440.556 600.997 440.513 42
Li Jiang, Hengshuang Zhao, Shaoshuai Shi, Shu Liu, Chi-Wing Fu, Jiaya Jia: PointGroup: Dual-Set Point Grouping for 3D Instance Segmentation. CVPR 2020 [oral]
DD-UNet+Group0.635 490.667 640.797 460.714 450.562 440.774 500.146 450.810 80.429 480.476 440.546 470.399 530.633 421.000 10.632 400.722 520.609 471.000 10.514 41
H. Liu, R. Liu, K. Yang, J. Zhang, K. Peng, R. Stiefelhagen: HIDA: Towards Holistic Indoor Understanding for the Visually Impaired via Semantic Instance Segmentation with a Wearable Solid-State LiDAR Sensor. ICCVW 2021
Mask3D_evaluation0.631 501.000 10.829 320.606 550.646 290.836 330.068 570.511 610.462 450.507 400.619 320.389 550.610 451.000 10.432 590.828 270.673 370.788 720.552 37
DENet0.629 511.000 10.797 450.608 540.589 400.627 640.219 400.882 10.310 580.402 610.383 640.396 540.650 301.000 10.663 340.543 720.691 351.000 10.568 33
3D-MPA0.611 521.000 10.833 310.765 370.526 510.756 530.136 500.588 540.470 430.438 520.432 580.358 590.650 300.857 530.429 600.765 410.557 591.000 10.430 55
Francis Engelmann, Martin Bokeloh, Alireza Fathi, Bastian Leibe, Matthias Nießner: 3D-MPA: Multi Proposal Aggregation for 3D Semantic Instance Segmentation. CVPR 2020
OSIS0.605 531.000 10.801 430.599 570.535 480.728 570.286 320.436 680.679 250.491 410.433 560.256 610.404 680.857 530.620 420.724 510.510 661.000 10.539 39
AOIA0.601 541.000 10.761 550.687 470.485 570.828 340.008 680.663 400.405 510.405 600.425 590.490 420.596 500.714 640.553 500.779 360.597 490.992 540.424 57
PCJC0.578 551.000 10.810 370.583 610.449 610.813 400.042 620.603 520.341 570.490 420.465 530.410 520.650 300.835 610.264 700.694 590.561 570.889 650.504 45
SSEN0.575 561.000 10.761 540.473 640.477 590.795 450.066 580.529 590.658 300.460 460.461 540.380 560.331 700.859 520.401 630.692 610.653 401.000 10.348 62
Dongsu Zhang, Junha Chun, Sang Kyun Cha, Young Min Kim: Spatial Semantic Embedding Network: Fast 3D Instance Segmentation with Deep Metric Learning. Arxiv
RWSeg0.567 570.528 740.708 650.626 520.580 420.745 560.063 590.627 480.240 620.400 620.497 500.464 440.515 571.000 10.475 550.745 470.571 541.000 10.429 56
NeuralBF0.555 580.667 640.896 210.843 210.517 530.751 540.029 630.519 600.414 500.439 500.465 520.000 800.484 590.857 530.287 680.693 600.651 421.000 10.485 49
Weiwei Sun, Daniel Rebain, Renjie Liao, Vladimir Tankovich, Soroosh Yazdani, Kwang Moo Yi, Andrea Tagliasacchi: NeuralBF: Neural Bilateral Filtering for Top-down Instance Segmentation on Point Clouds. WACV 2023
MTML0.549 591.000 10.807 400.588 600.327 660.647 620.004 700.815 70.180 650.418 570.364 660.182 640.445 621.000 10.442 580.688 620.571 551.000 10.396 58
Jean Lahoud, Bernard Ghanem, Marc Pollefeys, Martin R. Oswald: 3D Instance Segmentation via Multi-task Metric Learning. ICCV 2019 [oral]
ClickSeg_Instance0.539 601.000 10.621 690.300 670.530 500.698 580.127 510.533 580.222 630.430 550.400 610.365 570.574 540.938 500.472 560.659 640.543 620.944 600.347 63
One_Thing_One_Clickpermissive0.529 610.667 640.718 610.777 330.399 620.683 590.000 730.669 380.138 680.391 630.374 650.539 380.360 690.641 680.556 490.774 390.593 500.997 440.251 68
Zhengzhe Liu, Xiaojuan Qi, Chi-Wing Fu: One Thing One Click: A Self-Training Approach for Weakly Supervised 3D Semantic Segmentation. CVPR 2021
Sparse R-CNN0.515 621.000 10.538 740.282 680.468 600.790 460.173 420.345 700.429 470.413 590.484 510.176 650.595 520.591 690.522 520.668 630.476 670.986 580.327 64
Occipital-SCS0.512 631.000 10.716 620.509 630.506 550.611 650.092 550.602 530.177 660.346 660.383 630.165 660.442 630.850 600.386 650.618 680.543 630.889 650.389 59
3D-BoNet0.488 641.000 10.672 680.590 590.301 680.484 750.098 540.620 500.306 590.341 670.259 700.125 680.434 650.796 630.402 620.499 740.513 650.909 640.439 54
Bo Yang, Jianan Wang, Ronald Clark, Qingyong Hu, Sen Wang, Andrew Markham, Niki Trigoni: Learning Object Bounding Boxes for 3D Instance Segmentation on Point Clouds. NeurIPS 2019 Spotlight
PanopticFusion-inst0.478 650.667 640.712 640.595 580.259 710.550 710.000 730.613 510.175 670.250 720.434 550.437 480.411 670.857 530.485 540.591 710.267 770.944 600.359 61
Gaku Narita, Takashi Seno, Tomoya Ishikawa, Yohsuke Kaji: PanopticFusion: Online Volumetric Semantic Mapping at the Level of Stuff and Things. IROS 2019 (to appear)
SPG_WSIS0.470 660.667 640.685 670.677 490.372 640.562 690.000 730.482 650.244 610.316 690.298 670.052 750.442 640.857 530.267 690.702 560.559 581.000 10.287 66
SALoss-ResNet0.459 671.000 10.737 600.159 780.259 700.587 670.138 490.475 660.217 640.416 580.408 600.128 670.315 710.714 640.411 610.536 730.590 510.873 690.304 65
Zhidong Liang, Ming Yang, Hao Li, Chunxiang Wang: 3D Instance Embedding Learning With a Structure-Aware Loss Function for Point Cloud Segmentation. IEEE Robotics and Automation Letters (IROS2020)
MASCpermissive0.447 680.528 740.555 720.381 650.382 630.633 630.002 710.509 620.260 600.361 650.432 570.327 600.451 610.571 700.367 660.639 660.386 680.980 590.276 67
Chen Liu, Yasutaka Furukawa: MASC: Multi-scale Affinity with Sparse Convolution for 3D Instance Segmentation.
SegGroup_inspermissive0.445 690.667 640.773 510.185 750.317 670.656 610.000 730.407 690.134 690.381 640.267 690.217 630.476 600.714 640.452 570.629 670.514 641.000 10.222 71
An Tao, Yueqi Duan, Yi Wei, Jiwen Lu, Jie Zhou: SegGroup: Seg-Level Supervision for 3D Instance and Semantic Segmentation. TIP 2022
3D-SISpermissive0.382 701.000 10.432 770.245 700.190 720.577 680.013 670.263 720.033 750.320 680.240 710.075 710.422 660.857 530.117 750.699 570.271 760.883 670.235 70
Ji Hou, Angela Dai, Matthias Niessner: 3D-SIS: 3D Semantic Instance Segmentation of RGB-D Scans. CVPR 2019
Hier3Dcopyleft0.323 710.667 640.542 730.264 690.157 750.550 700.000 730.205 750.009 770.270 710.218 720.075 710.500 580.688 670.007 810.698 580.301 730.459 780.200 72
Tan: HCFS3D: Hierarchical Coupled Feature Selection Network for 3D Semantic and Instance Segmentation.
UNet-backbone0.319 720.667 640.715 630.233 710.189 730.479 760.008 680.218 730.067 740.201 740.173 730.107 690.123 760.438 720.150 720.615 690.355 690.916 630.093 80
R-PointNet0.306 730.500 760.405 780.311 660.348 650.589 660.054 600.068 780.126 700.283 700.290 680.028 760.219 740.214 750.331 670.396 780.275 740.821 710.245 69
Region-18class0.284 740.250 800.751 590.228 730.270 690.521 720.000 730.468 670.008 790.205 730.127 740.000 800.068 780.070 790.262 710.652 650.323 710.740 740.173 73
SemRegionNet-20cls0.250 750.333 770.613 700.229 720.163 740.493 730.000 730.304 710.107 710.147 770.100 760.052 740.231 720.119 770.039 770.445 760.325 700.654 750.141 76
tmp0.248 760.667 640.437 760.188 740.153 760.491 740.000 730.208 740.094 730.153 760.099 770.057 730.217 750.119 770.039 770.466 750.302 720.640 760.140 77
3D-BEVIS0.248 760.667 640.566 710.076 790.035 810.394 790.027 650.035 800.098 720.099 790.030 800.025 770.098 770.375 740.126 740.604 700.181 790.854 700.171 74
Cathrin Elich, Francis Engelmann, Jonas Schult, Theodora Kontogianni, Bastian Leibe: 3D-BEVIS: Birds-Eye-View Instance Segmentation.
Sem_Recon_ins0.227 780.764 630.486 750.069 800.098 780.426 780.017 660.067 790.015 760.172 750.100 750.096 700.054 800.183 760.135 730.366 790.260 780.614 770.168 75
ASIS0.199 790.333 770.253 800.167 770.140 770.438 770.000 730.177 760.008 780.121 780.069 780.004 790.231 730.429 730.036 790.445 770.273 750.333 800.119 79
Sgpn_scannet0.143 800.208 810.390 790.169 760.065 790.275 800.029 640.069 770.000 800.087 800.043 790.014 780.027 810.000 800.112 760.351 800.168 800.438 790.138 78
MaskRCNN 2d->3d Proj0.058 810.333 770.002 810.000 810.053 800.002 810.002 720.021 810.000 800.045 810.024 810.238 620.065 790.000 800.014 800.107 810.020 810.110 810.006 81