Benchmark Results - ScanNet Benchmark

This table lists the benchmark results for the ScanNet200 3D semantic label scenario.

Method	avg iou	head iou	common iou	tail iou	wall	chair	floor	table	door	couch	cabinet	shelf	desk	office chair	bed	pillow	sink	picture	window	toilet	bookshelf	monitor	curtain	book	coffee table	box	refrigerator	lamp	kitchen cabinet	towel	clothes	tv	nightstand	counter	dresser	stool	cushion	plant	ceiling	bathtub	end table	dining table	keyboard	bag	backpack	toilet paper	printer	tv stand	whiteboard	blanket	shower curtain	trash can	closet	stairs	microwave	stove	shoe	computer tower	bottle	bin	bench	board	washing machine	mirror	copier	basket	sofa chair	file cabinet	fan	laptop	shower	paper	person	paper towel dispenser	oven	blinds	rack	plate	blackboard	piano	suitcase	radiator	recycling bin	wardrobe	soap dispenser	telephone	bucket	clock	stand	light	laundry basket	pipe	clothes dryer	seat	speaker	column	bicycle	ladder	bathroom stall	shower wall	cup	jacket	storage bin	coffee maker	dishwasher	paper towel roll	machine	mat	windowsill	bar	toaster	bulletin board	ironing board	kitchen counter	doorframe	toilet paper dispenser	mini fridge	fire extinguisher	ball	hat	shower curtain rod	water cooler	paper cutter	tray	ledge	mouse	cart	storage container	scale	tissue box	light switch	power outlet	decoration	sign	projector	vacuum cleaner	candle	plunger	stuffed animal	headphones	dish rack	broom	range hood	water bottle	vent	shower floor	water pitcher	mailbox	bowl	paper bag	music stand	projector screen	laundry detergent	object	bathroom vanity	laundry hamper	bathroom stall door	ceiling light	trash bin	dumbbell	stair rail	tube	bathroom cabinet	closet rod	coffee kettle	structure	shower head	keyboard piano	case of water bottles	coat rack	storage organizer	folded chair	fire alarm	power strip	calendar	poster

ALS-MinkowskiNet	0.414 2	0.610 2	0.322 3	0.271 2	0.852 1	0.710 2	0.973 1	0.572 4	0.719 3	0.795 2	0.477 6	0.506 2	0.601 3	0.000 14	0.804 5	0.646 3	0.804 2	0.344 2	0.777 1	0.984 1	0.671 1	0.879 2	0.936 1	0.342 5	0.632 7	0.449 4	0.817 3	0.475 10	0.723 2	0.798 1	0.376 8	0.832 2	0.693 1	0.031 9	0.564 1	0.510 13	0.000 1	0.893 3	0.905 1	0.672 16	0.314 1	0.000 7	0.718 1	0.153 3	0.542 2	0.397 3	0.726 3	0.752 8	0.252 8	0.226 2	0.916 2	0.800 1	0.047 16	0.807 3	0.769 1	0.709 3	0.630 3	0.769 1	0.217 10	0.000 3	0.285 1	0.598 4	0.846 10	0.535 1	0.956 4	0.000 7	0.137 11	0.784 2	0.464 7	0.463 13	0.230 12	0.000 1	0.598 3	0.662 9	0.000 4	0.087 2	0.000 1	0.135 3	0.900 2	0.780 11	0.703 2	0.741 1	0.571 2	0.149 9	0.697 7	0.646 2	0.000 3	0.076 2	0.000 1	0.025 11	0.000 4	0.106 6	0.981 1	0.000 1	0.043 7	0.113 4	0.888 2	0.248 15	0.404 4	0.252 6	0.314 1	0.220 7	0.245 2	0.466 7	0.366 2	0.159 2	0.000 4	0.149 8	0.690 2	0.000 3	0.531 5	0.253 3	0.285 6	0.460 1	0.440 5	0.813 1	0.230 3	0.283 6	0.159 11	0.000 1	0.728 1	0.666 5	0.958 1	0.000 1	0.021 5	0.252 8	0.118 5	0.000 7	0.445 3	0.223 10	0.285 1	0.194 3	0.390 2	0.000 1	0.475 4	0.842 7	0.000 1	0.455 3	0.000 1	0.250 7	0.458 8	0.000 1	0.865 1	0.000 1	0.000 1	0.635 1	0.359 5	0.972 1	0.087 3	0.447 1	0.000 1	0.000 9	0.000 1	0.129 2	0.532 6	0.446 8	0.503 5	0.071 13	0.135 12	0.699 4	0.717 2	0.097 2	0.000 1	0.665 1	0.000 2	0.000 2	1.000 1	0.752 6	0.000 3	0.000 1	0.000 1	0.142 9	0.200 1	0.259 1	1.000 1	0.000 1
Guangda Ji, Silvan Weder, Francis Engelmann, Marc Pollefeys, Hermann Blum: ARKit LabelMaker: A New Scale for Indoor 3D Scene Understanding. CVPR 2025
BFANet ScanNet200	0.360 5	0.553 7	0.293 5	0.193 5	0.827 4	0.689 4	0.970 3	0.528 13	0.661 6	0.753 6	0.436 8	0.378 8	0.469 15	0.042 7	0.810 3	0.654 2	0.760 4	0.266 10	0.659 10	0.973 4	0.574 3	0.849 11	0.897 5	0.382 3	0.546 13	0.372 9	0.698 14	0.491 9	0.617 10	0.526 10	0.436 1	0.764 14	0.476 17	0.101 5	0.409 6	0.585 10	0.000 1	0.835 6	0.901 3	0.810 5	0.102 14	0.000 7	0.688 2	0.096 6	0.483 10	0.264 12	0.612 9	0.591 16	0.358 2	0.161 6	0.863 5	0.707 4	0.128 4	0.814 2	0.669 4	0.629 10	0.563 4	0.651 14	0.258 5	0.000 3	0.194 10	0.494 9	0.806 12	0.394 6	0.953 5	0.000 7	0.233 1	0.757 4	0.508 6	0.556 4	0.476 4	0.000 1	0.573 5	0.741 6	0.000 4	0.000 9	0.000 1	0.000 6	0.000 17	0.852 5	0.678 3	0.616 6	0.460 5	0.338 3	0.710 5	0.534 5	0.000 3	0.025 4	0.000 1	0.043 3	0.000 4	0.056 12	0.493 17	0.000 1	0.000 10	0.109 5	0.785 7	0.590 6	0.298 13	0.282 3	0.143 13	0.262 4	0.053 11	0.526 4	0.337 5	0.215 1	0.000 4	0.135 9	0.510 4	0.000 3	0.596 4	0.043 14	0.511 3	0.321 12	0.459 3	0.772 2	0.124 13	0.060 14	0.266 6	0.000 1	0.574 9	0.568 9	0.653 10	0.000 1	0.093 1	0.298 4	0.239 3	0.000 7	0.516 2	0.129 14	0.284 2	0.000 8	0.431 1	0.000 1	0.000 5	0.848 6	0.000 1	0.492 1	0.000 1	0.376 3	0.522 6	0.000 1	0.469 17	0.000 1	0.000 1	0.330 6	0.151 10	0.875 14	0.000 9	0.254 4	0.000 1	0.000 9	0.000 1	0.088 13	0.661 1	0.481 5	0.255 12	0.105 1	0.139 9	0.666 5	0.641 5	0.000 12	0.000 1	0.614 2	0.000 2	0.000 2	0.000 11	0.921 2	0.000 3	0.000 1	0.000 1	0.497 1	0.000 7	0.000 3	0.000 11	0.000 1
Weiguang Zhao, Rui Zhang, Qiufeng Wang, Guangliang Cheng, Kaizhu Huang: BFANet: Revisiting 3D Semantic Segmentation with Boundary Feature Analysis. CVPR 2025
PTv3 ScanNet200	0.393 3	0.592 3	0.330 2	0.216 3	0.851 2	0.687 6	0.971 2	0.586 2	0.755 1	0.752 7	0.505 2	0.404 7	0.575 5	0.000 14	0.848 2	0.616 4	0.761 3	0.349 1	0.738 3	0.978 3	0.546 6	0.860 8	0.926 3	0.346 4	0.654 3	0.384 7	0.828 1	0.523 4	0.699 3	0.583 6	0.387 7	0.822 3	0.688 2	0.118 4	0.474 3	0.603 5	0.000 1	0.832 8	0.903 2	0.753 9	0.140 10	0.000 7	0.650 3	0.109 5	0.520 3	0.457 2	0.497 10	0.871 4	0.281 4	0.192 5	0.887 4	0.748 3	0.168 2	0.727 7	0.733 2	0.740 1	0.644 2	0.714 5	0.190 13	0.000 3	0.256 3	0.449 10	0.914 1	0.514 2	0.759 15	0.337 1	0.172 6	0.692 7	0.617 3	0.636 1	0.325 7	0.000 1	0.641 2	0.782 2	0.000 4	0.065 3	0.000 1	0.000 6	0.842 4	0.903 2	0.661 4	0.662 3	0.612 1	0.405 2	0.731 4	0.566 4	0.000 3	0.000 7	0.000 1	0.017 15	0.301 1	0.088 7	0.941 3	0.000 1	0.077 4	0.000 10	0.717 8	0.790 2	0.310 12	0.026 17	0.264 4	0.349 1	0.220 5	0.397 12	0.366 2	0.115 13	0.000 4	0.337 1	0.463 6	0.000 3	0.531 5	0.218 4	0.593 2	0.455 2	0.469 2	0.708 3	0.210 4	0.592 4	0.108 16	0.000 1	0.728 1	0.682 3	0.671 8	0.000 1	0.000 11	0.407 1	0.136 4	0.022 3	0.575 1	0.436 4	0.259 3	0.428 1	0.048 6	0.000 1	0.000 5	0.879 5	0.000 1	0.480 2	0.000 1	0.133 9	0.597 2	0.000 1	0.690 2	0.000 1	0.000 1	0.009 16	0.000 15	0.921 3	0.000 9	0.151 5	0.000 1	0.000 9	0.000 1	0.109 8	0.494 11	0.622 2	0.394 9	0.073 12	0.141 7	0.798 2	0.528 8	0.026 5	0.000 1	0.551 5	0.000 2	0.000 2	0.134 7	0.717 8	0.000 3	0.000 1	0.000 1	0.188 4	0.000 7	0.000 3	0.791 3	0.000 1
Xiaoyang Wu, Li Jiang, Peng-Shuai Wang, Zhijian Liu, Xihui Liu, Yu Qiao, Wanli Ouyang, Tong He, Hengshuang Zhao: Point Transformer V3: Simpler, Faster, Stronger. CVPR 2024 (Oral)
PonderV2 ScanNet200	0.346 6	0.552 8	0.270 8	0.175 9	0.810 7	0.682 9	0.950 5	0.560 7	0.641 10	0.761 3	0.398 13	0.357 10	0.570 8	0.113 2	0.804 5	0.603 6	0.750 7	0.283 4	0.681 7	0.952 5	0.548 5	0.874 4	0.852 13	0.290 12	0.700 2	0.356 11	0.792 5	0.445 12	0.545 13	0.436 12	0.351 12	0.787 10	0.611 8	0.050 8	0.290 14	0.519 12	0.000 1	0.825 10	0.888 5	0.842 3	0.259 3	0.100 2	0.558 7	0.070 12	0.497 7	0.247 14	0.457 11	0.889 3	0.248 9	0.106 10	0.817 13	0.691 6	0.094 7	0.729 6	0.636 6	0.620 12	0.503 11	0.660 13	0.243 7	0.000 3	0.212 7	0.590 5	0.860 8	0.400 5	0.881 9	0.000 7	0.202 2	0.622 10	0.408 11	0.499 8	0.261 10	0.000 1	0.385 10	0.636 10	0.000 4	0.000 9	0.000 1	0.000 6	0.433 16	0.843 6	0.660 6	0.574 12	0.481 4	0.336 4	0.677 9	0.486 6	0.000 3	0.030 3	0.000 1	0.034 6	0.000 4	0.080 8	0.869 10	0.000 1	0.000 10	0.000 10	0.540 10	0.727 3	0.232 17	0.115 11	0.186 10	0.193 9	0.000 14	0.403 11	0.326 6	0.103 14	0.000 4	0.290 4	0.392 9	0.000 3	0.346 10	0.062 10	0.424 5	0.375 7	0.431 6	0.667 4	0.115 14	0.082 12	0.239 7	0.000 1	0.504 12	0.606 8	0.584 12	0.000 1	0.002 9	0.186 10	0.104 10	0.000 7	0.394 5	0.384 6	0.083 8	0.000 8	0.007 9	0.000 1	0.000 5	0.880 4	0.000 1	0.377 10	0.000 1	0.263 6	0.565 3	0.000 1	0.608 9	0.000 1	0.000 1	0.304 7	0.009 11	0.924 2	0.000 9	0.000 11	0.000 1	0.000 9	0.000 1	0.128 3	0.584 2	0.475 7	0.412 8	0.076 11	0.269 3	0.621 6	0.509 9	0.010 7	0.000 1	0.491 11	0.063 1	0.000 2	0.472 4	0.880 4	0.000 3	0.000 1	0.000 1	0.179 5	0.125 2	0.000 3	0.441 10	0.000 1
Haoyi Zhu, Honghui Yang, Xiaoyang Wu, Di Huang, Sha Zhang, Xianglong He, Tong He, Hengshuang Zhao, Chunhua Shen, Yu Qiao, Wanli Ouyang: PonderV2: Pave the Way for 3D Foundataion Model with A Universal Pre-training Paradigm.
CeCo	0.340 7	0.551 9	0.247 13	0.181 6	0.784 13	0.661 14	0.939 13	0.564 6	0.624 13	0.721 12	0.484 5	0.429 5	0.575 5	0.027 8	0.774 11	0.503 14	0.753 5	0.242 13	0.656 11	0.945 9	0.534 7	0.865 7	0.860 11	0.177 17	0.616 8	0.400 5	0.818 2	0.579 1	0.615 11	0.367 14	0.408 6	0.726 15	0.633 5	0.162 1	0.360 9	0.619 3	0.000 1	0.828 9	0.873 9	0.924 2	0.109 13	0.083 3	0.564 6	0.057 15	0.475 12	0.266 11	0.781 2	0.767 7	0.257 7	0.100 11	0.825 11	0.663 10	0.048 15	0.620 13	0.551 12	0.595 13	0.532 7	0.692 8	0.246 6	0.000 3	0.213 6	0.615 2	0.861 7	0.376 7	0.900 8	0.000 7	0.102 15	0.660 8	0.321 15	0.547 5	0.226 13	0.000 1	0.311 13	0.742 5	0.011 3	0.006 8	0.000 1	0.000 6	0.546 15	0.824 8	0.345 14	0.665 2	0.450 6	0.435 1	0.683 8	0.411 8	0.338 1	0.000 7	0.000 1	0.030 9	0.000 4	0.068 9	0.892 8	0.000 1	0.063 5	0.000 10	0.257 13	0.304 13	0.387 6	0.079 14	0.228 6	0.190 11	0.000 14	0.586 1	0.347 4	0.133 7	0.000 4	0.037 13	0.377 10	0.000 3	0.384 8	0.006 16	0.003 13	0.421 5	0.410 10	0.643 5	0.171 9	0.121 9	0.142 12	0.000 1	0.510 11	0.447 11	0.474 14	0.000 1	0.000 11	0.286 5	0.083 11	0.000 7	0.000 10	0.603 1	0.096 7	0.063 5	0.000 11	0.000 1	0.000 5	0.898 3	0.000 1	0.429 7	0.000 1	0.400 2	0.550 4	0.000 1	0.633 6	0.000 1	0.000 1	0.377 5	0.000 15	0.916 4	0.000 9	0.000 11	0.000 1	0.000 9	0.000 1	0.102 12	0.499 9	0.296 14	0.463 6	0.089 5	0.304 1	0.740 3	0.401 16	0.010 7	0.000 1	0.560 4	0.000 2	0.000 2	0.709 2	0.652 10	0.000 3	0.000 1	0.000 1	0.143 8	0.000 7	0.000 3	0.609 5	0.000 1
Zhisheng Zhong, Jiequan Cui, Yibo Yang, Xiaoyang Wu, Xiaojuan Qi, Xiangyu Zhang, Jiaya Jia: Understanding Imbalanced Semantic Segmentation Through Neural Collapse. CVPR 2023
DITR	0.449 1	0.629 1	0.392 1	0.289 1	0.851 2	0.727 1	0.969 4	0.600 1	0.741 2	0.805 1	0.519 1	0.480 3	0.636 1	0.014 10	0.867 1	0.680 1	0.849 1	0.318 3	0.753 2	0.982 2	0.508 12	0.871 6	0.934 2	0.482 1	0.596 11	0.551 2	0.804 4	0.508 6	0.729 1	0.718 2	0.417 4	0.886 1	0.664 3	0.000 17	0.500 2	0.698 1	0.000 1	0.913 1	0.901 3	0.766 7	0.113 12	0.000 7	0.617 5	0.168 2	0.650 1	0.477 1	0.826 1	0.962 1	0.348 3	0.300 1	0.947 1	0.776 2	0.160 3	0.889 1	0.651 5	0.720 2	0.700 1	0.728 3	0.317 1	0.000 3	0.238 5	0.664 1	0.869 4	0.514 2	0.998 1	0.313 3	0.138 10	0.815 1	0.828 1	0.622 2	0.421 5	0.000 1	0.823 1	0.817 1	0.000 4	0.000 9	0.000 1	0.157 2	0.866 3	0.991 1	0.805 1	0.660 4	0.571 2	0.043 12	0.709 6	0.642 3	0.000 3	0.000 7	0.000 1	0.028 10	0.018 3	0.134 3	0.967 2	0.000 1	0.150 2	0.130 2	0.949 1	0.855 1	0.580 1	0.262 5	0.314 1	0.230 5	0.222 4	0.498 5	0.367 1	0.153 3	0.869 1	0.334 2	0.397 8	0.000 3	0.904 1	0.486 2	1.000 1	0.423 4	0.484 1	0.632 6	0.716 1	0.733 2	0.862 1	0.000 1	0.433 14	0.710 1	0.851 2	0.000 1	0.034 4	0.315 3	0.385 1	0.000 7	0.001 9	0.268 9	0.066 11	0.000 8	0.278 4	0.000 1	0.978 1	0.839 8	0.000 1	0.448 4	0.000 1	0.579 1	0.403 12	0.000 1	0.647 3	0.000 1	0.000 1	0.411 3	0.315 6	0.904 7	0.420 1	0.392 2	0.000 1	0.091 6	0.000 1	0.128 3	0.564 3	0.591 3	0.568 2	0.079 9	0.139 9	1.000 1	0.714 3	0.178 1	0.000 1	0.606 3	0.000 2	0.000 2	0.148 6	0.983 1	0.000 3	0.000 1	0.000 1	0.374 2	0.000 7	0.000 3	0.662 4	0.000 1
Karim Abou Zeid, Kadir Yilmaz, Daan de Geus, Alexander Hermans, David Adrian, Timm Linder, Bastian Leibe: DINO in the Room: Leveraging 2D Foundation Models for 3D Segmentation.
OctFormer ScanNet200	0.326 13	0.539 10	0.265 10	0.131 12	0.806 8	0.670 12	0.943 9	0.535 12	0.662 4	0.705 16	0.423 9	0.407 6	0.505 13	0.003 11	0.765 13	0.582 7	0.686 15	0.227 16	0.680 8	0.943 10	0.601 2	0.854 10	0.892 6	0.335 6	0.417 17	0.357 10	0.724 10	0.453 11	0.632 7	0.596 5	0.432 3	0.783 11	0.512 16	0.021 12	0.244 15	0.637 2	0.000 1	0.787 12	0.873 9	0.743 11	0.000 17	0.000 7	0.534 9	0.110 4	0.499 6	0.289 10	0.626 7	0.620 12	0.168 15	0.204 4	0.849 10	0.679 8	0.117 5	0.633 11	0.684 3	0.650 8	0.552 5	0.684 9	0.312 3	0.000 3	0.175 11	0.429 11	0.865 5	0.413 4	0.837 12	0.000 7	0.145 8	0.626 9	0.451 8	0.487 11	0.513 3	0.000 1	0.529 7	0.613 12	0.000 4	0.033 6	0.000 1	0.000 6	0.828 5	0.871 3	0.622 9	0.587 9	0.411 7	0.137 10	0.645 14	0.343 12	0.000 3	0.000 7	0.000 1	0.022 13	0.000 4	0.026 17	0.829 11	0.000 1	0.022 8	0.089 6	0.842 4	0.253 14	0.318 11	0.296 2	0.178 11	0.291 3	0.224 3	0.584 2	0.200 14	0.132 8	0.000 4	0.128 11	0.227 13	0.000 3	0.230 13	0.047 11	0.149 8	0.331 10	0.412 9	0.618 7	0.164 10	0.102 11	0.522 3	0.000 1	0.655 4	0.378 12	0.469 15	0.000 1	0.000 11	0.000 12	0.105 9	0.000 7	0.000 10	0.483 3	0.000 12	0.000 8	0.028 8	0.000 1	0.000 5	0.906 1	0.000 1	0.339 15	0.000 1	0.000 12	0.457 9	0.000 1	0.612 8	0.000 1	0.000 1	0.408 4	0.000 15	0.900 10	0.000 9	0.000 11	0.000 1	0.029 8	0.000 1	0.074 15	0.455 15	0.479 6	0.427 7	0.079 9	0.140 8	0.496 8	0.414 14	0.022 6	0.000 1	0.471 13	0.000 2	0.000 2	0.000 11	0.722 7	0.000 3	0.000 1	0.000 1	0.138 13	0.000 7	0.000 3	0.000 11	0.000 1
Peng-Shuai Wang: OctFormer: Octree-based Transformers for 3D Point Clouds. SIGGRAPH 2023
PPT-SpUNet-F.T.	0.332 12	0.556 6	0.270 7	0.123 14	0.816 6	0.682 9	0.946 6	0.549 10	0.657 8	0.756 5	0.459 7	0.376 9	0.550 11	0.001 12	0.807 4	0.616 4	0.727 12	0.267 9	0.691 5	0.942 11	0.530 9	0.872 5	0.874 8	0.330 8	0.542 14	0.374 8	0.792 5	0.400 14	0.673 4	0.572 7	0.433 2	0.793 9	0.623 7	0.008 16	0.351 10	0.594 8	0.000 1	0.783 13	0.876 7	0.833 4	0.213 6	0.000 7	0.537 8	0.091 7	0.519 4	0.304 8	0.620 8	0.942 2	0.264 5	0.124 8	0.855 7	0.695 5	0.086 8	0.646 10	0.506 16	0.658 7	0.535 6	0.715 4	0.314 2	0.000 3	0.241 4	0.608 3	0.897 2	0.359 8	0.858 11	0.000 7	0.076 17	0.611 11	0.392 12	0.509 7	0.378 6	0.000 1	0.579 4	0.565 15	0.000 4	0.000 9	0.000 1	0.000 6	0.755 7	0.806 9	0.661 4	0.572 13	0.350 9	0.181 7	0.660 12	0.300 14	0.000 3	0.000 7	0.000 1	0.023 12	0.000 4	0.042 14	0.930 4	0.000 1	0.000 10	0.077 7	0.584 9	0.392 10	0.339 9	0.185 10	0.171 12	0.308 2	0.006 13	0.563 3	0.256 8	0.150 4	0.000 4	0.002 16	0.345 12	0.000 3	0.045 14	0.197 5	0.063 11	0.323 11	0.453 4	0.600 8	0.163 11	0.037 15	0.349 4	0.000 1	0.672 3	0.679 4	0.753 5	0.000 1	0.000 11	0.000 12	0.117 6	0.000 7	0.000 10	0.291 8	0.000 12	0.000 8	0.039 7	0.000 1	0.000 5	0.899 2	0.000 1	0.374 11	0.000 1	0.000 12	0.545 5	0.000 1	0.634 5	0.000 1	0.000 1	0.074 13	0.223 8	0.914 6	0.000 9	0.021 9	0.000 1	0.000 9	0.000 1	0.112 6	0.498 10	0.649 1	0.383 10	0.095 2	0.135 12	0.449 11	0.432 12	0.008 9	0.000 1	0.518 7	0.000 2	0.000 2	0.000 11	0.796 5	0.000 3	0.000 1	0.000 1	0.138 13	0.000 7	0.000 3	0.000 11	0.000 1
Xiaoyang Wu, Zhuotao Tian, Xin Wen, Bohao Peng, Xihui Liu, Kaicheng Yu, Hengshuang Zhao: Towards Large-scale 3D Representation Learning with Multi-dataset Point Prompt Training. CVPR 2024
IMFSegNet	0.334 9	0.532 13	0.251 11	0.179 7	0.799 11	0.683 8	0.940 10	0.555 8	0.631 12	0.740 11	0.406 10	0.336 13	0.560 9	0.062 4	0.795 7	0.518 12	0.733 10	0.274 5	0.646 13	0.947 8	0.458 17	0.848 13	0.862 10	0.305 10	0.649 4	0.284 13	0.713 13	0.495 8	0.626 8	0.527 9	0.363 9	0.820 5	0.574 13	0.010 14	0.411 4	0.597 7	0.000 1	0.842 4	0.873 9	0.704 14	0.246 4	0.000 7	0.495 11	0.041 16	0.486 9	0.305 7	0.444 12	0.604 15	0.134 16	0.055 16	0.852 9	0.633 13	0.076 9	0.792 4	0.612 8	0.573 17	0.484 12	0.668 12	0.216 12	0.000 3	0.197 9	0.518 6	0.784 13	0.344 12	0.908 7	0.283 4	0.190 4	0.599 13	0.439 10	0.496 10	0.569 2	0.000 1	0.392 9	0.776 3	0.000 4	0.064 4	0.000 1	0.000 6	0.710 9	0.756 12	0.508 11	0.512 16	0.159 15	0.034 14	0.773 2	0.363 10	0.000 3	0.000 7	0.000 1	0.032 7	0.000 4	0.029 16	0.648 16	0.000 1	0.000 10	0.000 10	0.830 6	0.595 4	0.274 15	0.228 8	0.206 8	0.188 12	0.000 14	0.425 9	0.237 11	0.123 12	0.000 4	0.277 6	0.214 14	0.003 1	0.610 2	0.044 12	0.124 10	0.320 14	0.408 11	0.594 9	0.196 7	0.213 7	0.139 13	0.000 1	0.615 6	0.618 6	0.839 3	0.000 1	0.014 6	0.260 6	0.080 12	0.025 2	0.000 10	0.139 12	0.135 5	0.035 7	0.000 11	0.000 1	0.793 2	0.799 9	0.000 1	0.357 13	0.000 1	0.369 5	0.359 13	0.000 1	0.512 15	0.000 1	0.000 1	0.120 12	0.424 2	0.903 8	0.027 5	0.091 6	0.000 1	0.245 5	0.000 1	0.073 16	0.457 14	0.340 12	0.191 15	0.021 15	0.009 17	0.322 15	0.608 6	0.060 3	0.000 1	0.494 10	0.000 2	0.000 2	0.068 10	0.624 11	0.000 3	0.000 1	0.000 1	0.139 11	0.047 4	0.000 3	0.561 7	0.000 1

GSTran	0.334 10	0.533 12	0.250 12	0.179 8	0.799 11	0.684 7	0.940 10	0.554 9	0.633 11	0.741 10	0.405 11	0.337 12	0.560 9	0.060 5	0.794 8	0.517 13	0.732 11	0.274 5	0.647 12	0.948 7	0.459 16	0.849 11	0.864 9	0.306 9	0.648 5	0.282 14	0.717 12	0.496 7	0.624 9	0.533 8	0.363 9	0.821 4	0.573 14	0.009 15	0.411 4	0.593 9	0.000 1	0.841 5	0.873 9	0.704 14	0.242 5	0.000 7	0.495 11	0.041 16	0.487 8	0.304 8	0.439 13	0.613 13	0.133 17	0.055 16	0.853 8	0.634 12	0.075 12	0.791 5	0.601 9	0.574 16	0.483 13	0.669 11	0.217 10	0.000 3	0.198 8	0.518 6	0.782 14	0.345 11	0.914 6	0.273 5	0.193 3	0.598 14	0.440 9	0.499 8	0.570 1	0.000 1	0.381 11	0.775 4	0.000 4	0.063 5	0.000 1	0.000 6	0.712 8	0.752 13	0.507 12	0.512 16	0.158 16	0.036 13	0.773 2	0.361 11	0.000 3	0.000 7	0.000 1	0.032 7	0.000 4	0.032 15	0.651 15	0.000 1	0.000 10	0.000 10	0.831 5	0.595 4	0.273 16	0.229 7	0.200 9	0.191 10	0.000 14	0.425 9	0.233 12	0.125 11	0.000 4	0.279 5	0.213 15	0.003 1	0.608 3	0.044 12	0.138 9	0.321 12	0.408 11	0.593 10	0.198 5	0.205 8	0.139 13	0.000 1	0.614 7	0.609 7	0.838 4	0.000 1	0.014 6	0.260 6	0.080 12	0.010 5	0.000 10	0.136 13	0.136 4	0.047 6	0.000 11	0.000 1	0.787 3	0.797 10	0.000 1	0.354 14	0.000 1	0.372 4	0.357 14	0.000 1	0.507 16	0.000 1	0.000 1	0.121 11	0.423 3	0.903 8	0.028 4	0.089 7	0.000 1	0.252 4	0.000 1	0.072 17	0.465 12	0.340 12	0.189 16	0.020 16	0.011 16	0.320 16	0.606 7	0.060 3	0.000 1	0.496 9	0.000 2	0.000 2	0.070 9	0.618 13	0.000 3	0.000 1	0.000 1	0.139 11	0.047 4	0.000 3	0.558 8	0.000 1

Minkowski 34D	0.253 16	0.463 16	0.154 17	0.102 16	0.771 16	0.650 16	0.932 15	0.483 16	0.571 16	0.710 15	0.331 16	0.250 16	0.492 14	0.044 6	0.703 16	0.419 17	0.606 17	0.227 16	0.621 16	0.865 17	0.531 8	0.771 17	0.813 14	0.291 11	0.484 15	0.242 16	0.612 17	0.282 17	0.440 17	0.351 15	0.299 15	0.622 16	0.593 11	0.027 11	0.293 13	0.310 17	0.000 1	0.757 14	0.858 14	0.737 12	0.150 9	0.164 1	0.368 17	0.084 8	0.381 16	0.142 17	0.357 15	0.720 10	0.214 12	0.092 14	0.724 16	0.596 17	0.056 14	0.655 9	0.525 14	0.581 15	0.352 17	0.594 15	0.056 17	0.000 3	0.014 17	0.224 15	0.772 15	0.205 17	0.720 16	0.000 7	0.159 7	0.531 16	0.163 17	0.294 16	0.136 17	0.000 1	0.169 16	0.589 14	0.000 4	0.000 9	0.000 1	0.002 4	0.663 10	0.466 17	0.265 17	0.582 10	0.337 10	0.016 15	0.559 15	0.084 17	0.000 3	0.000 7	0.000 1	0.036 5	0.000 4	0.125 5	0.670 13	0.000 1	0.102 3	0.071 8	0.164 15	0.406 9	0.386 7	0.046 16	0.068 17	0.159 15	0.117 6	0.284 16	0.111 16	0.094 16	0.000 4	0.000 17	0.197 16	0.000 3	0.044 15	0.013 15	0.002 14	0.228 17	0.307 17	0.588 11	0.025 17	0.545 5	0.134 15	0.000 1	0.655 4	0.302 14	0.282 17	0.000 1	0.060 2	0.000 12	0.035 17	0.000 7	0.000 10	0.097 17	0.000 12	0.000 8	0.005 10	0.000 1	0.000 5	0.096 17	0.000 1	0.334 16	0.000 1	0.000 12	0.274 16	0.000 1	0.513 14	0.000 1	0.000 1	0.280 8	0.194 9	0.897 11	0.000 9	0.000 11	0.000 1	0.000 9	0.000 1	0.108 9	0.279 17	0.189 16	0.141 17	0.059 14	0.272 2	0.307 17	0.445 10	0.003 10	0.000 1	0.353 15	0.000 2	0.026 1	0.000 11	0.581 15	0.001 2	0.000 1	0.000 1	0.093 17	0.002 6	0.000 3	0.000 11	0.000 1
C. Choy, J. Gwak, S. Savarese: 4D Spatio-Temporal ConvNets: Minkowski Convolutional Neural Networks. CVPR 2019
CSC-Pretrain	0.249 17	0.455 17	0.171 16	0.079 17	0.766 17	0.659 15	0.930 17	0.494 14	0.542 17	0.700 17	0.314 17	0.215 17	0.430 17	0.121 1	0.697 17	0.441 16	0.683 16	0.235 14	0.609 17	0.895 16	0.476 15	0.816 16	0.770 17	0.186 14	0.634 6	0.216 17	0.734 9	0.340 16	0.471 16	0.307 16	0.293 17	0.591 17	0.542 15	0.076 7	0.205 16	0.464 14	0.000 1	0.484 17	0.832 16	0.766 7	0.052 16	0.000 7	0.413 16	0.059 14	0.418 15	0.222 16	0.318 17	0.609 14	0.206 13	0.112 9	0.743 14	0.625 14	0.076 9	0.579 15	0.548 13	0.590 14	0.371 16	0.552 17	0.081 16	0.003 2	0.142 13	0.201 16	0.638 17	0.233 16	0.686 17	0.000 7	0.142 9	0.444 17	0.375 13	0.247 17	0.198 14	0.000 1	0.128 17	0.454 17	0.019 2	0.097 1	0.000 1	0.000 6	0.553 14	0.557 15	0.373 13	0.545 14	0.164 14	0.014 16	0.547 16	0.174 15	0.000 3	0.002 5	0.000 1	0.037 4	0.000 4	0.063 11	0.664 14	0.000 1	0.000 10	0.130 2	0.170 14	0.152 16	0.335 10	0.079 14	0.110 15	0.175 14	0.098 9	0.175 17	0.166 15	0.045 17	0.207 2	0.014 14	0.465 5	0.000 3	0.001 17	0.001 17	0.046 12	0.299 15	0.327 16	0.537 12	0.033 16	0.012 17	0.186 10	0.000 1	0.205 15	0.377 13	0.463 16	0.000 1	0.058 3	0.000 12	0.055 15	0.041 1	0.000 10	0.105 16	0.000 12	0.000 8	0.000 11	0.000 1	0.000 5	0.398 15	0.000 1	0.308 17	0.000 1	0.000 12	0.319 15	0.000 1	0.543 12	0.000 1	0.000 1	0.062 15	0.004 13	0.862 15	0.000 9	0.000 11	0.000 1	0.000 9	0.000 1	0.123 5	0.316 16	0.225 15	0.250 13	0.094 3	0.180 5	0.332 14	0.441 11	0.000 12	0.000 1	0.310 16	0.000 2	0.000 2	0.000 11	0.592 14	0.000 3	0.000 1	0.000 1	0.203 3	0.000 7	0.000 3	0.000 11	0.000 1
Ji Hou, Benjamin Graham, Matthias Nießner, Saining Xie: Exploring Data-Efficient 3D Scene Understanding with Contrastive Scene Contexts. CVPR 2021
AWCS	0.305 14	0.508 14	0.225 14	0.142 11	0.782 14	0.634 17	0.937 14	0.489 15	0.578 14	0.721 12	0.364 15	0.355 11	0.515 12	0.023 9	0.764 14	0.523 11	0.707 14	0.264 11	0.633 14	0.922 14	0.507 13	0.886 1	0.804 15	0.179 15	0.436 16	0.300 12	0.656 16	0.529 3	0.501 15	0.394 13	0.296 16	0.820 5	0.603 9	0.131 3	0.179 17	0.619 3	0.000 1	0.707 16	0.865 13	0.773 6	0.171 7	0.010 6	0.484 14	0.063 13	0.463 13	0.254 13	0.332 16	0.649 11	0.220 11	0.100 11	0.729 15	0.613 15	0.071 13	0.582 14	0.628 7	0.702 4	0.424 15	0.749 2	0.137 15	0.000 3	0.142 13	0.360 13	0.863 6	0.305 14	0.877 10	0.000 7	0.173 5	0.606 12	0.337 14	0.478 12	0.154 15	0.000 1	0.253 14	0.664 8	0.000 4	0.000 9	0.000 1	0.000 6	0.626 13	0.782 10	0.302 16	0.602 7	0.185 13	0.282 6	0.651 13	0.317 13	0.000 3	0.000 7	0.000 1	0.022 13	0.000 4	0.154 2	0.876 9	0.000 1	0.014 9	0.063 9	0.029 17	0.553 7	0.467 3	0.084 13	0.124 14	0.157 16	0.049 12	0.373 13	0.252 9	0.097 15	0.000 4	0.219 7	0.542 3	0.000 3	0.392 7	0.172 8	0.000 15	0.339 9	0.417 8	0.533 13	0.093 15	0.115 10	0.195 9	0.000 1	0.516 10	0.288 15	0.741 6	0.000 1	0.001 10	0.233 9	0.056 14	0.000 7	0.159 6	0.334 7	0.077 9	0.000 8	0.000 11	0.000 1	0.000 5	0.749 13	0.000 1	0.411 8	0.000 1	0.008 11	0.452 10	0.000 1	0.595 10	0.000 1	0.000 1	0.220 10	0.006 12	0.894 12	0.006 8	0.000 11	0.000 1	0.000 9	0.000 1	0.112 6	0.504 8	0.404 10	0.551 3	0.093 4	0.129 14	0.484 10	0.381 17	0.000 12	0.000 1	0.396 14	0.000 2	0.000 2	0.620 3	0.402 17	0.000 3	0.000 1	0.000 1	0.142 9	0.000 7	0.000 3	0.512 9	0.000 1
: Long-Tailed 3D Semantic Segmentation with Adaptive Weight Constraint and Sampling. ICRA 2024
OA-CNN-L_ScanNet200	0.333 11	0.558 5	0.269 9	0.124 13	0.821 5	0.703 3	0.946 6	0.569 5	0.662 4	0.748 9	0.487 3	0.455 4	0.572 7	0.000 14	0.789 9	0.534 9	0.736 9	0.271 8	0.713 4	0.949 6	0.498 14	0.877 3	0.860 11	0.332 7	0.706 1	0.474 3	0.788 7	0.406 13	0.637 6	0.495 11	0.355 11	0.805 7	0.592 12	0.015 13	0.396 8	0.602 6	0.000 1	0.799 11	0.876 7	0.713 13	0.276 2	0.000 7	0.493 13	0.080 9	0.448 14	0.363 5	0.661 4	0.833 6	0.262 6	0.125 7	0.823 12	0.665 9	0.076 9	0.720 8	0.557 10	0.637 9	0.517 9	0.672 10	0.227 8	0.000 3	0.158 12	0.496 8	0.843 11	0.352 10	0.835 13	0.000 7	0.103 14	0.711 5	0.527 4	0.526 6	0.320 8	0.000 1	0.568 6	0.625 11	0.067 1	0.000 9	0.000 1	0.001 5	0.806 6	0.836 7	0.621 10	0.591 8	0.373 8	0.314 5	0.668 10	0.398 9	0.003 2	0.000 7	0.000 1	0.016 16	0.024 2	0.043 13	0.906 6	0.000 1	0.052 6	0.000 10	0.384 12	0.330 12	0.342 8	0.100 12	0.223 7	0.183 13	0.112 7	0.476 6	0.313 7	0.130 9	0.196 3	0.112 12	0.370 11	0.000 3	0.234 12	0.071 9	0.160 7	0.403 6	0.398 13	0.492 14	0.197 6	0.076 13	0.272 5	0.000 1	0.200 16	0.560 10	0.735 7	0.000 1	0.000 11	0.000 12	0.110 8	0.002 6	0.021 8	0.412 5	0.000 12	0.000 8	0.000 11	0.000 1	0.000 5	0.794 11	0.000 1	0.445 5	0.000 1	0.022 10	0.509 7	0.000 1	0.517 13	0.000 1	0.000 1	0.001 17	0.245 7	0.915 5	0.024 6	0.089 7	0.000 1	0.262 3	0.000 1	0.103 11	0.524 7	0.392 11	0.515 4	0.013 17	0.251 4	0.411 13	0.662 4	0.001 11	0.000 1	0.473 12	0.000 2	0.000 2	0.150 5	0.699 9	0.000 3	0.000 1	0.000 1	0.166 6	0.000 7	0.024 2	0.000 11	0.000 1

ODIN - Sem200	0.368 4	0.562 4	0.297 4	0.207 4	0.800 10	0.669 13	0.940 10	0.575 3	0.654 9	0.749 8	0.487 3	0.589 1	0.609 2	0.001 12	0.769 12	0.561 8	0.752 6	0.274 5	0.682 6	0.926 13	0.554 4	0.833 14	0.921 4	0.389 2	0.599 10	0.591 1	0.787 8	0.550 2	0.657 5	0.610 4	0.334 13	0.803 8	0.661 4	0.090 6	0.408 7	0.373 15	0.000 1	0.912 2	0.796 17	0.501 17	0.169 8	0.000 7	0.641 4	0.196 1	0.380 17	0.397 3	0.641 5	0.740 9	0.862 1	0.213 3	0.857 6	0.685 7	0.216 1	0.578 16	0.557 10	0.685 5	0.523 8	0.581 16	0.312 3	0.000 3	0.065 15	0.000 17	0.871 3	0.359 8	0.988 2	0.321 2	0.090 16	0.704 6	0.631 2	0.393 15	0.246 11	0.000 1	0.482 8	0.565 15	0.000 4	0.000 9	0.000 1	0.181 1	0.913 1	0.468 16	0.632 8	0.642 5	0.259 11	0.000 17	0.832 1	0.663 1	0.000 3	0.081 1	0.000 1	0.048 2	0.000 4	0.376 1	0.898 7	0.000 1	0.157 1	0.000 10	0.870 3	0.000 17	0.400 5	0.265 4	0.242 5	0.227 6	0.539 1	0.370 14	0.214 13	0.129 10	0.000 4	0.131 10	0.054 17	0.000 3	0.358 9	0.491 1	0.462 4	0.434 3	0.346 15	0.454 15	0.316 2	0.814 1	0.828 2	0.000 1	0.000 17	0.220 17	0.612 11	0.000 1	0.000 11	0.373 2	0.378 2	0.000 7	0.429 4	0.152 11	0.077 9	0.166 4	0.202 5	0.000 1	0.000 5	0.441 14	0.000 1	0.440 6	0.000 1	0.000 12	0.655 1	0.000 1	0.626 7	0.000 1	0.000 1	0.228 9	0.487 1	0.784 16	0.000 9	0.301 3	0.000 1	0.426 2	0.000 1	0.108 9	0.460 13	0.590 4	0.775 1	0.088 6	0.119 15	0.485 9	0.791 1	0.000 12	0.000 1	0.256 17	0.000 2	0.000 2	0.000 11	0.885 3	0.303 1	0.000 1	0.000 1	0.127 16	0.000 7	0.000 3	0.894 2	0.000 1
Ayush Jain, Pushkal Katara, Nikolaos Gkanatsios, Adam W. Harley, Gabriel Sarch, Kriti Aggarwal, Vishrav Chaudhary, Katerina Fragkiadaki: ODIN: A Single Model for 2D and 3D Segmentation. CVPR 2024
LGround	0.272 15	0.485 15	0.184 15	0.106 15	0.778 15	0.676 11	0.932 15	0.479 17	0.572 15	0.718 14	0.399 12	0.265 15	0.453 16	0.085 3	0.745 15	0.446 15	0.726 13	0.232 15	0.622 15	0.901 15	0.512 11	0.826 15	0.786 16	0.178 16	0.549 12	0.277 15	0.659 15	0.381 15	0.518 14	0.295 17	0.323 14	0.777 12	0.599 10	0.028 10	0.321 11	0.363 16	0.000 1	0.708 15	0.858 14	0.746 10	0.063 15	0.022 5	0.457 15	0.077 10	0.476 11	0.243 15	0.402 14	0.397 17	0.233 10	0.077 15	0.720 17	0.610 16	0.103 6	0.629 12	0.437 17	0.626 11	0.446 14	0.702 6	0.190 13	0.005 1	0.058 16	0.322 14	0.702 16	0.244 15	0.768 14	0.000 7	0.134 12	0.552 15	0.279 16	0.395 14	0.147 16	0.000 1	0.207 15	0.612 13	0.000 4	0.000 9	0.000 1	0.000 6	0.658 11	0.566 14	0.323 15	0.525 15	0.229 12	0.179 8	0.467 17	0.154 16	0.000 3	0.002 5	0.000 1	0.051 1	0.000 4	0.127 4	0.703 12	0.000 1	0.000 10	0.216 1	0.112 16	0.358 11	0.547 2	0.187 9	0.092 16	0.156 17	0.055 10	0.296 15	0.252 9	0.143 5	0.000 4	0.014 14	0.398 7	0.000 3	0.028 16	0.173 7	0.000 15	0.265 16	0.348 14	0.415 16	0.179 8	0.019 16	0.218 8	0.000 1	0.597 8	0.274 16	0.565 13	0.000 1	0.012 8	0.000 12	0.039 16	0.022 3	0.000 10	0.117 15	0.000 12	0.000 8	0.000 11	0.000 1	0.000 5	0.324 16	0.000 1	0.384 9	0.000 1	0.000 12	0.251 17	0.000 1	0.566 11	0.000 1	0.000 1	0.066 14	0.404 4	0.886 13	0.199 2	0.000 11	0.000 1	0.059 7	0.000 1	0.136 1	0.540 5	0.127 17	0.295 11	0.085 7	0.143 6	0.514 7	0.413 15	0.000 12	0.000 1	0.498 8	0.000 2	0.000 2	0.000 11	0.623 12	0.000 3	0.000 1	0.000 1	0.132 15	0.000 7	0.000 3	0.000 11	0.000 1
David Rozenberszki, Or Litany, Angela Dai: Language-Grounded Indoor 3D Semantic Segmentation in the Wild. arXiv
L3DETR-ScanNet_200	0.336 8	0.533 11	0.279 6	0.155 10	0.801 9	0.689 4	0.946 6	0.539 11	0.660 7	0.759 4	0.380 14	0.333 14	0.583 4	0.000 14	0.788 10	0.529 10	0.740 8	0.261 12	0.679 9	0.940 12	0.525 10	0.860 8	0.883 7	0.226 13	0.613 9	0.397 6	0.720 11	0.512 5	0.565 12	0.620 3	0.417 4	0.775 13	0.629 6	0.158 2	0.298 12	0.579 11	0.000 1	0.835 6	0.883 6	0.927 1	0.114 11	0.079 4	0.511 10	0.073 11	0.508 5	0.312 6	0.629 6	0.861 5	0.192 14	0.098 13	0.908 3	0.636 11	0.032 17	0.563 17	0.514 15	0.664 6	0.505 10	0.697 7	0.225 9	0.000 3	0.264 2	0.411 12	0.860 8	0.321 13	0.960 3	0.058 6	0.109 13	0.776 3	0.526 5	0.557 3	0.303 9	0.000 1	0.339 12	0.712 7	0.000 4	0.014 7	0.000 1	0.000 6	0.638 12	0.856 4	0.641 7	0.579 11	0.107 17	0.119 11	0.661 11	0.416 7	0.000 3	0.000 7	0.000 1	0.007 17	0.000 4	0.067 10	0.910 5	0.000 1	0.000 10	0.000 10	0.463 11	0.448 8	0.294 14	0.324 1	0.293 3	0.211 8	0.108 8	0.448 8	0.068 17	0.141 6	0.000 4	0.330 3	0.699 1	0.000 3	0.256 11	0.192 6	0.000 15	0.355 8	0.418 7	0.209 17	0.146 12	0.679 3	0.101 17	0.000 1	0.503 13	0.687 2	0.671 8	0.000 1	0.000 11	0.174 11	0.117 6	0.000 7	0.122 7	0.515 2	0.104 6	0.259 2	0.312 3	0.000 1	0.000 5	0.765 12	0.000 1	0.369 12	0.000 1	0.183 8	0.422 11	0.000 1	0.646 4	0.000 1	0.000 1	0.565 2	0.001 14	0.125 17	0.010 7	0.002 10	0.000 1	0.487 1	0.000 1	0.075 14	0.548 4	0.420 9	0.233 14	0.082 8	0.138 11	0.430 12	0.427 13	0.000 12	0.000 1	0.549 6	0.000 2	0.000 2	0.074 8	0.409 16	0.000 3	0.000 1	0.000 1	0.152 7	0.051 3	0.000 3	0.598 6	0.000 1
Yanmin Wu, Qiankun Gao, Renrui Zhang, Jian Zhang: Language-Assisted 3D Scene Understanding. arXiv23.12

This table lists the benchmark results for the ScanNet200 3D semantic instance scenario.

Method	avg ap	head ap	common ap	tail ap	chair	table	door	couch	cabinet	shelf	desk	office chair	bed	pillow	sink	picture	window	toilet	bookshelf	monitor	curtain	book	coffee table	box	refrigerator	lamp	kitchen cabinet	towel	clothes	tv	nightstand	counter	dresser	stool	cushion	plant	ceiling	bathtub	end table	dining table	keyboard	bag	backpack	toilet paper	printer	tv stand	whiteboard	blanket	shower curtain	trash can	closet	stairs	microwave	stove	shoe	computer tower	bottle	bin	bench	board	washing machine	mirror	copier	basket	sofa chair	file cabinet	fan	laptop	shower	paper	person	paper towel dispenser	oven	blinds	rack	plate	blackboard	piano	suitcase	radiator	recycling bin	wardrobe	soap dispenser	telephone	bucket	clock	stand	light	laundry basket	pipe	clothes dryer	seat	speaker	column	bicycle	ladder	bathroom stall	shower wall	cup	jacket	storage bin	coffee maker	dishwasher	paper towel roll	machine	mat	windowsill	bar	toaster	bulletin board	ironing board	kitchen counter	doorframe	toilet paper dispenser	mini fridge	fire extinguisher	ball	hat	shower curtain rod	water cooler	paper cutter	tray	ledge	mouse	cart	storage container	scale	tissue box	light switch	power outlet	decoration	sign	projector	vacuum cleaner	candle	plunger	stuffed animal	headphones	dish rack	broom	range hood	water bottle	vent	shower floor	water pitcher	mailbox	bowl	paper bag	music stand	projector screen	laundry detergent	object	bathroom vanity	laundry hamper	bathroom stall door	ceiling light	trash bin	dumbbell	stair rail	tube	bathroom cabinet	closet rod	coffee kettle	structure	shower head	keyboard piano	case of water bottles	coat rack	storage organizer	folded chair	fire alarm	power strip	calendar	poster

Mask3D Scannet200	0.278 1	0.383 1	0.263 2	0.168 1	0.661 2	0.465 1	0.572 1	0.665 3	0.391 2	0.121 5	0.304 1	0.015 2	0.647 1	0.349 1	0.474 1	0.489 1	0.321 1	0.816 6	0.351 3	0.722 1	0.402 4	0.195 1	0.515 4	0.082 2	0.795 1	0.215 2	0.396 1	0.377 2	0.082 5	0.724 1	0.586 1	0.015 3	0.277 1	0.377 6	0.201 1	0.475 3	0.572 1	0.778 3	0.089 2	0.759 1	0.556 2	0.068 1	0.506 1	0.467 1	0.323 4	0.778 2	0.427 2	0.027 3	0.789 1	0.744 1	0.003 2	0.570 2	0.561 1	0.337 2	0.265 1	0.711 1	0.258 2	0.031 1	0.569 1	0.311 1	0.441 2	0.179 1	1.000 1	0.000 2	0.233 2	0.411 2	0.283 2	0.380 1	0.667 1	0.016 1	0.048 4	0.418 3	0.139 2	0.173 1	0.000 1	0.086 2	0.014 3	0.500 1	0.384 1	0.497 1	0.044 4	0.032 2	0.752 1	0.287 2	0.003 1	0.000 2	0.007 1	0.208 1	0.000 1	0.001 3	0.349 2	0.008 2	0.014 2	0.509 1	0.500 2	0.323 1	0.023 3	0.176 2	0.107 2	0.105 4	0.000 2	0.605 1	0.378 1	0.016 2	0.000 1	0.400 1	0.192 1	0.000 1	0.048 3	0.037 3	0.000 2	0.275 1	0.119 1	0.810 1	0.258 2	0.006 4	0.083 6	0.000 1	0.568 2	0.377 2	0.708 1	0.000 1	0.005 2	0.147 2	0.014 3	0.000 2	0.556 2	0.085 1	0.325 1	0.500 1	0.083 2	0.004 2	0.000 1	0.590 1	0.000 1	0.365 1	0.000 1	0.116 1	0.491 1	0.000 1	0.626 1	0.000 1	0.000 1	0.579 1	0.391 1	0.050 5	0.000 1	0.028 2	0.000 1	0.222 2	0.000 1	0.063 1	0.302 1	0.356 2	0.149 5	0.573 1	0.415 1	0.013 6	0.002 5	0.004 1	0.000 1	0.005 5	0.000 1	0.000 1	0.444 1	0.514 1	0.000 2	0.028 1	0.000 2	0.156 2	0.267 1	0.000 2	1.000 1	0.000 1
Jonas Schult, Francis Engelmann, Alexander Hermans, Or Litany, Siyu Tang, Bastian Leibe: Mask3D for 3D Semantic Instance Segmentation. ICRA 2023
ODIN - Ins200	0.265 2	0.349 2	0.268 1	0.163 2	0.485 6	0.366 4	0.549 2	0.492 6	0.421 1	0.229 1	0.265 3	0.003 3	0.609 2	0.297 2	0.320 2	0.327 2	0.251 3	0.848 4	0.314 5	0.526 3	0.324 5	0.138 2	0.529 2	0.178 1	0.440 5	0.186 6	0.306 2	0.546 1	0.160 1	0.494 4	0.476 3	0.016 2	0.231 3	0.594 1	0.000 3	0.615 1	0.357 3	0.630 4	0.141 1	0.167 3	0.665 1	0.054 2	0.360 2	0.451 2	0.610 1	0.769 4	0.640 1	0.032 2	0.746 2	0.698 2	0.040 1	0.389 4	0.550 2	0.371 1	0.257 2	0.617 4	0.310 1	0.000 3	0.481 3	0.022 5	0.463 1	0.160 2	1.000 1	0.125 1	0.193 3	0.267 3	0.253 3	0.156 3	0.000 5	0.000 2	0.332 1	0.606 2	0.444 1	0.000 2	0.000 1	0.281 1	1.000 1	0.417 3	0.344 2	0.238 6	0.218 1	0.000 3	0.655 3	0.506 1	0.000 2	0.052 1	0.000 3	0.091 3	0.000 1	0.035 1	0.370 1	0.000 3	0.000 3	0.250 2	0.903 1	0.037 6	0.031 1	0.221 1	0.197 1	0.285 1	0.037 1	0.191 6	0.200 3	0.083 1	0.000 1	0.200 3	0.115 2	0.000 1	0.250 1	0.552 1	0.278 1	0.077 2	0.107 2	0.389 2	0.674 1	0.565 1	0.278 1	0.000 1	0.361 6	0.333 4	0.361 4	0.000 1	0.000 3	0.438 1	0.451 1	0.000 2	1.000 1	0.074 2	0.204 2	0.250 2	0.250 1	0.000 3	0.000 1	0.493 2	0.000 1	0.083 5	0.000 1	0.000 3	0.317 2	0.000 1	0.481 2	0.000 1	0.000 1	0.188 3	0.333 2	0.345 2	0.000 1	0.333 1	0.000 1	0.333 1	0.000 1	0.035 3	0.266 2	0.478 1	0.506 1	0.054 3	0.205 3	0.119 5	0.067 2	0.000 2	0.000 1	0.210 1	0.000 1	0.000 1	0.000 2	0.389 2	0.097 1	0.000 2	0.000 2	0.111 3	0.000 2	0.000 2	0.889 2	0.000 1

Minkowski 34D Inst.	0.130 5	0.246 5	0.083 5	0.043 6	0.547 5	0.236 5	0.415 5	0.672 2	0.141 6	0.133 4	0.067 5	0.000 4	0.521 3	0.114 6	0.238 5	0.289 3	0.232 5	0.883 2	0.182 6	0.373 6	0.486 1	0.076 4	0.488 5	0.022 5	0.529 4	0.199 5	0.110 5	0.217 5	0.100 3	0.460 5	0.319 5	0.000 4	0.025 6	0.472 2	0.000 3	0.394 4	0.210 5	0.537 5	0.004 5	0.000 4	0.083 6	0.000 6	0.299 5	0.061 6	0.201 6	0.761 5	0.084 5	0.008 4	0.720 4	0.557 6	0.000 3	0.317 6	0.280 4	0.094 6	0.020 6	0.564 6	0.000 5	0.000 3	0.400 4	0.048 4	0.259 5	0.101 4	1.000 1	0.000 2	0.190 4	0.142 6	0.094 6	0.137 4	0.089 3	0.000 2	0.101 2	0.355 6	0.000 4	0.000 2	0.000 1	0.000 3	0.000 4	0.444 2	0.082 6	0.384 2	0.000 6	0.000 3	0.334 6	0.004 6	0.000 2	0.000 2	0.000 3	0.041 5	0.000 1	0.000 4	0.026 6	0.000 3	0.000 3	0.000 5	0.000 3	0.082 5	0.022 4	0.000 6	0.021 5	0.088 5	0.000 2	0.241 4	0.033 5	0.000 3	0.000 1	0.067 4	0.000 6	0.000 1	0.000 4	0.000 4	0.000 2	0.000 5	0.026 5	0.262 3	0.016 5	0.000 5	0.278 1	0.000 1	0.500 4	0.394 1	0.028 6	0.000 1	0.000 3	0.000 4	0.000 4	0.000 2	0.000 4	0.019 5	0.000 4	0.000 4	0.000 4	0.000 3	0.000 1	0.156 6	0.000 1	0.032 6	0.000 1	0.000 3	0.194 6	0.000 1	0.248 5	0.000 1	0.000 1	0.099 5	0.019 5	0.308 3	0.000 1	0.000 4	0.000 1	0.000 3	0.000 1	0.007 5	0.122 3	0.000 4	0.175 4	0.063 2	0.000 5	0.271 1	0.000 6	0.000 2	0.000 1	0.000 6	0.000 1	0.000 1	0.000 2	0.278 3	0.000 2	0.000 2	0.000 2	0.111 3	0.000 2	0.000 2	0.000 3	0.000 1
C. Choy, J. Gwak, S. Savarese: 4D Spatio-Temporal ConvNets: Minkowski Convolutional Neural Networks. CVPR 2019
TD3D Scannet200	0.211 3	0.332 3	0.177 3	0.103 3	0.662 1	0.413 2	0.463 3	0.705 1	0.192 4	0.145 2	0.266 2	0.215 1	0.452 5	0.209 3	0.222 6	0.219 6	0.315 2	0.893 1	0.380 2	0.617 2	0.439 2	0.047 5	0.646 1	0.080 3	0.610 3	0.253 1	0.237 3	0.293 3	0.135 2	0.379 6	0.494 2	0.048 1	0.252 2	0.451 3	0.184 2	0.483 2	0.395 2	0.852 1	0.083 3	0.551 2	0.278 3	0.036 3	0.337 3	0.266 3	0.544 2	0.963 1	0.079 6	0.039 1	0.740 3	0.604 3	0.000 3	0.586 1	0.283 3	0.282 3	0.059 3	0.633 3	0.028 3	0.004 2	0.559 2	0.309 2	0.420 3	0.028 6	1.000 1	0.000 2	0.456 1	0.411 1	0.372 1	0.060 5	0.046 4	0.000 2	0.040 5	0.694 1	0.083 3	0.000 2	0.000 1	0.000 3	0.000 4	0.083 5	0.252 3	0.260 5	0.200 2	0.160 1	0.669 2	0.111 3	0.000 2	0.000 2	0.006 2	0.169 2	0.000 1	0.007 2	0.296 3	0.032 1	0.074 1	0.139 4	0.000 3	0.321 2	0.031 2	0.108 3	0.088 3	0.157 2	0.000 2	0.231 5	0.026 6	0.000 3	0.000 1	0.356 2	0.052 3	0.000 1	0.240 2	0.147 2	0.000 2	0.015 3	0.046 4	0.144 4	0.073 4	0.414 2	0.222 5	0.000 1	0.806 1	0.343 3	0.486 3	0.000 1	0.008 1	0.038 3	0.083 2	0.002 1	0.028 3	0.074 2	0.032 3	0.150 3	0.039 3	0.008 1	0.000 1	0.250 5	0.000 1	0.125 4	0.000 1	0.052 2	0.260 4	0.000 1	0.143 6	0.000 1	0.000 1	0.543 2	0.207 3	0.404 1	0.000 1	0.003 3	0.000 1	0.000 3	0.000 1	0.037 2	0.093 5	0.272 3	0.342 2	0.039 5	0.281 2	0.249 3	0.224 1	0.000 2	0.000 1	0.074 2	0.000 1	0.000 1	0.000 2	0.278 3	0.000 2	0.000 2	0.889 1	0.323 1	0.000 2	0.014 1	0.000 3	0.000 1
Maksim Kolodiazhnyi, Anna Vorontsova, Anton Konushin, Danila Rukhovich: Top-Down Beats Bottom-Up in 3D Instance Segmentation. WACV 2024
LGround Inst.	0.154 4	0.275 4	0.108 4	0.060 4	0.573 3	0.381 3	0.434 4	0.654 4	0.190 5	0.141 3	0.097 4	0.000 4	0.503 4	0.180 4	0.252 4	0.242 5	0.242 4	0.881 3	0.448 1	0.494 4	0.429 3	0.078 3	0.364 6	0.024 4	0.654 2	0.213 4	0.222 4	0.239 4	0.099 4	0.616 2	0.363 4	0.000 4	0.092 4	0.444 4	0.000 3	0.383 5	0.209 6	0.815 2	0.030 4	0.000 4	0.166 4	0.002 5	0.295 6	0.099 5	0.364 3	0.778 2	0.177 4	0.001 5	0.427 6	0.585 5	0.000 3	0.470 3	0.268 6	0.205 4	0.045 4	0.642 2	0.007 4	0.000 3	0.333 6	0.148 3	0.407 4	0.130 3	1.000 1	0.000 2	0.156 5	0.189 4	0.097 5	0.169 2	0.000 5	0.000 2	0.056 3	0.400 4	0.000 4	0.000 2	0.000 1	0.000 3	0.556 2	0.278 4	0.203 4	0.323 4	0.019 5	0.000 3	0.402 5	0.026 4	0.000 2	0.000 2	0.000 3	0.044 4	0.000 1	0.000 4	0.037 5	0.000 3	0.000 3	0.181 3	0.000 3	0.127 3	0.006 5	0.028 5	0.023 4	0.115 3	0.000 2	0.327 2	0.267 2	0.000 3	0.000 1	0.000 5	0.028 4	0.000 1	0.000 4	0.000 4	0.000 2	0.003 4	0.048 3	0.135 5	0.222 3	0.089 3	0.278 1	0.000 1	0.514 3	0.333 4	0.611 2	0.000 1	0.000 3	0.000 4	0.000 4	0.000 2	0.000 4	0.037 4	0.000 4	0.000 4	0.000 4	0.000 3	0.000 1	0.322 3	0.000 1	0.209 2	0.000 1	0.000 3	0.278 3	0.000 1	0.302 4	0.000 1	0.000 1	0.143 4	0.148 4	0.000 6	0.000 1	0.000 4	0.000 1	0.000 3	0.000 1	0.015 4	0.064 6	0.000 4	0.272 3	0.031 6	0.000 5	0.257 2	0.028 3	0.000 2	0.000 1	0.041 3	0.000 1	0.000 1	0.000 2	0.222 6	0.000 2	0.000 2	0.000 2	0.000 6	0.000 2	0.000 2	0.000 3	0.000 1
David Rozenberszki, Or Litany, Angela Dai: Language-Grounded Indoor 3D Semantic Segmentation in the Wild.
CSC-Pretrain Inst.	0.123 6	0.223 6	0.082 6	0.046 5	0.564 4	0.152 6	0.394 6	0.578 5	0.235 3	0.116 6	0.034 6	0.000 4	0.348 6	0.119 5	0.297 3	0.285 4	0.202 6	0.838 5	0.323 4	0.407 5	0.184 6	0.037 6	0.516 3	0.013 6	0.424 6	0.214 3	0.093 6	0.105 6	0.078 6	0.542 3	0.250 6	0.000 4	0.064 5	0.444 4	0.000 3	0.224 6	0.231 4	0.537 5	0.001 6	0.000 4	0.126 5	0.004 4	0.308 4	0.193 4	0.244 5	0.343 6	0.228 3	0.000 6	0.441 5	0.588 4	0.000 3	0.338 5	0.275 5	0.189 5	0.030 5	0.600 5	0.000 5	0.000 3	0.378 5	0.000 6	0.108 6	0.098 5	1.000 1	0.000 2	0.096 6	0.172 5	0.144 4	0.011 6	0.125 2	0.000 2	0.000 6	0.376 5	0.000 4	0.000 2	0.000 1	0.000 3	0.000 4	0.042 6	0.141 5	0.377 3	0.051 3	0.000 3	0.483 4	0.017 5	0.000 2	0.000 2	0.000 3	0.022 6	0.000 1	0.000 4	0.065 4	0.000 3	0.000 3	0.000 5	0.000 3	0.094 4	0.000 6	0.042 4	0.000 6	0.064 6	0.000 2	0.259 3	0.089 4	0.000 3	0.000 1	0.000 5	0.022 5	0.000 1	0.000 4	0.000 4	0.000 2	0.000 5	0.018 6	0.111 6	0.000 6	0.000 5	0.278 1	0.000 1	0.444 5	0.333 4	0.333 5	0.000 1	0.000 3	0.000 4	0.000 4	0.000 2	0.000 4	0.000 6	0.000 4	0.000 4	0.000 4	0.000 3	0.000 1	0.267 4	0.000 1	0.184 3	0.000 1	0.000 3	0.211 5	0.000 1	0.378 3	0.000 1	0.000 1	0.063 6	0.000 6	0.275 4	0.000 1	0.000 4	0.000 1	0.000 3	0.000 1	0.007 6	0.105 4	0.000 4	0.032 6	0.045 4	0.198 4	0.171 4	0.028 3	0.000 2	0.000 1	0.006 4	0.000 1	0.000 1	0.000 2	0.278 3	0.000 2	0.000 2	0.000 2	0.044 5	0.000 2	0.000 2	0.000 3	0.000 1
Ji Hou, Benjamin Graham, Matthias Nießner, Saining Xie: Exploring Data-Efficient 3D Scene Understanding with Contrastive Scene Contexts. CVPR 2021

ScanNet Benchmark

This table lists the benchmark results for the 3D semantic label scenario.

Method	avg iou	bathtub	bed	bookshelf	cabinet	chair	counter	curtain	desk	door	floor	otherfurniture	picture	refrigerator	shower curtain	sink	sofa	table	toilet	wall	window

PTv3-PPT-ALC	0.798 1	0.911 11	0.812 22	0.854 8	0.770 12	0.856 15	0.555 17	0.943 1	0.660 26	0.735 2	0.979 1	0.606 7	0.492 1	0.792 4	0.934 4	0.841 2	0.819 6	0.716 9	0.947 10	0.906 1	0.822 1
Guangda Ji, Silvan Weder, Francis Engelmann, Marc Pollefeys, Hermann Blum: ARKit LabelMaker: A New Scale for Indoor 3D Scene Understanding. CVPR 2025
DITR ScanNet	0.797 2	0.727 76	0.869 1	0.882 1	0.785 6	0.868 7	0.578 5	0.943 1	0.744 1	0.727 3	0.979 1	0.627 2	0.364 9	0.824 1	0.949 2	0.779 15	0.844 1	0.757 1	0.982 1	0.905 2	0.802 3
Karim Abou Zeid, Kadir Yilmaz, Daan de Geus, Alexander Hermans, David Adrian, Timm Linder, Bastian Leibe: DINO in the Room: Leveraging 2D Foundation Models for 3D Segmentation.
PTv3 ScanNet	0.794 3	0.941 3	0.813 21	0.851 11	0.782 7	0.890 2	0.597 1	0.916 6	0.696 11	0.713 5	0.979 1	0.635 1	0.384 3	0.793 3	0.907 10	0.821 5	0.790 36	0.696 14	0.967 4	0.903 3	0.805 2
Xiaoyang Wu, Li Jiang, Peng-Shuai Wang, Zhijian Liu, Xihui Liu, Yu Qiao, Wanli Ouyang, Tong He, Hengshuang Zhao: Point Transformer V3: Simpler, Faster, Stronger. CVPR 2024 (Oral)
PonderV2	0.785 4	0.978 1	0.800 30	0.833 29	0.788 4	0.853 20	0.545 21	0.910 9	0.713 3	0.705 6	0.979 1	0.596 9	0.390 2	0.769 15	0.832 45	0.821 5	0.792 35	0.730 2	0.975 2	0.897 6	0.785 7
Haoyi Zhu, Honghui Yang, Xiaoyang Wu, Di Huang, Sha Zhang, Xianglong He, Tong He, Hengshuang Zhao, Chunhua Shen, Yu Qiao, Wanli Ouyang: PonderV2: Pave the Way for 3D Foundataion Model with A Universal Pre-training Paradigm.
Mix3D	0.781 5	0.964 2	0.855 2	0.843 20	0.781 8	0.858 13	0.575 8	0.831 39	0.685 17	0.714 4	0.979 1	0.594 10	0.310 30	0.801 2	0.892 19	0.841 2	0.819 6	0.723 6	0.940 15	0.887 8	0.725 28
Alexey Nekrasov, Jonas Schult, Or Litany, Bastian Leibe, Francis Engelmann: Mix3D: Out-of-Context Data Augmentation for 3D Scenes. 3DV 2021 (Oral)
Swin3D	0.779 6	0.861 23	0.818 16	0.836 26	0.790 3	0.875 4	0.576 7	0.905 10	0.704 7	0.739 1	0.969 12	0.611 3	0.349 12	0.756 25	0.958 1	0.702 51	0.805 19	0.708 10	0.916 39	0.898 5	0.801 4

TTT-KD	0.773 7	0.646 97	0.818 16	0.809 41	0.774 10	0.878 3	0.581 3	0.943 1	0.687 15	0.704 7	0.978 6	0.607 6	0.336 19	0.775 11	0.912 8	0.838 4	0.823 4	0.694 15	0.967 4	0.899 4	0.794 6
Lisa Weijler, Muhammad Jehanzeb Mirza, Leon Sick, Can Ekkazan, Pedro Hermosilla: TTT-KD: Test-Time Training for 3D Semantic Segmentation through Knowledge Distillation from Foundation Models.
ResLFE_HDS	0.772 8	0.939 4	0.824 7	0.854 8	0.771 11	0.840 35	0.564 13	0.900 12	0.686 16	0.677 14	0.961 18	0.537 36	0.348 13	0.769 15	0.903 12	0.785 13	0.815 9	0.676 26	0.939 16	0.880 13	0.772 11

PPT-SpUNet-Joint	0.766 9	0.932 5	0.794 36	0.829 31	0.751 26	0.854 18	0.540 25	0.903 11	0.630 39	0.672 17	0.963 16	0.565 26	0.357 10	0.788 5	0.900 14	0.737 31	0.802 20	0.685 20	0.950 8	0.887 8	0.780 8
Xiaoyang Wu, Zhuotao Tian, Xin Wen, Bohao Peng, Xihui Liu, Kaicheng Yu, Hengshuang Zhao: Towards Large-scale 3D Representation Learning with Multi-dataset Point Prompt Training. CVPR 2024
OctFormer	0.766 9	0.925 7	0.808 26	0.849 13	0.786 5	0.846 30	0.566 12	0.876 19	0.690 13	0.674 16	0.960 19	0.576 22	0.226 73	0.753 27	0.904 11	0.777 16	0.815 9	0.722 7	0.923 31	0.877 16	0.776 10
Peng-Shuai Wang: OctFormer: Octree-based Transformers for 3D Point Clouds. SIGGRAPH 2023
CU-Hybrid Net	0.764 11	0.924 8	0.819 14	0.840 23	0.757 21	0.853 20	0.580 4	0.848 31	0.709 5	0.643 27	0.958 23	0.587 16	0.295 38	0.753 27	0.884 23	0.758 23	0.815 9	0.725 5	0.927 27	0.867 27	0.743 19

OccuSeg+Semantic	0.764 11	0.758 61	0.796 34	0.839 24	0.746 30	0.907 1	0.562 14	0.850 30	0.680 19	0.672 17	0.978 6	0.610 4	0.335 21	0.777 9	0.819 49	0.847 1	0.830 3	0.691 17	0.972 3	0.885 10	0.727 26

O-CNN	0.762 13	0.924 8	0.823 8	0.844 19	0.770 12	0.852 22	0.577 6	0.847 33	0.711 4	0.640 31	0.958 23	0.592 11	0.217 79	0.762 20	0.888 20	0.758 23	0.813 13	0.726 4	0.932 25	0.868 26	0.744 18
Peng-Shuai Wang, Yang Liu, Yu-Xiao Guo, Chun-Yu Sun, Xin Tong: O-CNN: Octree-based Convolutional Neural Networks for 3D Shape Analysis. SIGGRAPH 2017
DiffSegNet	0.758 14	0.725 78	0.789 41	0.843 20	0.762 17	0.856 15	0.562 14	0.920 4	0.657 29	0.658 21	0.958 23	0.589 14	0.337 18	0.782 6	0.879 24	0.787 11	0.779 41	0.678 22	0.926 29	0.880 13	0.799 5

DTC	0.757 15	0.843 29	0.820 12	0.847 16	0.791 2	0.862 11	0.511 38	0.870 22	0.707 6	0.652 23	0.954 40	0.604 8	0.279 49	0.760 21	0.942 3	0.734 32	0.766 50	0.701 13	0.884 61	0.874 22	0.736 20

OA-CNN-L_ScanNet20	0.756 16	0.783 47	0.826 6	0.858 6	0.776 9	0.837 39	0.548 20	0.896 15	0.649 31	0.675 15	0.962 17	0.586 17	0.335 21	0.771 14	0.802 54	0.770 19	0.787 38	0.691 17	0.936 20	0.880 13	0.761 13

ConDaFormer	0.755 17	0.927 6	0.822 10	0.836 26	0.801 1	0.849 25	0.516 35	0.864 27	0.651 30	0.680 13	0.958 23	0.584 19	0.282 46	0.759 23	0.855 35	0.728 34	0.802 20	0.678 22	0.880 66	0.873 23	0.756 16
Lunhao Duan, Shanshan Zhao, Nan Xue, Mingming Gong, Guisong Xia, Dacheng Tao: ConDaFormer : Disassembled Transformer with Local Structure Enhancement for 3D Point Cloud Understanding. Neurips, 2023
LSK3DNet	0.755 17	0.899 16	0.823 8	0.843 20	0.764 16	0.838 38	0.584 2	0.845 34	0.717 2	0.638 33	0.956 30	0.580 21	0.229 72	0.640 49	0.900 14	0.750 26	0.813 13	0.729 3	0.920 35	0.872 24	0.757 14
Tuo Feng, Wenguan Wang, Fan Ma, Yi Yang: LSK3DNet: Towards Effective and Efficient 3D Perception with Large Sparse Kernels. CVPR 2024
PNE	0.755 17	0.786 45	0.835 5	0.834 28	0.758 19	0.849 25	0.570 10	0.836 38	0.648 32	0.668 19	0.978 6	0.581 20	0.367 7	0.683 40	0.856 33	0.804 8	0.801 24	0.678 22	0.961 6	0.889 7	0.716 35
P. Hermosilla: Point Neighborhood Embeddings.
PointTransformerV2	0.752 20	0.742 68	0.809 25	0.872 2	0.758 19	0.860 12	0.552 18	0.891 17	0.610 46	0.687 8	0.960 19	0.559 30	0.304 33	0.766 18	0.926 6	0.767 20	0.797 28	0.644 38	0.942 13	0.876 19	0.722 31
Xiaoyang Wu, Yixing Lao, Li Jiang, Xihui Liu, Hengshuang Zhao: Point Transformer V2: Grouped Vector Attention and Partition-based Pooling. NeurIPS 2022
DMF-Net	0.752 20	0.906 14	0.793 38	0.802 47	0.689 46	0.825 52	0.556 16	0.867 23	0.681 18	0.602 50	0.960 19	0.555 32	0.365 8	0.779 8	0.859 30	0.747 27	0.795 32	0.717 8	0.917 38	0.856 35	0.764 12
C.Yang, Y.Yan, W.Zhao, J.Ye, X.Yang, A.Hussain, B.Dong, K.Huang: Towards Deeper and Better Multi-view Feature Fusion for 3D Semantic Segmentation. ICONIP 2023
PointConvFormer	0.749 22	0.793 43	0.790 39	0.807 43	0.750 28	0.856 15	0.524 31	0.881 18	0.588 58	0.642 30	0.977 10	0.591 12	0.274 52	0.781 7	0.929 5	0.804 8	0.796 29	0.642 39	0.947 10	0.885 10	0.715 36
Wenxuan Wu, Qi Shan, Li Fuxin: PointConvFormer: Revenge of the Point-based Convolution.
BPNet	0.749 22	0.909 12	0.818 16	0.811 39	0.752 24	0.839 37	0.485 53	0.842 35	0.673 21	0.644 26	0.957 28	0.528 42	0.305 32	0.773 12	0.859 30	0.788 10	0.818 8	0.693 16	0.916 39	0.856 35	0.723 30
Wenbo Hu, Hengshuang Zhao, Li Jiang, Jiaya Jia, Tien-Tsin Wong: Bidirectional Projection Network for Cross Dimension Scene Understanding. CVPR 2021 (Oral)
MSP	0.748 24	0.623 100	0.804 28	0.859 5	0.745 31	0.824 54	0.501 42	0.912 8	0.690 13	0.685 10	0.956 30	0.567 25	0.320 27	0.768 17	0.918 7	0.720 39	0.802 20	0.676 26	0.921 33	0.881 12	0.779 9

StratifiedFormer	0.747 25	0.901 15	0.803 29	0.845 18	0.757 21	0.846 30	0.512 37	0.825 42	0.696 11	0.645 25	0.956 30	0.576 22	0.262 63	0.744 33	0.861 29	0.742 29	0.770 48	0.705 11	0.899 51	0.860 32	0.734 21
Xin Lai, Jianhui Liu, Li Jiang, Liwei Wang, Hengshuang Zhao, Shu Liu, Xiaojuan Qi, Jiaya Jia: Stratified Transformer for 3D Point Cloud Segmentation. CVPR 2022
Virtual MVFusion	0.746 26	0.771 55	0.819 14	0.848 15	0.702 43	0.865 10	0.397 91	0.899 13	0.699 9	0.664 20	0.948 62	0.588 15	0.330 23	0.746 32	0.851 39	0.764 21	0.796 29	0.704 12	0.935 21	0.866 28	0.728 24
Abhijit Kundu, Xiaoqi Yin, Alireza Fathi, David Ross, Brian Brewington, Thomas Funkhouser, Caroline Pantofaru: Virtual Multi-view Fusion for 3D Semantic Segmentation. ECCV 2020
VMNet	0.746 26	0.870 21	0.838 3	0.858 6	0.729 36	0.850 24	0.501 42	0.874 20	0.587 59	0.658 21	0.956 30	0.564 27	0.299 35	0.765 19	0.900 14	0.716 42	0.812 15	0.631 44	0.939 16	0.858 33	0.709 37
Zeyu HU, Xuyang Bai, Jiaxiang Shang, Runze Zhang, Jiayu Dong, Xin Wang, Guangyuan Sun, Hongbo Fu, Chiew-Lan Tai: VMNet: Voxel-Mesh Network for Geodesic-Aware 3D Semantic Segmentation. ICCV 2021 (Oral)
DiffSeg3D2	0.745 28	0.725 78	0.814 20	0.837 25	0.751 26	0.831 46	0.514 36	0.896 15	0.674 20	0.684 11	0.960 19	0.564 27	0.303 34	0.773 12	0.820 48	0.713 45	0.798 27	0.690 19	0.923 31	0.875 20	0.757 14

ODIN	0.744 29	0.658 93	0.752 64	0.870 3	0.714 40	0.843 33	0.569 11	0.919 5	0.703 8	0.622 40	0.949 59	0.591 12	0.343 15	0.736 34	0.784 56	0.816 7	0.838 2	0.672 31	0.918 37	0.854 39	0.725 28
Ayush Jain, Pushkal Katara, Nikolaos Gkanatsios, Adam W. Harley, Gabriel Sarch, Kriti Aggarwal, Vishrav Chaudhary, Katerina Fragkiadaki: ODIN: A Single Model for 2D and 3D Segmentation. CVPR 2024
Retro-FPN	0.744 29	0.842 30	0.800 30	0.767 61	0.740 32	0.836 41	0.541 23	0.914 7	0.672 22	0.626 37	0.958 23	0.552 33	0.272 54	0.777 9	0.886 22	0.696 52	0.801 24	0.674 29	0.941 14	0.858 33	0.717 33
Peng Xiang, Xin Wen, Yu-Shen Liu, Hui Zhang, Yi Fang, Zhizhong Han: Retrospective Feature Pyramid Network for Point Cloud Semantic Segmentation. ICCV 2023
EQ-Net	0.743 31	0.620 101	0.799 33	0.849 13	0.730 35	0.822 56	0.493 50	0.897 14	0.664 23	0.681 12	0.955 34	0.562 29	0.378 4	0.760 21	0.903 12	0.738 30	0.801 24	0.673 30	0.907 43	0.877 16	0.745 17
Zetong Yang, Li Jiang, Yanan Sun, Bernt Schiele, Jiaya JIa: A Unified Query-based Paradigm for Point Cloud Understanding. CVPR 2022
SAT	0.742 32	0.860 24	0.765 55	0.819 34	0.769 14	0.848 27	0.533 27	0.829 40	0.663 24	0.631 36	0.955 34	0.586 17	0.274 52	0.753 27	0.896 17	0.729 33	0.760 56	0.666 33	0.921 33	0.855 37	0.733 22

LRPNet	0.742 32	0.816 38	0.806 27	0.807 43	0.752 24	0.828 50	0.575 8	0.839 37	0.699 9	0.637 34	0.954 40	0.520 46	0.320 27	0.755 26	0.834 43	0.760 22	0.772 45	0.676 26	0.915 41	0.862 30	0.717 33

LargeKernel3D	0.739 34	0.909 12	0.820 12	0.806 45	0.740 32	0.852 22	0.545 21	0.826 41	0.594 57	0.643 27	0.955 34	0.541 35	0.263 62	0.723 38	0.858 32	0.775 18	0.767 49	0.678 22	0.933 23	0.848 43	0.694 42
Yukang Chen, Jianhui Liu, Xiangyu Zhang, Xiaojuan Qi, Jiaya Jia: LargeKernel3D: Scaling up Kernels in 3D Sparse CNNs. CVPR 2023
RPN	0.736 35	0.776 51	0.790 39	0.851 11	0.754 23	0.854 18	0.491 52	0.866 25	0.596 56	0.686 9	0.955 34	0.536 37	0.342 16	0.624 56	0.869 26	0.787 11	0.802 20	0.628 45	0.927 27	0.875 20	0.704 39

MinkowskiNet	0.736 35	0.859 25	0.818 16	0.832 30	0.709 41	0.840 35	0.521 33	0.853 29	0.660 26	0.643 27	0.951 51	0.544 34	0.286 44	0.731 36	0.893 18	0.675 61	0.772 45	0.683 21	0.874 73	0.852 41	0.727 26
C. Choy, J. Gwak, S. Savarese: 4D Spatio-Temporal ConvNets: Minkowski Convolutional Neural Networks. CVPR 2019
IPCA	0.731 37	0.890 17	0.837 4	0.864 4	0.726 37	0.873 5	0.530 30	0.824 43	0.489 93	0.647 24	0.978 6	0.609 5	0.336 19	0.624 56	0.733 64	0.758 23	0.776 43	0.570 71	0.949 9	0.877 16	0.728 24

online3d	0.727 38	0.715 83	0.777 48	0.854 8	0.748 29	0.858 13	0.497 47	0.872 21	0.572 66	0.639 32	0.957 28	0.523 43	0.297 37	0.750 30	0.803 53	0.744 28	0.810 16	0.587 67	0.938 18	0.871 25	0.719 32

PointTransformer++	0.725 39	0.727 76	0.811 24	0.819 34	0.765 15	0.841 34	0.502 41	0.814 48	0.621 42	0.623 39	0.955 34	0.556 31	0.284 45	0.620 58	0.866 27	0.781 14	0.757 60	0.648 36	0.932 25	0.862 30	0.709 37

SparseConvNet	0.725 39	0.647 96	0.821 11	0.846 17	0.721 38	0.869 6	0.533 27	0.754 64	0.603 52	0.614 42	0.955 34	0.572 24	0.325 25	0.710 39	0.870 25	0.724 37	0.823 4	0.628 45	0.934 22	0.865 29	0.683 45

MatchingNet	0.724 41	0.812 40	0.812 22	0.810 40	0.735 34	0.834 43	0.495 49	0.860 28	0.572 66	0.602 50	0.954 40	0.512 48	0.280 48	0.757 24	0.845 41	0.725 36	0.780 40	0.606 55	0.937 19	0.851 42	0.700 41

INS-Conv-semantic	0.717 42	0.751 64	0.759 58	0.812 38	0.704 42	0.868 7	0.537 26	0.842 35	0.609 48	0.608 46	0.953 44	0.534 39	0.293 39	0.616 59	0.864 28	0.719 41	0.793 33	0.640 40	0.933 23	0.845 47	0.663 51

PointMetaBase	0.714 43	0.835 31	0.785 43	0.821 32	0.684 48	0.846 30	0.531 29	0.865 26	0.614 43	0.596 54	0.953 44	0.500 51	0.246 68	0.674 41	0.888 20	0.692 53	0.764 52	0.624 47	0.849 88	0.844 48	0.675 47

contrastBoundary	0.705 44	0.769 58	0.775 49	0.809 41	0.687 47	0.820 59	0.439 79	0.812 49	0.661 25	0.591 56	0.945 70	0.515 47	0.171 98	0.633 53	0.856 33	0.720 39	0.796 29	0.668 32	0.889 58	0.847 44	0.689 43
Liyao Tang, Yibing Zhan, Zhe Chen, Baosheng Yu, Dacheng Tao: Contrastive Boundary Learning for Point Cloud Segmentation. CVPR2022
ClickSeg_Semantic	0.703 45	0.774 53	0.800 30	0.793 52	0.760 18	0.847 29	0.471 57	0.802 52	0.463 100	0.634 35	0.968 14	0.491 54	0.271 56	0.726 37	0.910 9	0.706 47	0.815 9	0.551 83	0.878 67	0.833 49	0.570 83

RFCR	0.702 46	0.889 18	0.745 70	0.813 37	0.672 51	0.818 63	0.493 50	0.815 47	0.623 40	0.610 44	0.947 64	0.470 63	0.249 67	0.594 63	0.848 40	0.705 48	0.779 41	0.646 37	0.892 56	0.823 55	0.611 66
Jingyu Gong, Jiachen Xu, Xin Tan, Haichuan Song, Yanyun Qu, Yuan Xie, Lizhuang Ma: Omni-Supervised Point Cloud Segmentation via Gradual Receptive Field Component Reasoning. CVPR2021
One Thing One Click	0.701 47	0.825 35	0.796 34	0.723 68	0.716 39	0.832 45	0.433 81	0.816 45	0.634 37	0.609 45	0.969 12	0.418 89	0.344 14	0.559 75	0.833 44	0.715 43	0.808 18	0.560 77	0.902 48	0.847 44	0.680 46

JSENet	0.699 48	0.881 20	0.762 56	0.821 32	0.667 52	0.800 76	0.522 32	0.792 55	0.613 44	0.607 47	0.935 90	0.492 53	0.205 85	0.576 68	0.853 37	0.691 55	0.758 58	0.652 35	0.872 76	0.828 52	0.649 55
Zeyu HU, Mingmin Zhen, Xuyang BAI, Hongbo Fu, Chiew-lan Tai: JSENet: Joint Semantic Segmentation and Edge Detection Network for 3D Point Clouds. ECCV 2020
One-Thing-One-Click	0.693 49	0.743 67	0.794 36	0.655 91	0.684 48	0.822 56	0.497 47	0.719 74	0.622 41	0.617 41	0.977 10	0.447 76	0.339 17	0.750 30	0.664 81	0.703 50	0.790 36	0.596 60	0.946 12	0.855 37	0.647 56
Zhengzhe Liu, Xiaojuan Qi, Chi-Wing Fu: One Thing One Click: A Self-Training Approach for Weakly Supervised 3D Semantic Segmentation. CVPR 2021
PicassoNet-II	0.692 50	0.732 72	0.772 50	0.786 53	0.677 50	0.866 9	0.517 34	0.848 31	0.509 86	0.626 37	0.952 49	0.536 37	0.225 75	0.545 81	0.704 71	0.689 58	0.810 16	0.564 76	0.903 47	0.854 39	0.729 23
Huan Lei, Naveed Akhtar, Mubarak Shah, and Ajmal Mian: Geometric feature learning for 3D meshes.
Feature_GeometricNet	0.690 51	0.884 19	0.754 62	0.795 50	0.647 59	0.818 63	0.422 83	0.802 52	0.612 45	0.604 48	0.945 70	0.462 66	0.189 93	0.563 74	0.853 37	0.726 35	0.765 51	0.632 43	0.904 45	0.821 58	0.606 70
Kangcheng Liu, Ben M. Chen: https://arxiv.org/abs/2012.09439. arXiv Preprint
FusionNet	0.688 52	0.704 85	0.741 74	0.754 65	0.656 54	0.829 48	0.501 42	0.741 69	0.609 48	0.548 64	0.950 55	0.522 45	0.371 5	0.633 53	0.756 59	0.715 43	0.771 47	0.623 48	0.861 84	0.814 61	0.658 52
Feihu Zhang, Jin Fang, Benjamin Wah, Philip Torr: Deep FusionNet for Point Cloud Semantic Segmentation. ECCV 2020
Feature-Geometry Net	0.685 53	0.866 22	0.748 67	0.819 34	0.645 61	0.794 79	0.450 69	0.802 52	0.587 59	0.604 48	0.945 70	0.464 65	0.201 88	0.554 77	0.840 42	0.723 38	0.732 71	0.602 58	0.907 43	0.822 57	0.603 73

VACNN++	0.684 54	0.728 75	0.757 61	0.776 58	0.690 44	0.804 74	0.464 62	0.816 45	0.577 65	0.587 57	0.945 70	0.508 50	0.276 51	0.671 42	0.710 69	0.663 66	0.750 64	0.589 65	0.881 64	0.832 51	0.653 54

KP-FCNN	0.684 54	0.847 28	0.758 60	0.784 55	0.647 59	0.814 66	0.473 56	0.772 58	0.605 50	0.594 55	0.935 90	0.450 74	0.181 96	0.587 64	0.805 52	0.690 56	0.785 39	0.614 51	0.882 63	0.819 59	0.632 62
H. Thomas, C. Qi, J. Deschaud, B. Marcotegui, F. Goulette, L. Guibas.: KPConv: Flexible and Deformable Convolution for Point Clouds. ICCV 2019
DGNet	0.684 54	0.712 84	0.784 44	0.782 57	0.658 53	0.835 42	0.499 46	0.823 44	0.641 34	0.597 53	0.950 55	0.487 56	0.281 47	0.575 69	0.619 85	0.647 74	0.764 52	0.620 50	0.871 79	0.846 46	0.688 44

PointContrast_LA_SEM	0.683 57	0.757 62	0.784 44	0.786 53	0.639 63	0.824 54	0.408 86	0.775 57	0.604 51	0.541 66	0.934 94	0.532 40	0.269 58	0.552 78	0.777 57	0.645 77	0.793 33	0.640 40	0.913 42	0.824 54	0.671 48

Superpoint Network	0.683 57	0.851 27	0.728 78	0.800 49	0.653 56	0.806 72	0.468 59	0.804 50	0.572 66	0.602 50	0.946 67	0.453 73	0.239 71	0.519 86	0.822 46	0.689 58	0.762 55	0.595 62	0.895 54	0.827 53	0.630 63

VI-PointConv	0.676 59	0.770 57	0.754 62	0.783 56	0.621 67	0.814 66	0.552 18	0.758 62	0.571 69	0.557 62	0.954 40	0.529 41	0.268 60	0.530 84	0.682 75	0.675 61	0.719 74	0.603 57	0.888 59	0.833 49	0.665 50
Xingyi Li, Wenxuan Wu, Xiaoli Z. Fern, Li Fuxin: The Devils in the Point Clouds: Studying the Robustness of Point Cloud Convolutions.
ROSMRF3D	0.673 60	0.789 44	0.748 67	0.763 63	0.635 65	0.814 66	0.407 88	0.747 66	0.581 63	0.573 59	0.950 55	0.484 57	0.271 56	0.607 60	0.754 60	0.649 71	0.774 44	0.596 60	0.883 62	0.823 55	0.606 70

SALANet	0.670 61	0.816 38	0.770 53	0.768 60	0.652 57	0.807 71	0.451 66	0.747 66	0.659 28	0.545 65	0.924 100	0.473 62	0.149 108	0.571 71	0.811 51	0.635 81	0.746 65	0.623 48	0.892 56	0.794 75	0.570 83

O3DSeg	0.668 62	0.822 36	0.771 52	0.496 112	0.651 58	0.833 44	0.541 23	0.761 61	0.555 75	0.611 43	0.966 15	0.489 55	0.370 6	0.388 105	0.580 88	0.776 17	0.751 62	0.570 71	0.956 7	0.817 60	0.646 57

PointConv	0.666 63	0.781 48	0.759 58	0.699 76	0.644 62	0.822 56	0.475 55	0.779 56	0.564 72	0.504 83	0.953 44	0.428 83	0.203 87	0.586 66	0.754 60	0.661 67	0.753 61	0.588 66	0.902 48	0.813 63	0.642 58
Wenxuan Wu, Zhongang Qi, Li Fuxin: PointConv: Deep Convolutional Networks on 3D Point Clouds. CVPR 2019
PointASNL	0.666 63	0.703 86	0.781 46	0.751 67	0.655 55	0.830 47	0.471 57	0.769 59	0.474 96	0.537 68	0.951 51	0.475 61	0.279 49	0.635 51	0.698 74	0.675 61	0.751 62	0.553 82	0.816 95	0.806 65	0.703 40
Xu Yan, Chaoda Zheng, Zhen Li, Sheng Wang, Shuguang Cui: PointASNL: Robust Point Clouds Processing using Nonlocal Neural Networks with Adaptive Sampling. CVPR 2020
PPCNN++	0.663 65	0.746 65	0.708 81	0.722 69	0.638 64	0.820 59	0.451 66	0.566 102	0.599 54	0.541 66	0.950 55	0.510 49	0.313 29	0.648 47	0.819 49	0.616 86	0.682 89	0.590 64	0.869 80	0.810 64	0.656 53
Pyunghwan Ahn, Juyoung Yang, Eojindl Yi, Chanho Lee, Junmo Kim: Projection-based Point Convolution for Efficient Point Cloud Segmentation. IEEE Access
MVF-GNN	0.658 66	0.558 108	0.751 65	0.655 91	0.690 44	0.722 101	0.453 65	0.867 23	0.579 64	0.576 58	0.893 112	0.523 43	0.293 39	0.733 35	0.571 90	0.692 53	0.659 96	0.606 55	0.875 70	0.804 67	0.668 49

DCM-Net	0.658 66	0.778 49	0.702 84	0.806 45	0.619 68	0.813 69	0.468 59	0.693 82	0.494 89	0.524 74	0.941 82	0.449 75	0.298 36	0.510 88	0.821 47	0.675 61	0.727 73	0.568 74	0.826 93	0.803 68	0.637 60
Jonas Schult, Francis Engelmann, Theodora Kontogianni, Bastian Leibe: DualConvMesh-Net: Joint Geodesic and Euclidean Convolutions on 3D Meshes. CVPR 2020 [Oral]
HPGCNN	0.656 68	0.698 88	0.743 72	0.650 93	0.564 85	0.820 59	0.505 40	0.758 62	0.631 38	0.479 87	0.945 70	0.480 59	0.226 73	0.572 70	0.774 58	0.690 56	0.735 69	0.614 51	0.853 87	0.776 90	0.597 76
Jisheng Dang, Qingyong Hu, Yulan Guo, Jun Yang: HPGCNN.
SAFNet-seg	0.654 69	0.752 63	0.734 76	0.664 89	0.583 80	0.815 65	0.399 90	0.754 64	0.639 35	0.535 70	0.942 80	0.470 63	0.309 31	0.665 43	0.539 92	0.650 70	0.708 79	0.635 42	0.857 86	0.793 77	0.642 58
Linqing Zhao, Jiwen Lu, Jie Zhou: Similarity-Aware Fusion Network for 3D Semantic Segmentation. IROS 2021
RandLA-Net	0.645 70	0.778 49	0.731 77	0.699 76	0.577 81	0.829 48	0.446 71	0.736 70	0.477 95	0.523 76	0.945 70	0.454 70	0.269 58	0.484 95	0.749 63	0.618 84	0.738 67	0.599 59	0.827 92	0.792 80	0.621 65

PointConv-SFPN	0.641 71	0.776 51	0.703 83	0.721 70	0.557 88	0.826 51	0.451 66	0.672 87	0.563 73	0.483 86	0.943 79	0.425 86	0.162 103	0.644 48	0.726 65	0.659 68	0.709 78	0.572 70	0.875 70	0.786 85	0.559 89

MVPNet	0.641 71	0.831 32	0.715 79	0.671 86	0.590 76	0.781 85	0.394 92	0.679 84	0.642 33	0.553 63	0.937 87	0.462 66	0.256 64	0.649 46	0.406 105	0.626 82	0.691 86	0.666 33	0.877 68	0.792 80	0.608 69
Maximilian Jaritz, Jiayuan Gu, Hao Su: Multi-view PointNet for 3D Scene Understanding. GMDL Workshop, ICCV 2019
PointMRNet	0.640 73	0.717 82	0.701 85	0.692 79	0.576 82	0.801 75	0.467 61	0.716 75	0.563 73	0.459 93	0.953 44	0.429 82	0.169 100	0.581 67	0.854 36	0.605 87	0.710 76	0.550 84	0.894 55	0.793 77	0.575 81

FPConv	0.639 74	0.785 46	0.760 57	0.713 74	0.603 71	0.798 77	0.392 94	0.534 107	0.603 52	0.524 74	0.948 62	0.457 68	0.250 66	0.538 82	0.723 67	0.598 91	0.696 84	0.614 51	0.872 76	0.799 70	0.567 86
Yiqun Lin, Zizheng Yan, Haibin Huang, Dong Du, Ligang Liu, Shuguang Cui, Xiaoguang Han: FPConv: Learning Local Flattening for Point Convolution. CVPR 2020
PD-Net	0.638 75	0.797 42	0.769 54	0.641 98	0.590 76	0.820 59	0.461 63	0.537 106	0.637 36	0.536 69	0.947 64	0.388 96	0.206 84	0.656 44	0.668 79	0.647 74	0.732 71	0.585 68	0.868 81	0.793 77	0.473 109

PointSPNet	0.637 76	0.734 71	0.692 92	0.714 73	0.576 82	0.797 78	0.446 71	0.743 68	0.598 55	0.437 98	0.942 80	0.403 92	0.150 107	0.626 55	0.800 55	0.649 71	0.697 83	0.557 80	0.846 89	0.777 89	0.563 87

SConv	0.636 77	0.830 33	0.697 88	0.752 66	0.572 84	0.780 87	0.445 73	0.716 75	0.529 79	0.530 71	0.951 51	0.446 77	0.170 99	0.507 90	0.666 80	0.636 80	0.682 89	0.541 90	0.886 60	0.799 70	0.594 77

Supervoxel-CNN	0.635 78	0.656 94	0.711 80	0.719 71	0.613 69	0.757 96	0.444 76	0.765 60	0.534 78	0.566 60	0.928 98	0.478 60	0.272 54	0.636 50	0.531 94	0.664 65	0.645 100	0.508 98	0.864 83	0.792 80	0.611 66

joint point-based	0.634 79	0.614 102	0.778 47	0.667 88	0.633 66	0.825 52	0.420 84	0.804 50	0.467 98	0.561 61	0.951 51	0.494 52	0.291 41	0.566 72	0.458 100	0.579 97	0.764 52	0.559 79	0.838 90	0.814 61	0.598 75
Hung-Yueh Chiang, Yen-Liang Lin, Yueh-Cheng Liu, Winston H. Hsu: A Unified Point-Based Framework for 3D Segmentation. 3DV 2019
PointMTL	0.632 80	0.731 73	0.688 95	0.675 83	0.591 75	0.784 84	0.444 76	0.565 103	0.610 46	0.492 84	0.949 59	0.456 69	0.254 65	0.587 64	0.706 70	0.599 90	0.665 95	0.612 54	0.868 81	0.791 83	0.579 80

PointNet2-SFPN	0.631 81	0.771 55	0.692 92	0.672 84	0.524 94	0.837 39	0.440 78	0.706 80	0.538 77	0.446 95	0.944 76	0.421 88	0.219 78	0.552 78	0.751 62	0.591 93	0.737 68	0.543 89	0.901 50	0.768 92	0.557 90

APCF-Net	0.631 81	0.742 68	0.687 97	0.672 84	0.557 88	0.792 82	0.408 86	0.665 89	0.545 76	0.508 80	0.952 49	0.428 83	0.186 94	0.634 52	0.702 72	0.620 83	0.706 80	0.555 81	0.873 74	0.798 72	0.581 79
Haojia, Lin: Adaptive Pyramid Context Fusion for Point Cloud Perception. GRSL
3DSM_DMMF	0.631 81	0.626 99	0.745 70	0.801 48	0.607 70	0.751 97	0.506 39	0.729 73	0.565 71	0.491 85	0.866 115	0.434 78	0.197 91	0.595 62	0.630 84	0.709 46	0.705 81	0.560 77	0.875 70	0.740 100	0.491 104

FusionAwareConv	0.630 84	0.604 104	0.741 74	0.766 62	0.590 76	0.747 98	0.501 42	0.734 71	0.503 88	0.527 72	0.919 104	0.454 70	0.323 26	0.550 80	0.420 104	0.678 60	0.688 87	0.544 87	0.896 53	0.795 74	0.627 64
Jiazhao Zhang, Chenyang Zhu, Lintao Zheng, Kai Xu: Fusion-Aware Point Convolution for Online Semantic 3D Scene Segmentation. CVPR 2020
DenSeR	0.628 85	0.800 41	0.625 107	0.719 71	0.545 91	0.806 72	0.445 73	0.597 97	0.448 103	0.519 78	0.938 86	0.481 58	0.328 24	0.489 94	0.499 99	0.657 69	0.759 57	0.592 63	0.881 64	0.797 73	0.634 61

SegGroup_sem	0.627 86	0.818 37	0.747 69	0.701 75	0.602 72	0.764 93	0.385 98	0.629 94	0.490 91	0.508 80	0.931 97	0.409 91	0.201 88	0.564 73	0.725 66	0.618 84	0.692 85	0.539 91	0.873 74	0.794 75	0.548 93
An Tao, Yueqi Duan, Yi Wei, Jiwen Lu, Jie Zhou: SegGroup: Seg-Level Supervision for 3D Instance and Semantic Segmentation. TIP 2022
SIConv	0.625 87	0.830 33	0.694 90	0.757 64	0.563 86	0.772 91	0.448 70	0.647 92	0.520 82	0.509 79	0.949 59	0.431 81	0.191 92	0.496 92	0.614 86	0.647 74	0.672 93	0.535 94	0.876 69	0.783 86	0.571 82

dtc_net	0.625 87	0.703 86	0.751 65	0.794 51	0.535 92	0.848 27	0.480 54	0.676 86	0.528 80	0.469 90	0.944 76	0.454 70	0.004 120	0.464 97	0.636 83	0.704 49	0.758 58	0.548 86	0.924 30	0.787 84	0.492 103

Weakly-Openseg v3	0.625 87	0.924 8	0.787 42	0.620 100	0.555 90	0.811 70	0.393 93	0.666 88	0.382 111	0.520 77	0.953 44	0.250 115	0.208 82	0.604 61	0.670 77	0.644 78	0.742 66	0.538 92	0.919 36	0.803 68	0.513 101

HPEIN	0.618 90	0.729 74	0.668 98	0.647 95	0.597 74	0.766 92	0.414 85	0.680 83	0.520 82	0.525 73	0.946 67	0.432 79	0.215 80	0.493 93	0.599 87	0.638 79	0.617 105	0.570 71	0.897 52	0.806 65	0.605 72
Li Jiang, Hengshuang Zhao, Shu Liu, Xiaoyong Shen, Chi-Wing Fu, Jiaya Jia: Hierarchical Point-Edge Interaction Network for Point Cloud Semantic Segmentation. ICCV 2019
SPH3D-GCN	0.610 91	0.858 26	0.772 50	0.489 113	0.532 93	0.792 82	0.404 89	0.643 93	0.570 70	0.507 82	0.935 90	0.414 90	0.046 117	0.510 88	0.702 72	0.602 89	0.705 81	0.549 85	0.859 85	0.773 91	0.534 96
Huan Lei, Naveed Akhtar, and Ajmal Mian: Spherical Kernel for Efficient Graph Convolution on 3D Point Clouds. TPAMI 2020
AttAN	0.609 92	0.760 60	0.667 99	0.649 94	0.521 95	0.793 80	0.457 64	0.648 91	0.528 80	0.434 100	0.947 64	0.401 93	0.153 106	0.454 98	0.721 68	0.648 73	0.717 75	0.536 93	0.904 45	0.765 93	0.485 105
Gege Zhang, Qinghua Ma, Licheng Jiao, Fang Liu and Qigong Sun: AttAN: Attention Adversarial Networks for 3D Point Cloud Semantic Segmentation. IJCAI2020
wsss-transformer	0.600 93	0.634 98	0.743 72	0.697 78	0.601 73	0.781 85	0.437 80	0.585 100	0.493 90	0.446 95	0.933 95	0.394 94	0.011 119	0.654 45	0.661 82	0.603 88	0.733 70	0.526 95	0.832 91	0.761 95	0.480 106

LAP-D	0.594 94	0.720 80	0.692 92	0.637 99	0.456 104	0.773 90	0.391 96	0.730 72	0.587 59	0.445 97	0.940 84	0.381 97	0.288 42	0.434 101	0.453 102	0.591 93	0.649 98	0.581 69	0.777 99	0.749 99	0.610 68

DPC	0.592 95	0.720 80	0.700 86	0.602 104	0.480 100	0.762 95	0.380 99	0.713 78	0.585 62	0.437 98	0.940 84	0.369 99	0.288 42	0.434 101	0.509 98	0.590 95	0.639 103	0.567 75	0.772 100	0.755 97	0.592 78
Francis Engelmann, Theodora Kontogianni, Bastian Leibe: Dilated Point Convolutions: On the Receptive Field Size of Point Convolutions on 3D Point Clouds. ICRA 2020
CCRFNet	0.589 96	0.766 59	0.659 102	0.683 81	0.470 103	0.740 100	0.387 97	0.620 96	0.490 91	0.476 88	0.922 102	0.355 102	0.245 69	0.511 87	0.511 97	0.571 98	0.643 101	0.493 102	0.872 76	0.762 94	0.600 74

ROSMRF	0.580 97	0.772 54	0.707 82	0.681 82	0.563 86	0.764 93	0.362 101	0.515 108	0.465 99	0.465 92	0.936 89	0.427 85	0.207 83	0.438 99	0.577 89	0.536 101	0.675 92	0.486 103	0.723 106	0.779 87	0.524 98

SD-DETR	0.576 98	0.746 65	0.609 111	0.445 117	0.517 96	0.643 112	0.366 100	0.714 77	0.456 101	0.468 91	0.870 114	0.432 79	0.264 61	0.558 76	0.674 76	0.586 96	0.688 87	0.482 104	0.739 104	0.733 102	0.537 95

SQN_0.1%	0.569 99	0.676 90	0.696 89	0.657 90	0.497 97	0.779 88	0.424 82	0.548 104	0.515 84	0.376 105	0.902 111	0.422 87	0.357 10	0.379 106	0.456 101	0.596 92	0.659 96	0.544 87	0.685 109	0.665 113	0.556 91

TextureNet	0.566 100	0.672 92	0.664 100	0.671 86	0.494 98	0.719 102	0.445 73	0.678 85	0.411 109	0.396 103	0.935 90	0.356 101	0.225 75	0.412 103	0.535 93	0.565 99	0.636 104	0.464 106	0.794 98	0.680 110	0.568 85
Jingwei Huang, Haotian Zhang, Li Yi, Thomas Funkerhouser, Matthias Niessner, Leonidas Guibas: TextureNet: Consistent Local Parametrizations for Learning from High-Resolution Signals on Meshes. CVPR
DVVNet	0.562 101	0.648 95	0.700 86	0.770 59	0.586 79	0.687 106	0.333 105	0.650 90	0.514 85	0.475 89	0.906 108	0.359 100	0.223 77	0.340 108	0.442 103	0.422 112	0.668 94	0.501 99	0.708 107	0.779 87	0.534 96

Pointnet++ & Feature	0.557 102	0.735 70	0.661 101	0.686 80	0.491 99	0.744 99	0.392 94	0.539 105	0.451 102	0.375 106	0.946 67	0.376 98	0.205 85	0.403 104	0.356 108	0.553 100	0.643 101	0.497 100	0.824 94	0.756 96	0.515 99

GMLPs	0.538 103	0.495 113	0.693 91	0.647 95	0.471 102	0.793 80	0.300 108	0.477 109	0.505 87	0.358 107	0.903 110	0.327 105	0.081 114	0.472 96	0.529 95	0.448 110	0.710 76	0.509 96	0.746 102	0.737 101	0.554 92

PanopticFusion-label	0.529 104	0.491 114	0.688 95	0.604 103	0.386 109	0.632 113	0.225 119	0.705 81	0.434 106	0.293 113	0.815 117	0.348 103	0.241 70	0.499 91	0.669 78	0.507 103	0.649 98	0.442 112	0.796 97	0.602 117	0.561 88
Gaku Narita, Takashi Seno, Tomoya Ishikawa, Yohsuke Kaji: PanopticFusion: Online Volumetric Semantic Mapping at the Level of Stuff and Things. IROS 2019 (to appear)
subcloud_weak	0.516 105	0.676 90	0.591 114	0.609 101	0.442 105	0.774 89	0.335 104	0.597 97	0.422 108	0.357 108	0.932 96	0.341 104	0.094 113	0.298 110	0.528 96	0.473 108	0.676 91	0.495 101	0.602 115	0.721 105	0.349 117

Online SegFusion	0.515 106	0.607 103	0.644 105	0.579 106	0.434 106	0.630 114	0.353 102	0.628 95	0.440 104	0.410 101	0.762 120	0.307 107	0.167 101	0.520 85	0.403 106	0.516 102	0.565 108	0.447 110	0.678 110	0.701 107	0.514 100
Davide Menini, Suryansh Kumar, Martin R. Oswald, Erik Sandstroem, Cristian Sminchisescu, Luc van Gool: A Real-Time Learning Framework for Joint 3D Reconstruction and Semantic Segmentation. Robotics and Automation Letters Submission
3DMV, FTSDF	0.501 107	0.558 108	0.608 112	0.424 119	0.478 101	0.690 105	0.246 115	0.586 99	0.468 97	0.450 94	0.911 106	0.394 94	0.160 104	0.438 99	0.212 115	0.432 111	0.541 113	0.475 105	0.742 103	0.727 103	0.477 107

PCNN	0.498 108	0.559 107	0.644 105	0.560 108	0.420 108	0.711 104	0.229 117	0.414 110	0.436 105	0.352 109	0.941 82	0.324 106	0.155 105	0.238 115	0.387 107	0.493 104	0.529 114	0.509 96	0.813 96	0.751 98	0.504 102

3DMV	0.484 109	0.484 115	0.538 117	0.643 97	0.424 107	0.606 117	0.310 106	0.574 101	0.433 107	0.378 104	0.796 118	0.301 108	0.214 81	0.537 83	0.208 116	0.472 109	0.507 117	0.413 115	0.693 108	0.602 117	0.539 94
Angela Dai, Matthias Niessner: 3DMV: Joint 3D-Multi-View Prediction for 3D Semantic Scene Segmentation. ECCV'18
PointCNN with RGB	0.458 110	0.577 106	0.611 110	0.356 121	0.321 117	0.715 103	0.299 110	0.376 114	0.328 117	0.319 111	0.944 76	0.285 110	0.164 102	0.216 118	0.229 113	0.484 106	0.545 112	0.456 108	0.755 101	0.709 106	0.475 108
Yangyan Li, Rui Bu, Mingchao Sun, Baoquan Chen: PointCNN. NeurIPS 2018
FCPN	0.447 111	0.679 89	0.604 113	0.578 107	0.380 110	0.682 107	0.291 111	0.106 121	0.483 94	0.258 119	0.920 103	0.258 114	0.025 118	0.231 117	0.325 109	0.480 107	0.560 110	0.463 107	0.725 105	0.666 112	0.231 121
Dario Rethage, Johanna Wald, Jürgen Sturm, Nassir Navab, Federico Tombari: Fully-Convolutional Point Networks for Large-Scale Point Clouds. ECCV 2018
DGCNN_reproduce	0.446 112	0.474 116	0.623 108	0.463 115	0.366 112	0.651 110	0.310 106	0.389 113	0.349 115	0.330 110	0.937 87	0.271 112	0.126 110	0.285 111	0.224 114	0.350 117	0.577 107	0.445 111	0.625 113	0.723 104	0.394 113
Yue Wang, Yongbin Sun, Ziwei Liu, Sanjay E. Sarma, Michael M. Bronstein, Justin M. Solomon: Dynamic Graph CNN for Learning on Point Clouds. TOG 2019
PNET2	0.442 113	0.548 110	0.548 116	0.597 105	0.363 113	0.628 115	0.300 108	0.292 116	0.374 112	0.307 112	0.881 113	0.268 113	0.186 94	0.238 115	0.204 117	0.407 113	0.506 118	0.449 109	0.667 111	0.620 116	0.462 111

SurfaceConvPF	0.442 113	0.505 112	0.622 109	0.380 120	0.342 115	0.654 109	0.227 118	0.397 112	0.367 113	0.276 115	0.924 100	0.240 116	0.198 90	0.359 107	0.262 111	0.366 114	0.581 106	0.435 113	0.640 112	0.668 111	0.398 112
Hao Pan, Shilin Liu, Yang Liu, Xin Tong: Convolutional Neural Networks on 3D Surfaces Using Parallel Frames.
Tangent Convolutions	0.438 115	0.437 118	0.646 104	0.474 114	0.369 111	0.645 111	0.353 102	0.258 118	0.282 120	0.279 114	0.918 105	0.298 109	0.147 109	0.283 112	0.294 110	0.487 105	0.562 109	0.427 114	0.619 114	0.633 115	0.352 116
Maxim Tatarchenko, Jaesik Park, Vladlen Koltun, Qian-Yi Zhou: Tangent convolutions for dense prediction in 3d. CVPR 2018
3DWSSS	0.425 116	0.525 111	0.647 103	0.522 109	0.324 116	0.488 121	0.077 122	0.712 79	0.353 114	0.401 102	0.636 122	0.281 111	0.176 97	0.340 108	0.565 91	0.175 121	0.551 111	0.398 116	0.370 122	0.602 117	0.361 115

SPLAT Net	0.393 117	0.472 117	0.511 118	0.606 102	0.311 118	0.656 108	0.245 116	0.405 111	0.328 117	0.197 120	0.927 99	0.227 118	0.000 122	0.001 123	0.249 112	0.271 120	0.510 115	0.383 118	0.593 116	0.699 108	0.267 119
Hang Su, Varun Jampani, Deqing Sun, Subhransu Maji, Evangelos Kalogerakis, Ming-Hsuan Yang, Jan Kautz: SPLATNet: Sparse Lattice Networks for Point Cloud Processing. CVPR 2018
ScanNet+FTSDF	0.383 118	0.297 120	0.491 119	0.432 118	0.358 114	0.612 116	0.274 113	0.116 120	0.411 109	0.265 116	0.904 109	0.229 117	0.079 115	0.250 113	0.185 118	0.320 118	0.510 115	0.385 117	0.548 117	0.597 120	0.394 113

PointNet++	0.339 119	0.584 105	0.478 120	0.458 116	0.256 120	0.360 122	0.250 114	0.247 119	0.278 121	0.261 118	0.677 121	0.183 119	0.117 111	0.212 119	0.145 120	0.364 115	0.346 122	0.232 122	0.548 117	0.523 121	0.252 120
Charles R. Qi, Li Yi, Hao Su, Leonidas J. Guibas: pointnet++: deep hierarchical feature learning on point sets in a metric space.
GrowSP++	0.323 120	0.114 122	0.589 115	0.499 111	0.147 122	0.555 118	0.290 112	0.336 115	0.290 119	0.262 117	0.865 116	0.102 122	0.000 122	0.037 121	0.000 123	0.000 123	0.462 119	0.381 119	0.389 121	0.664 114	0.473 109

SSC-UNet	0.308 121	0.353 119	0.290 122	0.278 122	0.166 121	0.553 119	0.169 121	0.286 117	0.147 122	0.148 122	0.908 107	0.182 120	0.064 116	0.023 122	0.018 122	0.354 116	0.363 120	0.345 120	0.546 119	0.685 109	0.278 118

ScanNet	0.306 122	0.203 121	0.366 121	0.501 110	0.311 118	0.524 120	0.211 120	0.002 123	0.342 116	0.189 121	0.786 119	0.145 121	0.102 112	0.245 114	0.152 119	0.318 119	0.348 121	0.300 121	0.460 120	0.437 122	0.182 122
Angela Dai, Angel X. Chang, Manolis Savva, Maciej Halber, Thomas Funkhouser, Matthias Nießner: ScanNet: Richly-annotated 3D Reconstructions of Indoor Scenes. CVPR'17
ERROR	0.054 123	0.000 123	0.041 123	0.172 123	0.030 123	0.062 123	0.001 123	0.035 122	0.004 123	0.051 123	0.143 123	0.019 123	0.003 121	0.041 120	0.050 121	0.003 122	0.054 123	0.018 123	0.005 123	0.264 123	0.082 123

This table lists the benchmark results for the 3D semantic instance scenario.

Method	avg ap	bathtub	bed	bookshelf	cabinet	chair	counter	curtain	desk	door	otherfurniture	picture	refrigerator	shower curtain	sink	sofa	table	toilet	window

PointRel	0.622 1	0.926 8	0.710 3	0.541 10	0.502 2	0.772 7	0.314 4	0.598 11	0.425 9	0.504 11	0.565 2	0.650 7	0.716 2	0.809 7	0.476 12	0.747 5	0.618 2	0.963 4	0.364 20
: Relation3D: Enhancing Relation Modeling for Point Cloud Instance Segmentation. CVPR 2025
Competitor-MAFT	0.618 2	0.866 16	0.724 1	0.628 1	0.484 4	0.803 2	0.300 8	0.509 32	0.496 1	0.539 1	0.547 6	0.703 1	0.668 8	0.708 33	0.463 18	0.708 17	0.595 4	0.959 6	0.418 8

SIM3D	0.617 3	0.952 4	0.629 18	0.539 11	0.426 16	0.768 11	0.302 7	0.681 2	0.425 10	0.473 17	0.511 16	0.701 2	0.717 1	0.821 6	0.467 15	0.774 1	0.559 15	0.914 19	0.448 3

Spherical Mask(CtoF)	0.616 4	0.946 5	0.654 13	0.555 6	0.434 13	0.769 10	0.271 13	0.604 8	0.447 5	0.505 9	0.549 3	0.698 3	0.716 2	0.775 16	0.480 9	0.747 6	0.575 11	0.925 14	0.436 5

EV3D	0.615 5	0.946 5	0.652 14	0.555 6	0.433 14	0.773 6	0.271 14	0.604 8	0.447 5	0.506 8	0.544 7	0.698 3	0.716 2	0.775 16	0.480 9	0.747 6	0.572 13	0.925 14	0.435 6

DCD	0.614 6	0.892 13	0.633 17	0.434 29	0.495 3	0.810 1	0.292 9	0.501 33	0.408 11	0.525 5	0.582 1	0.688 5	0.625 10	0.801 8	0.608 1	0.672 21	0.649 1	0.965 3	0.476 1

ExtMask3D	0.598 7	0.852 17	0.692 8	0.433 32	0.461 8	0.791 4	0.264 15	0.488 36	0.493 2	0.508 7	0.528 15	0.594 13	0.706 6	0.791 10	0.483 7	0.734 10	0.595 5	0.911 21	0.437 4

MAFT	0.596 8	0.889 14	0.721 2	0.448 24	0.460 9	0.768 12	0.251 17	0.558 21	0.408 12	0.504 10	0.539 9	0.616 11	0.618 12	0.858 3	0.482 8	0.684 20	0.551 18	0.931 13	0.450 2

UniPerception	0.588 9	0.963 3	0.667 11	0.493 15	0.472 7	0.750 16	0.229 20	0.528 27	0.468 4	0.498 14	0.542 8	0.643 8	0.530 22	0.661 40	0.463 17	0.695 19	0.599 3	0.972 1	0.420 7

MG-Former	0.587 10	0.852 17	0.639 16	0.454 23	0.393 22	0.758 15	0.338 2	0.572 16	0.480 3	0.527 3	0.491 23	0.671 6	0.527 23	0.867 1	0.485 6	0.601 32	0.590 8	0.938 12	0.390 12

InsSSM	0.586 11	1.000 1	0.593 22	0.440 27	0.480 5	0.771 8	0.345 1	0.437 41	0.444 8	0.495 15	0.548 5	0.579 17	0.621 11	0.720 29	0.409 24	0.712 12	0.593 6	0.960 5	0.395 10
Lei Yao, Yi Wang, Moyun Liu, Lap-Pui Chau: SGIFormer: Semantic-guided and Geometric-enhanced Interleaving Transformer for 3D Instance Segmentation. TCSVT, 2024
Queryformer	0.583 12	0.926 8	0.702 5	0.393 38	0.504 1	0.733 22	0.276 12	0.527 28	0.373 18	0.479 16	0.534 11	0.533 24	0.697 7	0.720 30	0.436 22	0.745 8	0.592 7	0.958 7	0.363 21

KmaxOneFormerNet	0.581 13	0.745 29	0.692 9	0.551 8	0.458 10	0.798 3	0.264 16	0.531 26	0.369 20	0.513 6	0.531 14	0.632 9	0.494 26	0.798 9	0.567 3	0.648 25	0.558 17	0.950 9	0.362 23

Competitor-SPFormer	0.580 14	0.721 36	0.705 4	0.593 4	0.444 12	0.786 5	0.286 10	0.564 19	0.376 17	0.498 13	0.534 12	0.546 22	0.390 46	0.785 12	0.577 2	0.708 16	0.579 10	0.954 8	0.388 13

VDG-Uni3DSeg	0.576 15	0.833 21	0.699 6	0.483 17	0.412 20	0.767 13	0.313 5	0.461 40	0.446 7	0.526 4	0.498 21	0.584 14	0.551 18	0.743 25	0.464 16	0.766 2	0.538 22	0.919 17	0.363 22

PBNet	0.573 16	0.926 8	0.575 28	0.619 2	0.472 6	0.736 20	0.239 19	0.487 37	0.383 16	0.459 20	0.506 19	0.533 23	0.585 14	0.767 18	0.404 25	0.717 11	0.559 16	0.969 2	0.381 16
Weiguang Zhao, Yuyao Yan, Chaolong Yang, Jianan Ye, Xi Yang, Kaizhu Huang: Divide and Conquer: 3D Instance Segmentation With Point-Wise Binarization. ICCV 2023
TST3D	0.569 17	0.778 26	0.675 10	0.598 3	0.451 11	0.727 23	0.280 11	0.476 39	0.395 13	0.472 18	0.457 29	0.583 15	0.580 16	0.777 13	0.462 20	0.735 9	0.547 20	0.919 18	0.333 29
Duc Tran Dang Trung, Byeongkeun Kang, Yeejin Lee: MSTA3D: Multi-scale Twin-attention for 3D Instance Segmentation. ACM Multimedia 2024
OneFormer3D	0.566 18	0.781 25	0.697 7	0.562 5	0.431 15	0.770 9	0.331 3	0.400 47	0.373 19	0.529 2	0.504 20	0.568 19	0.475 30	0.732 27	0.470 13	0.762 3	0.550 19	0.871 36	0.379 17
Maxim Kolodiazhnyi, Anna Vorontsova, Anton Konushin, Danila Rukhovich: OneFormer3D: One Transformer for Unified Point Cloud Segmentation.
Mask3D	0.566 18	0.926 8	0.597 21	0.408 35	0.420 18	0.737 19	0.239 18	0.598 11	0.386 15	0.458 21	0.549 3	0.568 20	0.716 2	0.601 46	0.480 9	0.646 26	0.575 11	0.922 16	0.364 19
Jonas Schult, Francis Engelmann, Alexander Hermans, Or Litany, Siyu Tang, Bastian Leibe: Mask3D for 3D Semantic Instance Segmentation. ICRA 2023
ISBNet	0.559 20	0.939 7	0.655 12	0.383 41	0.426 17	0.763 14	0.180 22	0.534 25	0.386 14	0.499 12	0.509 18	0.621 10	0.427 40	0.704 35	0.467 14	0.649 24	0.571 14	0.948 10	0.401 9
Tuan Duc Ngo, Binh-Son Hua, Khoi Nguyen: ISBNet: a 3D Point Cloud Instance Segmentation Network with Instance-aware Sampling and Box-aware Dynamic Convolution. CVPR 2023
GraphCut	0.552 21	1.000 1	0.611 20	0.438 28	0.392 23	0.714 24	0.139 26	0.598 13	0.327 24	0.389 24	0.510 17	0.598 12	0.427 41	0.754 21	0.463 19	0.761 4	0.588 9	0.903 24	0.329 31

SPFormer	0.549 22	0.745 29	0.640 15	0.484 16	0.395 21	0.739 18	0.311 6	0.566 18	0.335 22	0.468 19	0.492 22	0.555 21	0.478 29	0.747 23	0.436 21	0.712 13	0.540 21	0.893 28	0.343 28
Sun Jiahao, Qing Chunmei, Tan Junpeng, Xu Xiangmin: Superpoint Transformer for 3D Scene Instance Segmentation. AAAI 2023 [Oral]
DKNet	0.532 23	0.815 22	0.624 19	0.517 12	0.377 25	0.749 17	0.107 28	0.509 31	0.304 26	0.437 22	0.475 24	0.581 16	0.539 20	0.775 15	0.339 31	0.640 28	0.506 25	0.901 25	0.385 15
Yizheng Wu, Min Shi, Shuaiyuan Du, Hao Lu, Zhiguo Cao, Weicai Zhong: 3D Instances as 1D Kernels. ECCV 2022
IPCA-Inst	0.520 24	0.889 14	0.551 32	0.548 9	0.418 19	0.665 34	0.064 37	0.585 14	0.260 34	0.277 39	0.471 26	0.500 25	0.644 9	0.785 11	0.369 27	0.591 36	0.511 23	0.878 33	0.362 24

SoftGroup++	0.513 25	0.704 38	0.578 27	0.398 37	0.363 31	0.704 25	0.061 38	0.647 5	0.297 31	0.378 27	0.537 10	0.343 29	0.614 13	0.828 5	0.295 36	0.710 15	0.505 27	0.875 35	0.394 11

SSTNet	0.506 26	0.738 33	0.549 33	0.497 14	0.316 37	0.693 28	0.178 23	0.377 51	0.198 40	0.330 30	0.463 28	0.576 18	0.515 24	0.857 4	0.494 4	0.637 29	0.457 31	0.943 11	0.290 40
Zhihao Liang, Zhihao Li, Songcen Xu, Mingkui Tan, Kui Jia: Instance Segmentation in 3D Scenes using Semantic Superpoint Tree Networks. ICCV2021
SoftGroup	0.504 27	0.667 45	0.579 25	0.372 43	0.381 24	0.694 27	0.072 34	0.677 3	0.303 27	0.387 25	0.531 13	0.319 33	0.582 15	0.754 20	0.318 32	0.643 27	0.492 28	0.907 23	0.388 14
Thang Vu, Kookhoi Kim, Tung M. Luu, Xuan Thanh Nguyen, Chang D. Yoo: SoftGroup for 3D Instance Segmentaiton on Point Clouds. CVPR 2022 [Oral]
DANCENET	0.504 27	0.926 8	0.579 24	0.472 19	0.367 28	0.626 44	0.165 24	0.432 42	0.221 36	0.408 23	0.449 31	0.411 27	0.564 17	0.746 24	0.421 23	0.707 18	0.438 34	0.846 44	0.288 41

TD3D	0.489 29	0.852 17	0.511 42	0.434 30	0.322 36	0.735 21	0.101 31	0.512 30	0.355 21	0.349 29	0.468 27	0.283 37	0.514 25	0.676 39	0.268 41	0.671 22	0.510 24	0.908 22	0.329 32
Maksim Kolodiazhnyi, Anna Vorontsova, Anton Konushin, Danila Rukhovich: Top-Down Beats Bottom-Up in 3D Instance Segmentation. WACV 2024
OccuSeg+instance	0.486 30	0.802 24	0.536 35	0.428 33	0.369 27	0.702 26	0.205 21	0.331 56	0.301 28	0.379 26	0.474 25	0.327 30	0.437 35	0.862 2	0.485 5	0.601 33	0.394 42	0.846 46	0.273 44
Lei Han, Tian Zheng, Lan Xu, Lu Fang: OccuSeg: Occupancy-aware 3D Instance Segmentation. CVPR2020
TopoSeg	0.479 31	0.704 38	0.564 29	0.467 21	0.366 29	0.633 42	0.068 35	0.554 22	0.262 33	0.328 31	0.447 32	0.323 31	0.534 21	0.722 28	0.288 38	0.614 30	0.482 29	0.912 20	0.358 26

DualGroup	0.469 32	0.815 22	0.552 31	0.398 36	0.374 26	0.683 30	0.130 27	0.539 24	0.310 25	0.327 32	0.407 35	0.276 38	0.447 34	0.535 50	0.342 30	0.659 23	0.455 32	0.900 27	0.301 36

SSEC	0.465 33	0.667 45	0.578 26	0.502 13	0.362 32	0.641 41	0.035 47	0.605 7	0.291 32	0.323 33	0.451 30	0.296 35	0.417 44	0.677 38	0.245 45	0.501 54	0.506 26	0.900 26	0.366 18

ODIN - Ins	0.463 34	0.738 33	0.589 23	0.344 47	0.358 33	0.560 53	0.139 25	0.393 50	0.331 23	0.373 28	0.392 38	0.496 26	0.493 27	0.709 32	0.377 26	0.599 34	0.359 48	0.752 56	0.332 30
Ayush Jain, Pushkal Katara, Nikolaos Gkanatsios, Adam W. Harley, Gabriel Sarch, Kriti Aggarwal, Vishrav Chaudhary, Katerina Fragkiadaki: ODIN: A Single Model for 2D and 3D Segmentation. CVPR 2024
HAIS	0.457 35	0.704 38	0.561 30	0.457 22	0.364 30	0.673 31	0.046 46	0.547 23	0.194 41	0.308 34	0.426 33	0.288 36	0.454 33	0.711 31	0.262 42	0.563 44	0.434 36	0.889 30	0.344 27
Shaoyu Chen, Jiemin Fang, Qian Zhang, Wenyu Liu, Xinggang Wang: Hierarchical Aggregation for 3D Instance Segmentation. ICCV 2021
DD-UNet+Group	0.436 36	0.630 53	0.508 45	0.480 18	0.310 39	0.624 46	0.065 36	0.638 6	0.174 42	0.256 43	0.384 40	0.194 50	0.428 38	0.759 19	0.289 37	0.574 41	0.400 40	0.849 43	0.291 39
H. Liu, R. Liu, K. Yang, J. Zhang, K. Peng, R. Stiefelhagen: HIDA: Towards Holistic Indoor Understanding for the Visually Impaired via Semantic Instance Segmentation with a Wearable Solid-State LiDAR Sensor. ICCVW 2021
INS-Conv-instance	0.435 37	0.716 37	0.495 47	0.355 45	0.331 34	0.689 29	0.102 30	0.394 49	0.208 39	0.280 37	0.395 37	0.250 41	0.544 19	0.741 26	0.309 34	0.536 50	0.391 43	0.842 49	0.258 48

Mask-Group	0.434 38	0.778 26	0.516 40	0.471 20	0.330 35	0.658 35	0.029 49	0.526 29	0.249 35	0.256 42	0.400 36	0.309 34	0.384 49	0.296 66	0.368 28	0.575 40	0.425 37	0.877 34	0.362 25
Min Zhong, Xinghao Chen, Xiaokang Chen, Gang Zeng, Yunhe Wang: MaskGroup: Hierarchical Point Grouping and Masking for 3D Instance Segmentation. ICME 2022
Box2Mask	0.433 39	0.741 31	0.463 52	0.433 31	0.283 42	0.625 45	0.103 29	0.298 61	0.125 51	0.260 41	0.424 34	0.322 32	0.472 31	0.701 36	0.363 29	0.711 14	0.309 60	0.882 31	0.272 46
Julian Chibane, Francis Engelmann, Tuan Anh Tran, Gerard Pons-Moll: Box2Mask: Weakly Supervised 3D Semantic Instance Segmentation Using Bounding Boxes. ECCV 2022
RPGN	0.428 40	0.630 53	0.508 44	0.367 44	0.249 49	0.658 36	0.016 57	0.673 4	0.131 49	0.234 46	0.383 41	0.270 39	0.434 36	0.748 22	0.274 40	0.609 31	0.406 39	0.842 48	0.267 47
Shichao Dong, Guosheng Lin, Tzu-Yi Hung: Learning Regional Purity for Instance Segmentation on 3D Point Clouds. ECCV 2022
DENet	0.413 41	0.741 31	0.520 37	0.237 57	0.284 41	0.523 56	0.097 32	0.691 1	0.138 46	0.209 56	0.229 58	0.238 44	0.390 47	0.707 34	0.310 33	0.448 61	0.470 30	0.892 29	0.310 34

PointGroup	0.407 42	0.639 52	0.496 46	0.415 34	0.243 51	0.645 40	0.021 54	0.570 17	0.114 52	0.211 54	0.359 43	0.217 48	0.428 39	0.660 41	0.256 43	0.562 45	0.341 52	0.860 39	0.291 38
Li Jiang, Hengshuang Zhao, Shaoshuai Shi, Shu Liu, Chi-Wing Fu, Jiaya Jia: PointGroup: Dual-Set Point Grouping for 3D Instance Segmentation. CVPR 2020 [oral]
CSC-Pretrained	0.405 43	0.738 33	0.465 51	0.331 50	0.205 55	0.655 37	0.051 42	0.601 10	0.092 56	0.211 55	0.329 46	0.198 49	0.459 32	0.775 14	0.195 52	0.524 52	0.400 41	0.878 32	0.184 57

PE	0.396 44	0.667 45	0.467 50	0.446 26	0.243 50	0.624 47	0.022 53	0.577 15	0.106 53	0.219 49	0.340 44	0.239 43	0.487 28	0.475 57	0.225 47	0.541 49	0.350 50	0.818 51	0.273 45
Biao Zhang, Peter Wonka: Point Cloud Instance Segmentation using Probabilistic Embeddings. CVPR 2021
Dyco3D	0.395 45	0.642 51	0.518 39	0.447 25	0.259 48	0.666 33	0.050 43	0.251 66	0.166 43	0.231 47	0.362 42	0.232 45	0.331 52	0.535 49	0.229 46	0.587 37	0.438 35	0.850 41	0.317 33
Tong He; Chunhua Shen; Anton van den Hengel: DyCo3D: Robust Instance Segmentation of 3D Point Clouds through Dynamic Convolution. CVPR2021
OSIS	0.392 46	0.778 26	0.530 36	0.220 59	0.278 43	0.567 52	0.083 33	0.330 57	0.299 29	0.270 40	0.310 49	0.143 56	0.260 56	0.624 44	0.277 39	0.568 43	0.361 47	0.865 38	0.301 35

AOIA	0.387 47	0.704 38	0.515 41	0.385 40	0.225 54	0.669 32	0.005 64	0.482 38	0.126 50	0.181 59	0.269 55	0.221 47	0.426 42	0.478 56	0.218 48	0.592 35	0.371 45	0.851 40	0.242 50

SSEN	0.384 48	0.852 17	0.494 48	0.192 60	0.226 53	0.648 39	0.022 52	0.398 48	0.299 30	0.277 38	0.317 48	0.231 46	0.194 63	0.514 53	0.196 50	0.586 38	0.444 33	0.843 47	0.184 56
Dongsu Zhang, Junha Chun, Sang Kyun Cha, Young Min Kim: Spatial Semantic Embedding Network: Fast 3D Instance Segmentation with Deep Metric Learning. Arxiv
Mask3D_evaluation	0.382 49	0.593 55	0.520 38	0.390 39	0.314 38	0.600 48	0.018 56	0.287 64	0.151 45	0.281 36	0.387 39	0.169 54	0.429 37	0.654 42	0.172 56	0.578 39	0.384 44	0.670 63	0.278 43

PCJC	0.375 50	0.704 38	0.542 34	0.284 54	0.197 57	0.649 38	0.006 61	0.426 43	0.138 47	0.242 44	0.304 50	0.183 53	0.388 48	0.629 43	0.141 63	0.546 48	0.344 51	0.738 58	0.283 42

ClickSeg_Instance	0.366 51	0.654 49	0.375 56	0.184 61	0.302 40	0.592 50	0.050 44	0.300 60	0.093 55	0.283 35	0.277 52	0.249 42	0.426 43	0.615 45	0.299 35	0.504 53	0.367 46	0.832 50	0.191 55

SphereSeg	0.357 52	0.651 50	0.411 54	0.345 46	0.264 47	0.630 43	0.059 39	0.289 63	0.212 37	0.240 45	0.336 45	0.158 55	0.305 53	0.557 47	0.159 59	0.455 60	0.341 53	0.726 60	0.294 37

3D-MPA	0.355 53	0.457 65	0.484 49	0.299 52	0.277 44	0.591 51	0.047 45	0.332 54	0.212 38	0.217 50	0.278 51	0.193 51	0.413 45	0.410 60	0.195 51	0.574 42	0.352 49	0.849 42	0.213 53
Francis Engelmann, Martin Bokeloh, Alireza Fathi, Bastian Leibe, Matthias Nießner: 3D-MPA: Multi Proposal Aggregation for 3D Semantic Instance Segmentation. CVPR 2020
NeuralBF	0.353 54	0.593 55	0.511 43	0.375 42	0.264 46	0.597 49	0.008 59	0.332 55	0.160 44	0.229 48	0.274 54	0.000 77	0.206 60	0.678 37	0.155 60	0.485 56	0.422 38	0.816 52	0.254 49
Weiwei Sun, Daniel Rebain, Renjie Liao, Vladimir Tankovich, Soroosh Yazdani, Kwang Moo Yi, Andrea Tagliasacchi: NeuralBF: Neural Bilateral Filtering for Top-down Instance Segmentation on Point Clouds. WACV 2023
RWSeg	0.348 55	0.475 62	0.456 53	0.320 51	0.275 45	0.476 58	0.020 55	0.491 35	0.056 63	0.212 53	0.320 47	0.261 40	0.302 54	0.520 51	0.182 54	0.557 46	0.285 62	0.867 37	0.197 54

GICN	0.341 56	0.580 57	0.371 57	0.344 48	0.198 56	0.469 59	0.052 41	0.564 20	0.093 54	0.212 52	0.212 60	0.127 58	0.347 51	0.537 48	0.206 49	0.525 51	0.329 55	0.729 59	0.241 51

One_Thing_One_Click	0.326 57	0.472 63	0.361 58	0.232 58	0.183 58	0.555 54	0.000 70	0.498 34	0.038 65	0.195 57	0.226 59	0.362 28	0.168 64	0.469 58	0.251 44	0.553 47	0.335 54	0.846 45	0.117 65
Zhengzhe Liu, Xiaojuan Qi, Chi-Wing Fu: One Thing One Click: A Self-Training Approach for Weakly Supervised 3D Semantic Segmentation. CVPR 2021
Occipital-SCS	0.320 58	0.679 44	0.352 59	0.334 49	0.229 52	0.436 60	0.025 50	0.412 46	0.058 61	0.161 64	0.240 57	0.085 60	0.262 55	0.496 55	0.187 53	0.467 58	0.328 56	0.775 53	0.231 52

Sparse R-CNN	0.292 59	0.704 38	0.213 69	0.153 63	0.154 60	0.551 55	0.053 40	0.212 67	0.132 48	0.174 61	0.274 53	0.070 62	0.363 50	0.441 59	0.176 55	0.424 63	0.234 64	0.758 55	0.161 61

MTML	0.282 60	0.577 58	0.380 55	0.182 62	0.107 66	0.430 61	0.001 67	0.422 44	0.057 62	0.179 60	0.162 63	0.070 63	0.229 58	0.511 54	0.161 57	0.491 55	0.313 57	0.650 66	0.162 59
Jean Lahoud, Bernard Ghanem, Marc Pollefeys, Martin R. Oswald: 3D Instance Segmentation via Multi-task Metric Learning. ICCV 2019 [oral]
SALoss-ResNet	0.262 61	0.667 45	0.335 60	0.067 70	0.123 64	0.427 62	0.022 51	0.280 65	0.058 60	0.216 51	0.211 61	0.039 66	0.142 66	0.519 52	0.106 67	0.338 67	0.310 59	0.721 61	0.138 62
Zhidong Liang, Ming Yang, Hao Li, Chunxiang Wang: 3D Instance Embedding Learning With a Structure-Aware Loss Function for Point Cloud Segmentation. IEEE Robotics and Automation Letters (IROS2020)
MASC	0.254 62	0.463 64	0.249 68	0.113 64	0.167 59	0.412 64	0.000 69	0.374 52	0.073 57	0.173 62	0.243 56	0.130 57	0.228 59	0.368 62	0.160 58	0.356 65	0.208 65	0.711 62	0.136 63
Chen Liu, Yasutaka Furukawa: MASC: Multi-scale Affinity with Sparse Convolution for 3D Instance Segmentation.
3D-BoNet	0.253 63	0.519 60	0.324 63	0.251 56	0.137 63	0.345 69	0.031 48	0.419 45	0.069 58	0.162 63	0.131 65	0.052 64	0.202 62	0.338 64	0.147 62	0.301 70	0.303 61	0.651 65	0.178 58
Bo Yang, Jianan Wang, Ronald Clark, Qingyong Hu, Sen Wang, Andrew Markham, Niki Trigoni: Learning Object Bounding Boxes for 3D Instance Segmentation on Point Clouds. NeurIPS 2019 Spotlight
SPG_WSIS	0.251 64	0.380 67	0.274 66	0.289 53	0.144 61	0.413 63	0.000 70	0.311 58	0.065 59	0.113 66	0.130 66	0.029 69	0.204 61	0.388 61	0.108 66	0.459 59	0.311 58	0.769 54	0.127 64

SegGroup_ins	0.246 65	0.556 59	0.335 61	0.062 72	0.115 65	0.490 57	0.000 70	0.297 62	0.018 69	0.186 58	0.142 64	0.083 61	0.233 57	0.216 68	0.153 61	0.469 57	0.251 63	0.744 57	0.083 68
An Tao, Yueqi Duan, Yi Wei, Jiwen Lu, Jie Zhou: SegGroup: Seg-Level Supervision for 3D Instance and Semantic Segmentation. TIP 2022
PanopticFusion-inst	0.214 66	0.250 72	0.330 62	0.275 55	0.103 67	0.228 75	0.000 70	0.345 53	0.024 67	0.088 68	0.203 62	0.186 52	0.167 65	0.367 63	0.125 64	0.221 73	0.112 75	0.666 64	0.162 60
Gaku Narita, Takashi Seno, Tomoya Ishikawa, Yohsuke Kaji: PanopticFusion: Online Volumetric Semantic Mapping at the Level of Stuff and Things. IROS 2019 (to appear)
UNet-backbone	0.161 67	0.519 60	0.259 67	0.084 66	0.059 69	0.325 71	0.002 65	0.093 72	0.009 71	0.077 70	0.064 69	0.045 65	0.044 73	0.161 70	0.045 69	0.331 68	0.180 67	0.566 67	0.033 77

3D-SIS	0.161 67	0.407 66	0.155 74	0.068 69	0.043 73	0.346 68	0.001 66	0.134 69	0.005 72	0.088 67	0.106 68	0.037 67	0.135 68	0.321 65	0.028 73	0.339 66	0.116 74	0.466 70	0.093 67
Ji Hou, Angela Dai, Matthias Niessner: 3D-SIS: 3D Semantic Instance Segmentation of RGB-D Scans. CVPR 2019
R-PointNet	0.158 69	0.356 68	0.173 72	0.113 65	0.140 62	0.359 65	0.012 58	0.023 75	0.039 64	0.134 65	0.123 67	0.008 73	0.089 69	0.149 71	0.117 65	0.221 72	0.128 72	0.563 68	0.094 66

Region-18class	0.146 70	0.175 76	0.321 64	0.080 67	0.062 68	0.357 66	0.000 70	0.307 59	0.002 74	0.066 71	0.044 71	0.000 77	0.018 75	0.036 76	0.054 68	0.447 62	0.133 70	0.472 69	0.060 72

SemRegionNet-20cls	0.121 71	0.296 70	0.203 70	0.071 68	0.058 70	0.349 67	0.000 70	0.150 68	0.019 68	0.054 73	0.034 74	0.017 72	0.052 71	0.042 75	0.013 76	0.209 74	0.183 66	0.371 71	0.057 73

Hier3D	0.117 72	0.222 74	0.161 73	0.054 74	0.027 75	0.289 72	0.000 70	0.124 70	0.001 76	0.079 69	0.061 70	0.027 70	0.141 67	0.240 67	0.005 77	0.310 69	0.129 71	0.153 77	0.081 69
Tan: HCFS3D: Hierarchical Coupled Feature Selection Network for 3D Semantic and Instance Segmentation.
3D-BEVIS	0.117 72	0.250 72	0.308 65	0.020 76	0.009 78	0.269 74	0.006 62	0.008 76	0.029 66	0.037 76	0.014 77	0.003 75	0.036 74	0.147 72	0.042 71	0.381 64	0.118 73	0.362 72	0.069 71
Cathrin Elich, Francis Engelmann, Jonas Schult, Theodora Kontogianni, Bastian Leibe: 3D-BEVIS: Birds-Eye-View Instance Segmentation.
tmp	0.113 74	0.333 69	0.151 75	0.056 73	0.053 71	0.344 70	0.000 70	0.105 71	0.016 70	0.049 74	0.035 73	0.020 71	0.053 70	0.048 74	0.013 75	0.183 76	0.173 68	0.344 74	0.054 74

Sem_Recon_ins	0.098 75	0.295 71	0.187 71	0.015 77	0.036 74	0.213 76	0.005 63	0.038 74	0.003 73	0.056 72	0.037 72	0.036 68	0.015 76	0.051 73	0.044 70	0.209 75	0.098 76	0.354 73	0.071 70

ASIS	0.085 76	0.037 77	0.080 77	0.066 71	0.047 72	0.282 73	0.000 70	0.052 73	0.002 75	0.047 75	0.026 75	0.001 76	0.046 72	0.194 69	0.031 72	0.264 71	0.140 69	0.167 76	0.047 76

Sgpn_scannet	0.049 77	0.023 78	0.134 76	0.031 75	0.013 77	0.144 77	0.006 60	0.008 77	0.000 77	0.028 77	0.017 76	0.003 74	0.009 78	0.000 77	0.021 74	0.122 77	0.095 77	0.175 75	0.054 75

MaskRCNN 2d->3d Proj	0.022 78	0.185 75	0.000 78	0.000 78	0.015 76	0.000 78	0.000 68	0.006 78	0.000 77	0.010 78	0.006 78	0.107 59	0.012 77	0.000 77	0.002 78	0.027 78	0.004 78	0.022 78	0.001 78

Method	avg iou	bathtub	bed	bookshelf	cabinet	chair	counter	curtain	desk	door	floor	otherfurniture	picture	refrigerator	shower curtain	sink	sofa	table	toilet	wall	window

Virtual MVFusion (R)	0.745 1	0.861 1	0.839 1	0.881 1	0.672 2	0.512 1	0.422 18	0.898 1	0.723 1	0.714 1	0.954 2	0.454 1	0.509 1	0.773 1	0.895 1	0.756 1	0.820 1	0.653 1	0.935 1	0.891 1	0.728 1
Abhijit Kundu, Xiaoqi Yin, Alireza Fathi, David Ross, Brian Brewington, Thomas Funkhouser, Caroline Pantofaru: Virtual Multi-view Fusion for 3D Semantic Segmentation. ECCV 2020
BPNet_2D	0.670 2	0.822 3	0.795 3	0.836 2	0.659 3	0.481 2	0.451 14	0.769 4	0.656 3	0.567 4	0.931 3	0.395 6	0.390 5	0.700 4	0.534 4	0.689 11	0.770 2	0.574 3	0.865 10	0.831 3	0.675 5
Wenbo Hu, Hengshuang Zhao, Li Jiang, Jiaya Jia and Tien-Tsin Wong: Bidirectional Projection Network for Cross Dimension Scene Understanding. CVPR 2021 (Oral)
CU-Hybrid-2D Net	0.636 3	0.825 2	0.820 2	0.179 24	0.648 4	0.463 3	0.549 2	0.742 8	0.676 2	0.628 2	0.961 1	0.420 2	0.379 6	0.684 8	0.381 19	0.732 3	0.723 3	0.599 2	0.827 17	0.851 2	0.634 8

MVF-GNN（2D）	0.636 3	0.606 15	0.794 4	0.434 16	0.688 1	0.337 8	0.464 13	0.798 3	0.632 5	0.589 3	0.908 9	0.420 2	0.329 13	0.743 2	0.594 2	0.738 2	0.676 5	0.527 4	0.906 2	0.818 6	0.715 3

CMX	0.613 5	0.681 9	0.725 12	0.502 12	0.634 6	0.297 18	0.478 11	0.830 2	0.651 4	0.537 7	0.924 4	0.375 7	0.315 15	0.686 7	0.451 14	0.714 5	0.543 22	0.504 6	0.894 7	0.823 5	0.688 4

DMMF_3d	0.605 6	0.651 10	0.744 10	0.782 3	0.637 5	0.387 4	0.536 4	0.732 9	0.590 7	0.540 6	0.856 22	0.359 11	0.306 16	0.596 15	0.539 3	0.627 21	0.706 4	0.497 8	0.785 22	0.757 20	0.476 23

EMSANet	0.600 7	0.716 4	0.746 9	0.395 19	0.614 9	0.382 5	0.523 5	0.713 12	0.571 11	0.503 10	0.922 7	0.404 5	0.397 4	0.655 9	0.400 16	0.626 22	0.663 6	0.469 13	0.900 4	0.827 4	0.577 15
Seichter, Daniel and Fischedick, Söhnke and Köhler, Mona and Gross, Horst-Michael: EMSANet: Efficient Multi-Task RGB-D Scene Analysis for Indoor Environments. IJCNN 2022
MCA-Net	0.595 8	0.533 21	0.756 8	0.746 4	0.590 10	0.334 10	0.506 8	0.670 16	0.587 8	0.500 12	0.905 11	0.366 10	0.352 9	0.601 14	0.506 8	0.669 17	0.648 9	0.501 7	0.839 16	0.769 16	0.516 22

RFBNet	0.592 9	0.616 12	0.758 7	0.659 5	0.581 11	0.330 11	0.469 12	0.655 19	0.543 14	0.524 8	0.924 4	0.355 13	0.336 11	0.572 18	0.479 10	0.671 15	0.648 9	0.480 10	0.814 20	0.814 7	0.614 11

FAN_NV_RVC	0.586 10	0.510 22	0.764 6	0.079 27	0.620 8	0.330 11	0.494 9	0.753 6	0.573 9	0.556 5	0.884 17	0.405 4	0.303 17	0.718 3	0.452 13	0.672 14	0.658 7	0.509 5	0.898 5	0.813 8	0.727 2

WSGFormer	0.585 11	0.706 5	0.708 17	0.434 16	0.574 13	0.283 21	0.538 3	0.759 5	0.542 16	0.482 16	0.924 4	0.351 15	0.333 12	0.614 11	0.393 17	0.692 10	0.551 21	0.461 14	0.874 9	0.809 9	0.673 6

DCRedNet	0.583 12	0.682 8	0.723 13	0.542 11	0.510 21	0.310 15	0.451 14	0.668 17	0.549 13	0.520 9	0.920 8	0.375 7	0.446 2	0.528 21	0.417 15	0.670 16	0.577 18	0.478 11	0.862 11	0.806 10	0.628 10

MIX6D_RVC	0.582 13	0.695 6	0.687 18	0.225 22	0.632 7	0.328 13	0.550 1	0.748 7	0.623 6	0.494 15	0.890 15	0.350 16	0.254 24	0.688 6	0.454 12	0.716 4	0.597 17	0.489 9	0.881 8	0.768 17	0.575 16

SSMA	0.577 14	0.695 6	0.716 15	0.439 14	0.563 15	0.314 14	0.444 16	0.719 10	0.551 12	0.503 10	0.887 16	0.346 17	0.348 10	0.603 13	0.353 21	0.709 6	0.600 15	0.457 15	0.901 3	0.786 12	0.599 14
Abhinav Valada, Rohit Mohan, Wolfram Burgard: Self-Supervised Model Adaptation for Multimodal Semantic Segmentation. International Journal of Computer Vision, 2019
DMMF	0.567 15	0.623 11	0.767 5	0.238 21	0.571 14	0.347 6	0.413 20	0.719 10	0.472 21	0.418 23	0.895 14	0.357 12	0.260 23	0.696 5	0.523 7	0.666 18	0.642 11	0.437 19	0.895 6	0.793 11	0.603 13

UNIV_CNP_RVC_UE	0.566 16	0.569 20	0.686 20	0.435 15	0.524 18	0.294 19	0.421 19	0.712 13	0.543 14	0.463 18	0.872 18	0.320 18	0.363 8	0.611 12	0.477 11	0.686 12	0.627 12	0.443 18	0.862 11	0.775 15	0.639 7

EMSAFormer	0.564 17	0.581 17	0.736 11	0.564 10	0.546 17	0.219 24	0.517 6	0.675 15	0.486 20	0.427 22	0.904 12	0.352 14	0.320 14	0.589 16	0.528 5	0.708 7	0.464 25	0.413 23	0.847 15	0.786 12	0.611 12

SN_RN152pyrx8_RVC	0.546 18	0.572 18	0.663 22	0.638 7	0.518 19	0.298 17	0.366 25	0.633 22	0.510 18	0.446 20	0.864 20	0.296 21	0.267 20	0.542 20	0.346 22	0.704 8	0.575 19	0.431 20	0.853 14	0.766 18	0.630 9

UDSSEG_RVC	0.545 19	0.610 14	0.661 23	0.588 8	0.556 16	0.268 22	0.482 10	0.642 21	0.572 10	0.475 17	0.836 24	0.312 19	0.367 7	0.630 10	0.189 24	0.639 20	0.495 24	0.452 16	0.826 18	0.756 21	0.541 18

segfomer with 6d	0.542 20	0.594 16	0.687 18	0.146 25	0.579 12	0.308 16	0.515 7	0.703 14	0.472 21	0.498 13	0.868 19	0.369 9	0.282 18	0.589 16	0.390 18	0.701 9	0.556 20	0.416 22	0.860 13	0.759 19	0.539 20

FuseNet	0.535 21	0.570 19	0.681 21	0.182 23	0.512 20	0.290 20	0.431 17	0.659 18	0.504 19	0.495 14	0.903 13	0.308 20	0.428 3	0.523 22	0.365 20	0.676 13	0.621 14	0.470 12	0.762 23	0.779 14	0.541 18
Caner Hazirbas, Lingni Ma, Csaba Domokos, Daniel Cremers: FuseNet: Incorporating Depth into Semantic Segmentation via Fusion-based CNN Architecture. ACCV 2016
AdapNet++	0.503 22	0.613 13	0.722 14	0.418 18	0.358 27	0.337 8	0.370 24	0.479 25	0.443 23	0.368 25	0.907 10	0.207 24	0.213 26	0.464 25	0.525 6	0.618 23	0.657 8	0.450 17	0.788 21	0.721 24	0.408 26
Abhinav Valada, Rohit Mohan, Wolfram Burgard: Self-Supervised Model Adaptation for Multimodal Semantic Segmentation. International Journal of Computer Vision, 2019
3DMV (2d proj)	0.498 23	0.481 25	0.612 24	0.579 9	0.456 23	0.343 7	0.384 22	0.623 23	0.525 17	0.381 24	0.845 23	0.254 23	0.264 22	0.557 19	0.182 25	0.581 25	0.598 16	0.429 21	0.760 24	0.661 26	0.446 25
Angela Dai, Matthias Niessner: 3DMV: Joint 3D-Multi-View Prediction for 3D Semantic Scene Segmentation. ECCV'18
MSeg1080_RVC	0.485 24	0.505 23	0.709 16	0.092 26	0.427 24	0.241 23	0.411 21	0.654 20	0.385 27	0.457 19	0.861 21	0.053 27	0.279 19	0.503 23	0.481 9	0.645 19	0.626 13	0.365 25	0.748 25	0.725 23	0.529 21
John Lambert, Zhuang Liu, Ozan Sener, James Hays, Vladlen Koltun: MSeg: A Composite Dataset for Multi-domain Semantic Segmentation. CVPR 2020
ILC-PSPNet	0.475 25	0.490 24	0.581 25	0.289 20	0.507 22	0.067 27	0.379 23	0.610 24	0.417 25	0.435 21	0.822 26	0.278 22	0.267 20	0.503 23	0.228 23	0.616 24	0.533 23	0.375 24	0.820 19	0.729 22	0.560 17

Enet (reimpl)	0.376 26	0.264 27	0.452 27	0.452 13	0.365 25	0.181 25	0.143 27	0.456 26	0.409 26	0.346 26	0.769 27	0.164 25	0.218 25	0.359 26	0.123 27	0.403 27	0.381 27	0.313 27	0.571 26	0.685 25	0.472 24
Re-implementation of Adam Paszke, Abhishek Chaurasia, Sangpil Kim, Eugenio Culurciello: ENet: A Deep Neural Network Architecture for Real-Time Semantic Segmentation.
ScanNet (2d proj)	0.330 27	0.293 26	0.521 26	0.657 6	0.361 26	0.161 26	0.250 26	0.004 27	0.440 24	0.183 27	0.836 24	0.125 26	0.060 27	0.319 27	0.132 26	0.417 26	0.412 26	0.344 26	0.541 27	0.427 27	0.109 27
Angela Dai, Angel X. Chang, Manolis Savva, Maciej Halber, Thomas Funkhouser, Matthias Nießner: ScanNet: Richly-annotated 3D Reconstructions of Indoor Scenes. CVPR'17

Method	avg ap	bathtub	bed	bookshelf	cabinet	chair	counter	curtain	desk	door	otherfurniture	picture	refrigerator	shower curtain	sink	sofa	table	toilet	window

EMSANet (Instance)	0.241 1	0.401 1	0.439 1	0.085 1	0.242 1	0.220 1	0.081 1	0.289 2	0.117 2	0.121 1	0.182 1	0.126 1	0.346 1	0.181 2	0.181 2	0.358 1	0.156 1	0.675 2	0.131 1
Seichter, Daniel and Fischedick, Söhnke and Köhler, Mona and Gross, Horst-Michael: EMSANet: Efficient Multi-Task RGB-D Scene Analysis for Indoor Environments. IJCNN 2022
UniDet_RVC	0.205 2	0.381 2	0.323 3	0.037 3	0.226 3	0.177 3	0.063 2	0.277 3	0.120 1	0.067 3	0.131 3	0.074 3	0.317 2	0.080 3	0.235 1	0.289 3	0.141 3	0.678 1	0.080 3

FKNet	0.204 3	0.334 3	0.358 2	0.038 2	0.234 2	0.184 2	0.025 3	0.318 1	0.042 4	0.088 2	0.141 2	0.053 4	0.300 3	0.207 1	0.171 3	0.292 2	0.149 2	0.636 3	0.109 2

MaskRCNN_ScanNet	0.119 4	0.129 4	0.212 4	0.002 4	0.112 4	0.148 4	0.014 4	0.205 4	0.044 3	0.066 4	0.078 4	0.095 2	0.142 4	0.030 4	0.128 4	0.139 4	0.080 4	0.459 4	0.057 4
Re-implementation of Kaiming He, Georgia Gkioxari, Piotr Dollár, Ross Girshick: Mask R-CNN. ICCV'17

Presenting the ScanNet200 Benchmark

ScanNet200 Benchmark

ScanNet200 3D Semantic Label Benchmark

ScanNet200 3D Semantic Instance Benchmark

ScanNet Benchmark

3D Semantic Label Benchmark

3D Semantic Instance Benchmark

2D Semantic Label Benchmark

2D Semantic Instance Benchmark

Scene Type Classification Benchmark

Method	avg recall	apartment	bathroom	bedroom / hotel	bookstore / library	conference room	copy/mail room	hallway	kitchen	laundry room	living room / lounge	misc	office	storage / basement / garage

LAST-PCL-type	0.780 1	0.250 3	1.000 1	1.000 1	1.000 1	1.000 1	1.000 1	0.500 2	1.000 1	0.500 2	0.889 1	0.000 2	1.000 1	1.000 1
Yanmin Wu, Qiankun Gao, Renrui Zhang, and Jian Zhang: Language-Assisted 3D Scene Understanding. arxiv23.12
multi-task	0.700 2	0.500 1	1.000 1	0.882 3	0.500 3	1.000 1	1.000 1	0.500 2	1.000 1	1.000 1	0.778 2	0.000 2	0.938 2	0.000 3
Shengyu Huang, Mikhail Usvyatsov, Konrad Schindler: Indoor Scene Recognition in 3D. IROS 2020
3DASPP-SCE	0.691 3	0.500 1	0.938 3	0.824 4	1.000 1	1.000 1	0.500 3	1.000 1	0.857 3	0.500 2	0.556 4	0.000 2	0.812 3	0.500 2

SE-ResNeXt-SSMA	0.498 4	0.000 5	0.812 4	0.941 2	0.500 3	0.500 4	0.500 3	0.500 2	0.429 5	0.500 2	0.667 3	0.500 1	0.625 4	0.000 3
Abhinav Valada, Rohit Mohan, Wolfram Burgard: Self-Supervised Model Adaptation for Multimodal Semantic Segmentation. arXiv
resnet50_scannet	0.353 5	0.250 3	0.812 4	0.529 5	0.500 3	0.500 4	0.000 5	0.500 2	0.571 4	0.000 5	0.556 4	0.000 2	0.375 5	0.000 3