paper-with-me

Papers

ObitoNet: Multimodal High-Resolution Point Cloud Reconstruction

2024-12-25 · Apoorv Thapliyal, Vinay Lanka, Swathi Baskaran

ObitoNet employs a Cross Attention mechanism to integrate multimodal inputs, where Vision Transformers (ViT) extract semantic features from images and a point cloud tokenizer processes geometric information using Farthest Point Sampling (FPS) and K Nearest Neighbors (KNN) for spatial structure capture. The learned multimodal features are fed into a transformer-based decoder for high-resolution point cloud reconstruction. This approach leverages the complementary strengths of both modalities rich image features and precise geometric details ensuring robust point cloud generation even in challenging conditions such as sparse or noisy data.

📄 PDF Abstract BibTeX arXiv:2412.18775

Code (1)

vinay-lanka/ObitoNet 공식 구현 pytorch

Tasks

DecoderPoint Cloud GenerationPoint cloud reconstruction

Methods 이 논문이 사용한 방법론

Softmax The Softmax output function transforms a previous layer's output into a vector of probabilities. It is commonly used for multiclass classification. Given an input vector $x$…
Attention 설명 없음

Similar Papers 제목 키워드 기반

CL3DOR: Contrastive Learning for 3D Large Multimodal Models via Odds Ratio on High-Resolution Point Clouds

2025-01-07 · Keonwoo Kim, Yeongjae Cho, Taebaek Hwang, Minsoo Jo 외

Recent research has demonstrated that Large Language Models (LLMs) are not limited to text-only tasks but can also function as multimodal models across various modalities, including audio, images, and videos. In particul…

Contrastive LearningLanguage ModelingLanguage ModellingScene Understanding+1

Real-IAD D3: A Real-World 2D/Pseudo-3D/3D Dataset for Industrial Anomaly Detection

2025-04-19 · CVPR 2025 1 · Wenbing Zhu, Lidong Wang, Ziqing Zhou, Chengjie Wang 외

The increasing complexity of industrial anomaly detection (IAD) has positioned multimodal detection methods as a focal area of machine vision research. However, dedicated multimodal datasets specifically tailored for IAD…

Anomaly Detection

Dense 3D Point Cloud Reconstruction Using a Deep Pyramid Network

2019-01-25 · Priyanka Mandikal, R. Venkatesh Babu

Reconstructing a high-resolution 3D model of an object is a challenging task in computer vision. Designing scalable and light-weight architectures is crucial while addressing this problem. Existing point-cloud based reco…

3D Point Cloud ReconstructionPoint cloud reconstruction

PointHR: Exploring High-Resolution Architectures for 3D Point Cloud Segmentation

2023-10-11 · Haibo Qiu, Baosheng Yu, Yixin Chen, DaCheng Tao

Significant progress has been made recently in point cloud segmentation utilizing an encoder-decoder framework, which initially encodes point clouds into low-resolution representations and subsequently decodes high-resol…

DecoderPoint Cloud SegmentationSemantic Segmentation

PointInfinity: Resolution-Invariant Point Diffusion Models

2024-04-04 · CVPR 2024 1 · Zixuan Huang, Justin Johnson, Shoubhik Debnath, James M. Rehg 외

We present PointInfinity, an efficient family of point cloud diffusion models. Our core idea is to use a transformer-based architecture with a fixed-size, resolution-invariant latent representation. This enables efficien…