
VRSBench
VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding
NeurIPS2024 · Image Captioning & Object Referring & Visual Question Answering
遥感多模态基础模型相关公开数据与评测基准 · 共 116 个

VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding
NeurIPS2024 · Image Captioning & Object Referring & Visual Question Answering

CHOICE: Evaluating and Understanding Vision-Language Model Choices in Remote Sensing
NeurIPS2025 · Perception & Reasoning

A semantic-enhanced multi-modal remote sensing foundation model for Earth observation
Nature Machine Intelligence 2025

UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios
AAAI2025 · Object Referring & Visual Question Answering & Counting & Scene Classification & Location Recognition & Geolocalization

PANGAEA: A Global and Inclusive Benchmark for Geospatial Foundation Models
Arxiv2024 · Segmentation & Change detection & Regression

REOBench: Benchmarking Robustness of Earth Observation Foundation Models
Arxiv2025 · Robustness across 6 Earth observation tasks

GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning
Arxiv2026 · Logical consistency & multi-step reasoning

Earth-Agent: Unlocking the Full Landscape of Earth Observation with Agents (Earth-Bench is the benchmark introduced in this paper)
ICLR2026 · Tool-augmented EO reasoning & multi-step planning & quantitative spatiotemporal analysis

GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing
CVPR2026 · Expert-level multimodal QA across RS disciplines, sensors & tasks

OpenEarth-Agent: From Tool Calling to Tool Creation for Open-Environment Earth Observation (OpenEarth-Bench is the benchmark introduced in this paper)
Arxiv2026 · Full-pipeline EO across 7 application domains

GeoChat: Grounded Large Vision-Language Model for Remote Sensing
CVPR2024 · Grounded VQA & referring

LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model
ECCV2024 · Multimodal RS interpretation

VLRS-Bench: Vision-language reasoning benchmark for remote sensing
Arxiv2026 · VL reasoning







Plantation Bench: A Multiscale, Multimodal Remote Sensing Benchmark for Plantation Mapping Under Distribution Shift
ICCVW2025 · Plantation Mapping under Distribution Shift

ChatEarthBench: Benchmarking multimodal large language models for Earth observation
IEEE GRSM2026 · Benchmarking EO multimodal large language models


Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation
CVPR2026 · UAV spatial intelligence evaluation for Vision-Language Models



GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis
Arxiv2026 · Dynamic execution evaluation for tool-augmented GIS agents







EarthShift: Robustness benchmark for real-world distribution shifts
Arxiv2026 · Distribution shift / robustness

UHR-Micro: Ultra-high-resolution evidence localization benchmark
Arxiv2026 · Evidence localization

LithoBench: Remote-sensing lithology interpretation benchmark
Arxiv2026 · Lithology interpretation

Sentinel2Cap: Human-annotated Sentinel-2 image captioning benchmark
Arxiv2026 · Image captioning




SkyScript: A Large and Semantically Diverse Vision-Language Dataset for Remote Sensing
AAAI2024 · Vision-Language

MMEarth: Exploring Multi-Modal Pretext Tasks For Geospatial Representation Learning
Arxiv2024 · Vision

Harnessing Massive Satellite Imagery with Efficient Masked Image Modeling
ICCV2025 · Vision

VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding
NeurIPS2024 · Vision-Language

MMM-RS: A Multi-modal, Multi-GSD, Multi-scene Remote Sensing Dataset and Benchmark for Text-to-Image Generation
Arxiv2024 · Vision-Language

A Multi-Modal, Multi-Label Earth Observation Dataset Integrating Interferometric SAR and Multispectral Data
NeurIPS2024 · Vision

EarthDial: Turning Multi-sensory Earth Observations to Interactive Dialogues
CVPR2025 · Vision-Language

GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing
IEEE GRSM2025 · Vision-Language

Rethinking Remote Sensing CLIP: Leveraging Multimodal Large Language Models for High-Quality Vision-Language Dataset
ICONIP2024 · Vision-Language

Falcon: A Remote Sensing Vision-Language Foundation Model
Arxiv2025 · Vision-Language

RemoteSAM: Towards Segment Anything for Earth Observation
ACMMM2025 · Vision-Language

GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery
Arxiv2026 · Vision-Language

SOMA-1M: A Large-Scale SAR-Optical Multi-resolution Alignment Dataset for Multi-Task Remote Sensing
Arxiv2026 · Vision (SAR-Optical)

GeoChat: Grounded Large Vision-Language Model for Remote Sensing
CVPR2024 · Vision-Language

EarthGPT: A Universal Multimodal Large Language Model for Multisensor Image Comprehension
TGRS2024 · Vision-Language

LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model
ECCV2024 · Vision-Language

Quality-Driven Curation of Remote Sensing Vision-Language Data via Learned Scoring Models
NeurIPS2025 · Vision-Language

DisasterM3: A multimodal multi-task disaster interpretation dataset
NeurIPS2025 · Vision-Language

SpectralEarth-MM: Multimodal, multisensor pretraining data
Arxiv2026 · Vision

SkySense-VITA: Towards Universal In-context Segmentation of Multi-modal Remote Sensing Imagery
CVPR2026 · Vision-Language

UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes
CVPR2026 · Vision-Language

GroundSet: Cadastral-grounded vector-data spatial understanding dataset
Arxiv2026 · Vision-Language

EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing
TGRS2024 · Vision-Language

Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset
GRSM2025 · Vision-Language

EarthGPT-X: a spatial-aware multimodal large language model for multi-resolution remote sensing imagery
Arxiv2025 · Vision-Language (multi-resolution)

RingMo-Agent: A Unified Remote Sensing Foundation Model for Multi-Platform and Multi-Modal Reasoning
Arxiv2025 · Vision-Language (optical / SAR / IR)




















LuoJiaHOG: A hierarchy oriented geo-aware image caption dataset for remote sensing image-text retrieval
ISPRS JPRS2025 · Vision-Language








Towards LLM Agents for Earth Observation: The UnivEARTH Dataset
Arxiv2025 · Vision-Language & Agents







BigEarthNet.txt: Large-scale multi-sensor image-text dataset and benchmark
Arxiv2026 · Vision-Language

FusionRS: RGB-infrared remote sensing vision-language dataset
Arxiv2026 · Vision-Language

ChronoEarth-492K: Long-horizon spatiotemporal hyperspectral dataset and benchmark
Arxiv2026 · Vision







TESSERA: Temporal Embeddings of Surface Spectra for Earth Representation and Analysis
CVPR2026 · Embeddings

AlphaEarth Foundations: An embedding field model for accurate and efficient global mapping from sparse label data
Arxiv2025 · Embeddings

Democratizing planetary-scale analysis: An ultra-lightweight Earth embedding database for accurate and flexible global land monitoring
Arxiv2026 · Embeddings



