← 返回

← 全部遥感数据

多模态基础模型数据/基准

遥感多模态基础模型相关公开数据与评测基准 · 共 116 个

评测基准 (Benchmarks)

VRSBench

VRSBench

VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding

NeurIPS2024 · Image Captioning & Object Referring & Visual Question Answering

CHOICE

CHOICE

CHOICE: Evaluating and Understanding Vision-Language Model Choices in Remote Sensing

NeurIPS2025 · Perception & Reasoning

SkySense++

SkySense++

A semantic-enhanced multi-modal remote sensing foundation model for Earth observation

Nature Machine Intelligence 2025

UrBench

UrBench

UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios

AAAI2025 · Object Referring & Visual Question Answering & Counting & Scene Classification & Location Recognition & Geolocalization

PANGAEA

PANGAEA

PANGAEA: A Global and Inclusive Benchmark for Geospatial Foundation Models

Arxiv2024 · Segmentation & Change detection & Regression

REOBench

REOBench

REOBench: Benchmarking Robustness of Earth Observation Foundation Models

Arxiv2025 · Robustness across 6 Earth observation tasks

GeoReason-Bench

GeoReason-Bench

GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning

Arxiv2026 · Logical consistency & multi-step reasoning

Earth-Bench

Earth-Bench

Earth-Agent: Unlocking the Full Landscape of Earth Observation with Agents (Earth-Bench is the benchmark introduced in this paper)

ICLR2026 · Tool-augmented EO reasoning & multi-step planning & quantitative spatiotemporal analysis

GeoMMBench

GeoMMBench

GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing

CVPR2026 · Expert-level multimodal QA across RS disciplines, sensors & tasks

OpenEarth-Bench

OpenEarth-Bench

OpenEarth-Agent: From Tool Calling to Tool Creation for Open-Environment Earth Observation (OpenEarth-Bench is the benchmark introduced in this paper)

Arxiv2026 · Full-pipeline EO across 7 application domains

GeoChat-Bench

GeoChat-Bench

GeoChat: Grounded Large Vision-Language Model for Remote Sensing

CVPR2024 · Grounded VQA & referring

LHRS-Bench

LHRS-Bench

LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model

ECCV2024 · Multimodal RS interpretation

VLRS-Bench

VLRS-Bench

VLRS-Bench: Vision-language reasoning benchmark for remote sensing

Arxiv2026 · VL reasoning

GEO-Bench

GEO-Bench

GEO-Bench: Toward Foundation Models for Earth Monitoring

Arxiv2023 · Classification & Segmentation

FoMo-Bench

FoMo-Bench

FoMo: Multi-Modal, Multi-Scale and Multi-Task Remote Sensing Foundation Models for Forest Monitoring

Arxiv2023 · Classification & Segmentation & Detection for forest monitoring

PhilEO

PhilEO

PhilEO Bench: Evaluating Geo-Spatial Foundation Models

Arxiv2024 · Segmentation & Regression estimation

VLEO-Bench

VLEO-Bench

Good at captioning, bad at counting: Benchmarking GPT-4V on Earth observation data

Arxiv2024 · Location Recognition & Captioning & Scene Classification & Counting & Detection & Change detection

GEO-Bench-VLM

GEO-Bench-VLM

GEO-Bench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks

ICCV2025 · Scene Understanding & Counting & Object Classification & Event Detection & Spatial Relations

Copernicus-Bench

Copernicus-Bench

Towards a Unified Copernicus Foundation Model for Earth Vision

ICCV2025 · Segmentation & Classification & Change detection & Regression

Plantation Bench

Plantation Bench

Plantation Bench: A Multiscale, Multimodal Remote Sensing Benchmark for Plantation Mapping Under Distribution Shift

ICCVW2025 · Plantation Mapping under Distribution Shift

ChatEarthBench

ChatEarthBench

ChatEarthBench: Benchmarking multimodal large language models for Earth observation

IEEE GRSM2026 · Benchmarking EO multimodal large language models

OmniEarth

OmniEarth

OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks

Arxiv2026 · Perception & Reasoning & Robustness across geospatial tasks

SpatialSky-Bench

SpatialSky-Bench

Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation

CVPR2026 · UAV spatial intelligence evaluation for Vision-Language Models

RSVLM-QA

RSVLM-QA

RSVLM-QA: A Benchmark Dataset for Remote Sensing Vision Language Model-based Question Answering

ACM MM2025 · Visual Question Answering & Image Captioning & Counting

Geo3DVQA

Geo3DVQA

Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery

WACV2026 · 3D geospatial reasoning & height-aware spatial analysis

GeoAgentBench

GeoAgentBench

GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis

Arxiv2026 · Dynamic execution evaluation for tool-augmented GIS agents

XLRS-Bench

XLRS-Bench

XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery?

CVPR2025 · Ultra-high-resolution multimodal understanding

NAIP-OSM

NAIP-OSM

Remote Sensing Vision-Language Foundation Models without Annotations via Ground Remote Alignment

ICLR2024 · Location Recognition / GRAFT evaluation

ThinkGeo

ThinkGeo

ThinkGeo: Evaluating Tool-Augmented Agents for Remote Sensing Tasks

Arxiv2025 · Tool-augmented RS agents

SARChat-Bench-2M

SARChat-Bench-2M

SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation

Arxiv2025 · SAR vision-language

RS-Neg

RS-Neg

RS-Neg: Negative-aware evaluation for remote sensing vision-language models

ECCV2026 · Robustness / negative samples

A2Seek

A2Seek

A2Seek: Towards reasoning-aware remote sensing visual search

Arxiv2025 · Visual search & reasoning

EarthShift

EarthShift

EarthShift: Robustness benchmark for real-world distribution shifts

Arxiv2026 · Distribution shift / robustness

UHR-Micro

UHR-Micro

UHR-Micro: Ultra-high-resolution evidence localization benchmark

Arxiv2026 · Evidence localization

LithoBench

LithoBench

LithoBench: Remote-sensing lithology interpretation benchmark

Arxiv2026 · Lithology interpretation

Sentinel2Cap

Sentinel2Cap

Sentinel2Cap: Human-annotated Sentinel-2 image captioning benchmark

Arxiv2026 · Image captioning

FIT-RSFG

FIT-RSFG

SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding

Arxiv2024 · Fine-grained VL evaluation

FIT-RSRC

FIT-RSRC

SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding

Arxiv2024 · Relation comprehension evaluation

AirSpatial

AirSpatial

AirSpatialBot: A Spatially-Aware Aerial Agent for Remote Sensing Visual Question Answering

TGRS2025 · Spatial VQA benchmark

大规模预训练数据 (Pre-training Datasets)

SkyScript

SkyScript

SkyScript: A Large and Semantically Diverse Vision-Language Dataset for Remote Sensing

AAAI2024 · Vision-Language

MMEarth

MMEarth

MMEarth: Exploring Multi-Modal Pretext Tasks For Geospatial Representation Learning

Arxiv2024 · Vision

RS-4M

RS-4M

Harnessing Massive Satellite Imagery with Efficient Masked Image Modeling

ICCV2025 · Vision

VRSBench

VRSBench

VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding

NeurIPS2024 · Vision-Language

MMM-RS

MMM-RS

MMM-RS: A Multi-modal, Multi-GSD, Multi-scene Remote Sensing Dataset and Benchmark for Text-to-Image Generation

Arxiv2024 · Vision-Language

M3LEO

M3LEO

A Multi-Modal, Multi-Label Earth Observation Dataset Integrating Interferometric SAR and Multispectral Data

NeurIPS2024 · Vision

EarthDial-Instruct

EarthDial-Instruct

EarthDial: Turning Multi-sensory Earth Observations to Interactive Dialogues

CVPR2025 · Vision-Language

GeoPixInstruct

GeoPixInstruct

GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing

IEEE GRSM2025 · Vision-Language

GeoLangBind-2M

GeoLangBind-2M

Rethinking Remote Sensing CLIP: Leveraging Multimodal Large Language Models for High-Quality Vision-Language Dataset

ICONIP2024 · Vision-Language

RemoteSAM-270K

RemoteSAM-270K

RemoteSAM: Towards Segment Anything for Earth Observation

ACMMM2025 · Vision-Language

UHR-CoZ

UHR-CoZ

GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery

Arxiv2026 · Vision-Language

SOMA-1M

SOMA-1M

SOMA-1M: A Large-Scale SAR-Optical Multi-resolution Alignment Dataset for Multi-Task Remote Sensing

Arxiv2026 · Vision (SAR-Optical)

GeoChat-Instruct

GeoChat-Instruct

GeoChat: Grounded Large Vision-Language Model for Remote Sensing

CVPR2024 · Vision-Language

MMRS-1M

MMRS-1M

EarthGPT: A Universal Multimodal Large Language Model for Multisensor Image Comprehension

TGRS2024 · Vision-Language

LHRS-Align & LHRS-Instruct

LHRS-Align & LHRS-Instruct

LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model

ECCV2024 · Vision-Language

ScoreRS

ScoreRS

Quality-Driven Curation of Remote Sensing Vision-Language Data via Learned Scoring Models

NeurIPS2025 · Vision-Language

DisasterM3

DisasterM3

DisasterM3: A multimodal multi-task disaster interpretation dataset

NeurIPS2025 · Vision-Language

SpectralEarth-MM

SpectralEarth-MM

SpectralEarth-MM: Multimodal, multisensor pretraining data

Arxiv2026 · Vision

Sky-VT-300K

Sky-VT-300K

SkySense-VITA: Towards Universal In-context Segmentation of Multi-modal Remote Sensing Imagery

CVPR2026 · Vision-Language

GeoSeg-1M

GeoSeg-1M

UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes

CVPR2026 · Vision-Language

GroundSet

GroundSet

GroundSet: Cadastral-grounded vector-data spatial understanding dataset

Arxiv2026 · Vision-Language

RSVP

RSVP

EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing

TGRS2024 · Vision-Language

Git-10M

Git-10M

Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset

GRSM2025 · Vision-Language

M-RSVP

M-RSVP

EarthGPT-X: a spatial-aware multimodal large language model for multi-resolution remote sensing imagery

Arxiv2025 · Vision-Language (multi-resolution)

RS-VL3M

RS-VL3M

RingMo-Agent: A Unified Remote Sensing Foundation Model for Multi-Platform and Multi-Modal Reasoning

Arxiv2025 · Vision-Language (optical / SAR / IR)

SEN12MS

SEN12MS

SEN12MS -- A Curated Dataset of Georeferenced Multi-Spectral Sentinel-1/2 Imagery for Deep Learning and Data Fusion

- · Vision

BEN-MM

BEN-MM

BigEarthNet-MM: A Large Scale Multi-Modal Multi-Label Benchmark Archive for Remote Sensing Image Classification and Retrieval

GRSM2021 · Vision

MillionAID

MillionAID

On Creating Benchmark Dataset for Aerial Image Interpretation: Reviews, Guidances, and Million-AID

JSTARS2021 · Vision

SeCo

SeCo

Seasonal Contrast: Unsupervised Pre-Training From Uncurated Remote Sensing Data

ICCV2021 · Vision

fMoW-S2

fMoW-S2

Functional Map of the World — Sentinel-2: temporal and multi-spectral pre-training data released with SatMAE

NeurIPS2022 · Vision

TOV-RS-Balanced

TOV-RS-Balanced

TOV: The original vision model for optical remote sensing image understanding via self-supervised learning

JSTARS2023 · Vision

SSL4EO-S12

SSL4EO-S12

SSL4EO-S12: A Large-Scale Multi-Modal, Multi-Temporal Dataset for Self-Supervised Learning in Earth Observation

GRSM2023 · Vision

SSL4EO-L

SSL4EO-L

SSL4EO-L: Datasets and Foundation Models for Landsat Imagery

Arxiv2023 · Vision

SatlasPretrain

SatlasPretrain

SatlasPretrain: A Large-Scale Dataset for Remote Sensing Image Understanding

ICCV2023 · Vision (Supervised)

CACo

CACo

Change-Aware Sampling and Contrastive Learning for Satellite Images

CVPR2023 · Vision

SAMRS

SAMRS

SAMRS: Scaling-up Remote Sensing Segmentation Dataset with Segment Anything Model

NeurIPS2023 · Vision

RSVG

RSVG

RSVG: Exploring Data and Models for Visual Grounding on Remote Sensing Data

TGRS2023 · Vision-Language

RS5M

RS5M

RS5M: A Large Scale Vision-Language Dataset for Remote Sensing Vision-Language Foundation Model

Arxiv2023 · Vision-Language

GEO-Bench

GEO-Bench

GEO-Bench: Toward Foundation Models for Earth Monitoring

Arxiv2023 · Vision (Evaluation)

RSICap & RSIEval

RSICap & RSIEval

RSGPT: A Remote Sensing Vision Language Model and Benchmark

Arxiv2023 · Vision-Language

Clay

Clay

Clay Foundation Model

- · Vision

SATIN

SATIN

SATIN: A Multi-Task Metadataset for Classifying Satellite Imagery using Vision-Language Models

ICCVW2023 · Vision-Language

ChatEarthNet

ChatEarthNet

ChatEarthNet: a global-scale image-text dataset empowering vision-language geo-foundation models

ESSD2025 · Vision-Language

LuoJiaHOG

LuoJiaHOG

LuoJiaHOG: A hierarchy oriented geo-aware image caption dataset for remote sensing image-text retrieval

ISPRS JPRS2025 · Vision-Language

SeeFar

SeeFar

SeeFar: Satellite Agnostic Multi-Resolution Dataset for Geospatial Foundation Models

Arxiv2024 · Vision

FIT-RS

FIT-RS

SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding

Arxiv2024 · Vision-Language

RS-GPT4V

RS-GPT4V

RS-GPT4V: A Unified Multimodal Instruction-Following Dataset for Remote Sensing Image Understanding

Arxiv2024 · Vision-Language

Major TOM

Major TOM

Major TOM: Expandable Datasets for Earth Observation

Arxiv2024 · Vision

DDFAV

DDFAV

DDFAV: Remote Sensing Large Vision Language Models Dataset and Evaluation Benchmark

RS2025 · Vision-Language

Copernicus-Pretrain

Copernicus-Pretrain

Towards a Unified Copernicus Foundation Model for Earth Vision

ICCV2025 · Vision

DGTRSD

DGTRSD

DGTRSD & DGTRS-CLIP: A Dual-Granularity Remote Sensing Image-Text Dataset and Vision Language Foundation Model for Alignment

Arxiv2025 · Vision-Language

GeoPixelD

GeoPixelD

GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing

ICML2025 · Vision-Language

UnivEARTH

UnivEARTH

Towards LLM Agents for Earth Observation: The UnivEARTH Dataset

Arxiv2025 · Vision-Language & Agents

OpenEarthAgent Dataset

OpenEarthAgent Dataset

OpenEarthAgent: A Unified Framework for Tool-Augmented Geospatial Agents

Arxiv2026 · Vision-Language & Agents

SkyEye-968k

SkyEye-968k

SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning

ISPRS JPRS2025 · Vision-Language

TEOChatlas

TEOChatlas

TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data

ICLR2025 · Vision-Language (temporal)

SARLANG-1M

SARLANG-1M

SARLANG-1M: A large-scale SAR vision-language dataset

ICLR2025 · Vision-Language (SAR)

FUSAR-GEOVL-1M

FUSAR-GEOVL-1M

FUSAR-KLIP: Towards Multimodal Foundation Models for Remote Sensing

Arxiv2025 · Vision-Language (SAR)

VariousRS-Instruct

VariousRS-Instruct

VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis

AAAI2025 · Vision-Language

BigEarthNet.txt

BigEarthNet.txt

BigEarthNet.txt: Large-scale multi-sensor image-text dataset and benchmark

Arxiv2026 · Vision-Language

FusionRS

FusionRS

FusionRS: RGB-infrared remote sensing vision-language dataset

Arxiv2026 · Vision-Language

ChronoEarth-492K

ChronoEarth-492K

ChronoEarth-492K: Long-horizon spatiotemporal hyperspectral dataset and benchmark

Arxiv2026 · Vision

SkyCap

SkyCap

SkyCap: Bitemporal VHR optical-SAR quartets

Arxiv2025 · Vision (Optical-SAR)

ChangeChat-87k

ChangeChat-87k

ChangeChat: A remote sensing change interpretation instruction dataset

ICASSP2025 · Vision-Language

RS-EoT-4K

RS-EoT-4K

Asking like Socrates: Remote sensing chain-of-thought data

Arxiv2025 · Vision-Language

GAIA

GAIA

GAIA: A global, richly annotated image-text dataset for Earth observation

Arxiv2025 · Vision-Language

SARVLM-1M

SARVLM-1M

SARVLM: A Vision Language Foundation Model for Semantic Understanding and Target Recognition in SAR Imagery

Arxiv2025 · Vision-Language (SAR)

LAION-EO

LAION-EO

From LAION-5B to LAION-EO: Filtering Billions of Images Using Anchor Datasets for Satellite Image Extraction

ICCVW2023 · Vision-Language

Embedding 数据

TESSERA

TESSERA

TESSERA: Temporal Embeddings of Surface Spectra for Earth Representation and Analysis

CVPR2026 · Embeddings

AlphaEarth

AlphaEarth

AlphaEarth Foundations: An embedding field model for accurate and efficient global mapping from sparse label data

Arxiv2025 · Embeddings

ESD

ESD

Democratizing planetary-scale analysis: An ultra-lightweight Earth embedding database for accurate and flexible global land monitoring

Arxiv2026 · Embeddings

CLAY Embeddings

CLAY Embeddings

Clay Model v0 Embeddings

Source Cooperative2024 · Embeddings

Major TOM Embeddings

Major TOM Embeddings

Global and Dense Embeddings of Earth: Major TOM Floating in the Latent Space

Arxiv2024 · Embeddings

Earth Genome Embeddings

Earth Genome Embeddings

Embeddings for all

Medium2025 · Embeddings

Copernicus-Embed

Copernicus-Embed

Towards a Unified Copernicus Foundation Model for Earth Vision

ICCV2025 Oral · Embeddings