Dataset Overview
This section provides detailed documentation for all supported datasets in PyGDA, including their domains and sources.
Citation Networks
Arxiv
- Domains: 3 domains based on publication years
- Source: ogbn-arxiv
- Processing: See ArxivDataset
- Features: Generated from paper abstracts
- Note: Can be preprocessed with scripts in benchmark folder
Citation
- Domains: ACMv9, Citationv1, DBLPv7
- Source: Adopted from ASN
- Processing: See CitationDataset
- Download: Download Link
MAG
- Domains: CN, DE, FR, JP, RU, US
- Source: Originally from ogbn-mag
- Processing: See MAGDataset
- Download: Download Link
- Note: Separated into 6 countries by PairAlign
Social Networks
Blog
- Domains: Blog1, Blog2
- Source: Adopted from ACDNE
- Processing: See BlogDataset
- Download: Download Link
Twitch
- Domains: DE, EN, ES, FR, PT, RU
- Source: Twitch Social Networks
- Processing: See TwitchDataset
- Download: Download Link
Infrastructure Networks
Airport
- Domains: Brazil, Europe, USA
- Source: Adopted from struc2vec
- Processing: See AirportDataset
- Features: Constructed using OneHotDegree for each node
- Download: Download Link
Graph Classification Benchmarks
TUGraph
-
Datasets:
- PROTEINS
- FRANKENSTEIN
- Mutagenicity
-
Domains: 2 domains based on density for each dataset
- Source: Adopted from TUDataset
- Processing: See GraphTUDataset
- Download: Download Link
Usage Example
from pygda.datasets import CitationDataset
# Load the Citation dataset
dataset = CitationDataset(root='data/citation', name='ACMv9')
data = dataset[0]
# Access the data
x = data.x # Node features
edge_index = data.edge_index # Graph connectivity
y = data.y # Labels
Each dataset documentation includes:
- Detailed domain descriptions
- Data sources and references
- Processing instructions
- Download information
- Usage examples
- Implementation details
For specific details about each dataset, please visit their respective documentation pages linked above.