PyPI - pyg-nightly - Versions diffs - 2.6.0.dev20240319__py3-none-any.whl → 2.7.0.dev20250114__py3-none-any.whl - Mend

pyg-nightly 2.6.0.dev20240319py3-none-any.whl → 2.7.0.dev20250114py3-none-any.whl

Files changed (226) hide show

{pyg_nightly-2.6.0.dev20240319.dist-info → pyg_nightly-2.7.0.dev20250114.dist-info}/METADATA +31 -47
{pyg_nightly-2.6.0.dev20240319.dist-info → pyg_nightly-2.7.0.dev20250114.dist-info}/RECORD +226 -199
{pyg_nightly-2.6.0.dev20240319.dist-info → pyg_nightly-2.7.0.dev20250114.dist-info}/WHEEL +1 -1
torch_geometric/__init__.py +28 -1
torch_geometric/_compile.py +8 -1
torch_geometric/_onnx.py +14 -0
torch_geometric/config_mixin.py +113 -0
torch_geometric/config_store.py +28 -19
torch_geometric/data/__init__.py +24 -1
torch_geometric/data/batch.py +2 -2
torch_geometric/data/collate.py +8 -2
torch_geometric/data/data.py +16 -8
torch_geometric/data/database.py +61 -15
torch_geometric/data/dataset.py +14 -6
torch_geometric/data/feature_store.py +25 -42
torch_geometric/data/graph_store.py +1 -5
torch_geometric/data/hetero_data.py +18 -9
torch_geometric/data/in_memory_dataset.py +2 -4
torch_geometric/data/large_graph_indexer.py +677 -0
torch_geometric/data/lightning/datamodule.py +4 -4
torch_geometric/data/separate.py +6 -1
torch_geometric/data/storage.py +17 -7
torch_geometric/data/summary.py +14 -4
torch_geometric/data/temporal.py +1 -2
torch_geometric/datasets/__init__.py +17 -2
torch_geometric/datasets/actor.py +9 -11
torch_geometric/datasets/airfrans.py +15 -18
torch_geometric/datasets/airports.py +10 -12
torch_geometric/datasets/amazon.py +8 -11
torch_geometric/datasets/amazon_book.py +9 -10
torch_geometric/datasets/amazon_products.py +9 -10
torch_geometric/datasets/aminer.py +8 -9
torch_geometric/datasets/aqsol.py +10 -13
torch_geometric/datasets/attributed_graph_dataset.py +10 -12
torch_geometric/datasets/ba_multi_shapes.py +10 -12
torch_geometric/datasets/ba_shapes.py +5 -6
torch_geometric/datasets/bitcoin_otc.py +1 -1
torch_geometric/datasets/brca_tgca.py +1 -1
torch_geometric/datasets/cornell.py +145 -0
torch_geometric/datasets/dblp.py +2 -1
torch_geometric/datasets/dbp15k.py +2 -2
torch_geometric/datasets/fake.py +1 -3
torch_geometric/datasets/flickr.py +2 -1
torch_geometric/datasets/freebase.py +1 -1
torch_geometric/datasets/gdelt_lite.py +3 -2
torch_geometric/datasets/ged_dataset.py +3 -2
torch_geometric/datasets/git_mol_dataset.py +263 -0
torch_geometric/datasets/gnn_benchmark_dataset.py +11 -10
torch_geometric/datasets/hgb_dataset.py +8 -8
torch_geometric/datasets/imdb.py +2 -1
torch_geometric/datasets/karate.py +3 -2
torch_geometric/datasets/last_fm.py +2 -1
torch_geometric/datasets/linkx_dataset.py +4 -3
torch_geometric/datasets/lrgb.py +3 -5
torch_geometric/datasets/malnet_tiny.py +4 -3
torch_geometric/datasets/mnist_superpixels.py +2 -3
torch_geometric/datasets/molecule_gpt_dataset.py +485 -0
torch_geometric/datasets/molecule_net.py +15 -3
torch_geometric/datasets/motif_generator/base.py +0 -1
torch_geometric/datasets/neurograph.py +1 -3
torch_geometric/datasets/ogb_mag.py +1 -1
torch_geometric/datasets/opf.py +239 -0
torch_geometric/datasets/ose_gvcs.py +1 -1
torch_geometric/datasets/pascal.py +11 -9
torch_geometric/datasets/pascal_pf.py +1 -1
torch_geometric/datasets/pcpnet_dataset.py +1 -1
torch_geometric/datasets/pcqm4m.py +10 -3
torch_geometric/datasets/ppi.py +1 -1
torch_geometric/datasets/qm9.py +8 -7
torch_geometric/datasets/rcdd.py +4 -4
torch_geometric/datasets/reddit.py +2 -1
torch_geometric/datasets/reddit2.py +2 -1
torch_geometric/datasets/rel_link_pred_dataset.py +3 -3
torch_geometric/datasets/s3dis.py +5 -3
torch_geometric/datasets/shapenet.py +3 -3
torch_geometric/datasets/shrec2016.py +2 -2
torch_geometric/datasets/snap_dataset.py +7 -1
torch_geometric/datasets/tag_dataset.py +350 -0
torch_geometric/datasets/upfd.py +2 -1
torch_geometric/datasets/web_qsp_dataset.py +246 -0
torch_geometric/datasets/webkb.py +2 -2
torch_geometric/datasets/wikics.py +1 -1
torch_geometric/datasets/wikidata.py +3 -2
torch_geometric/datasets/wikipedia_network.py +2 -2
torch_geometric/datasets/willow_object_class.py +1 -1
torch_geometric/datasets/word_net.py +2 -2
torch_geometric/datasets/yelp.py +2 -1
torch_geometric/datasets/zinc.py +1 -1
torch_geometric/device.py +42 -0
torch_geometric/distributed/local_feature_store.py +3 -2
torch_geometric/distributed/local_graph_store.py +2 -1
torch_geometric/distributed/partition.py +9 -8
torch_geometric/edge_index.py +616 -438
torch_geometric/explain/algorithm/base.py +0 -1
torch_geometric/explain/algorithm/graphmask_explainer.py +1 -2
torch_geometric/explain/algorithm/pg_explainer.py +1 -1
torch_geometric/explain/explanation.py +2 -2
torch_geometric/graphgym/checkpoint.py +2 -1
torch_geometric/graphgym/logger.py +4 -4
torch_geometric/graphgym/loss.py +1 -1
torch_geometric/graphgym/utils/agg_runs.py +6 -6
torch_geometric/index.py +826 -0
torch_geometric/inspector.py +8 -3
torch_geometric/io/fs.py +28 -2
torch_geometric/io/npz.py +2 -1
torch_geometric/io/off.py +2 -2
torch_geometric/io/sdf.py +2 -2
torch_geometric/io/tu.py +4 -5
torch_geometric/loader/__init__.py +4 -0
torch_geometric/loader/cluster.py +10 -4
torch_geometric/loader/graph_saint.py +2 -1
torch_geometric/loader/ibmb_loader.py +12 -4
torch_geometric/loader/mixin.py +1 -1
torch_geometric/loader/neighbor_loader.py +1 -1
torch_geometric/loader/neighbor_sampler.py +2 -2
torch_geometric/loader/prefetch.py +1 -1
torch_geometric/loader/rag_loader.py +107 -0
torch_geometric/loader/utils.py +8 -7
torch_geometric/loader/zip_loader.py +10 -0
torch_geometric/metrics/__init__.py +11 -2
torch_geometric/metrics/link_pred.py +159 -34
torch_geometric/nn/aggr/__init__.py +4 -0
torch_geometric/nn/aggr/attention.py +0 -2
torch_geometric/nn/aggr/base.py +2 -4
torch_geometric/nn/aggr/patch_transformer.py +143 -0
torch_geometric/nn/aggr/set_transformer.py +1 -1
torch_geometric/nn/aggr/variance_preserving.py +33 -0
torch_geometric/nn/attention/__init__.py +5 -1
torch_geometric/nn/attention/qformer.py +71 -0
torch_geometric/nn/conv/collect.jinja +7 -4
torch_geometric/nn/conv/cugraph/base.py +8 -12
torch_geometric/nn/conv/edge_conv.py +3 -2
torch_geometric/nn/conv/fused_gat_conv.py +1 -1
torch_geometric/nn/conv/gat_conv.py +35 -7
torch_geometric/nn/conv/gatv2_conv.py +36 -6
torch_geometric/nn/conv/general_conv.py +1 -1
torch_geometric/nn/conv/graph_conv.py +21 -3
torch_geometric/nn/conv/gravnet_conv.py +3 -2
torch_geometric/nn/conv/hetero_conv.py +3 -3
torch_geometric/nn/conv/hgt_conv.py +1 -1
torch_geometric/nn/conv/message_passing.py +138 -87
torch_geometric/nn/conv/mixhop_conv.py +1 -1
torch_geometric/nn/conv/propagate.jinja +9 -1
torch_geometric/nn/conv/rgcn_conv.py +5 -5
torch_geometric/nn/conv/spline_conv.py +4 -4
torch_geometric/nn/conv/x_conv.py +3 -2
torch_geometric/nn/dense/linear.py +11 -6
torch_geometric/nn/fx.py +3 -3
torch_geometric/nn/model_hub.py +3 -1
torch_geometric/nn/models/__init__.py +10 -2
torch_geometric/nn/models/deep_graph_infomax.py +1 -2
torch_geometric/nn/models/dimenet_utils.py +5 -7
torch_geometric/nn/models/g_retriever.py +230 -0
torch_geometric/nn/models/git_mol.py +336 -0
torch_geometric/nn/models/glem.py +385 -0
torch_geometric/nn/models/gnnff.py +0 -1
torch_geometric/nn/models/graph_unet.py +12 -3
torch_geometric/nn/models/jumping_knowledge.py +63 -4
torch_geometric/nn/models/lightgcn.py +1 -1
torch_geometric/nn/models/metapath2vec.py +5 -5
torch_geometric/nn/models/molecule_gpt.py +222 -0
torch_geometric/nn/models/node2vec.py +2 -3
torch_geometric/nn/models/schnet.py +2 -1
torch_geometric/nn/models/signed_gcn.py +3 -3
torch_geometric/nn/module_dict.py +2 -2
torch_geometric/nn/nlp/__init__.py +9 -0
torch_geometric/nn/nlp/llm.py +322 -0
torch_geometric/nn/nlp/sentence_transformer.py +134 -0
torch_geometric/nn/nlp/vision_transformer.py +33 -0
torch_geometric/nn/norm/batch_norm.py +1 -1
torch_geometric/nn/parameter_dict.py +2 -2
torch_geometric/nn/pool/__init__.py +21 -5
torch_geometric/nn/pool/cluster_pool.py +145 -0
torch_geometric/nn/pool/connect/base.py +0 -1
torch_geometric/nn/pool/edge_pool.py +1 -1
torch_geometric/nn/pool/graclus.py +4 -2
torch_geometric/nn/pool/pool.py +8 -2
torch_geometric/nn/pool/select/base.py +0 -1
torch_geometric/nn/pool/voxel_grid.py +3 -2
torch_geometric/nn/resolver.py +1 -1
torch_geometric/nn/sequential.jinja +10 -23
torch_geometric/nn/sequential.py +204 -78
torch_geometric/nn/summary.py +1 -1
torch_geometric/nn/to_hetero_with_bases_transformer.py +19 -19
torch_geometric/profile/__init__.py +2 -0
torch_geometric/profile/nvtx.py +66 -0
torch_geometric/profile/profiler.py +30 -19
torch_geometric/resolver.py +1 -1
torch_geometric/sampler/base.py +34 -13
torch_geometric/sampler/neighbor_sampler.py +11 -10
torch_geometric/sampler/utils.py +1 -1
torch_geometric/template.py +1 -0
torch_geometric/testing/__init__.py +6 -2
torch_geometric/testing/decorators.py +53 -20
torch_geometric/testing/feature_store.py +1 -1
torch_geometric/transforms/__init__.py +2 -0
torch_geometric/transforms/add_metapaths.py +5 -5
torch_geometric/transforms/add_positional_encoding.py +1 -1
torch_geometric/transforms/delaunay.py +65 -14
torch_geometric/transforms/face_to_edge.py +32 -3
torch_geometric/transforms/gdc.py +7 -6
torch_geometric/transforms/laplacian_lambda_max.py +3 -3
torch_geometric/transforms/mask.py +5 -1
torch_geometric/transforms/node_property_split.py +1 -2
torch_geometric/transforms/pad.py +7 -6
torch_geometric/transforms/random_link_split.py +1 -1
torch_geometric/transforms/remove_self_loops.py +36 -0
torch_geometric/transforms/svd_feature_reduction.py +1 -1
torch_geometric/transforms/to_sparse_tensor.py +1 -1
torch_geometric/transforms/two_hop.py +1 -1
torch_geometric/transforms/virtual_node.py +2 -1
torch_geometric/typing.py +43 -6
torch_geometric/utils/__init__.py +5 -1
torch_geometric/utils/_negative_sampling.py +1 -1
torch_geometric/utils/_normalize_edge_index.py +46 -0
torch_geometric/utils/_scatter.py +38 -12
torch_geometric/utils/_subgraph.py +4 -0
torch_geometric/utils/_tree_decomposition.py +2 -2
torch_geometric/utils/augmentation.py +1 -1
torch_geometric/utils/convert.py +12 -8
torch_geometric/utils/geodesic.py +24 -22
torch_geometric/utils/hetero.py +1 -1
torch_geometric/utils/map.py +8 -2
torch_geometric/utils/smiles.py +65 -27
torch_geometric/utils/sparse.py +39 -25
torch_geometric/visualization/graph.py +3 -4

torch_geometric/nn/models/glem.py ADDED Viewed

@@ -0,0 +1,385 @@
+from typing import List, Optional, Union
+import torch
+import torch.nn as nn
+from tqdm import tqdm
+from torch_geometric.loader import DataLoader, NeighborLoader
+from torch_geometric.nn.models import GraphSAGE, basic_gnn
+class GLEM(torch.nn.Module):
+    r"""This GNN+LM co-training model is based on GLEM from the `"Learning on
+    Large-scale Text-attributed Graphs via Variational Inference"
+    <https://arxiv.org/abs/2210.14709>`_ paper.
+    Args:
+        lm_to_use (str): A TextEncoder from huggingface model repo
+                with a classifier(default: TinyBERT)
+        gnn_to_use (torch_geometric.nn.models): (default: GraphSAGE)
+        out_channels (int): output channels for LM and GNN, should be same
+        num_gnn_heads Optional[int]: Number of heads for attention, if needed
+        num_gnn_layers (int): number of gnn layers
+        gnn_loss: loss function for gnn, (default: CrossEntropyLoss)
+        lm_loss: loss function for Language Model, (default: CrossEntropyLoss)
+        alpha (float): pseudo label weight of E-step, LM optimization,
+            (default: 0.5)
+        beta (float): pseudo label weight of M-step, GNN optimization,
+            (default: 0.5)
+        lm_dtype (torch.dtype): the data type once you load LM into memory,
+            (default: torch.bfloat16)
+        lm_use_lora (bool): choose if LM use Lora peft for fine tune,
+            (default: True)
+        lora_target_modules: The names of the target modules to apply the lora
+            adapter to, e.g. ['q_proj', 'v_proj'] for LLM , (default: None)
+    .. note::
+        See `examples/llm_plus_gnn/glem.py` for example usage.
+    """
+    def __init__(
+            self,
+            lm_to_use: str = 'prajjwal1/bert-tiny',
+            gnn_to_use: basic_gnn = GraphSAGE,
+            out_channels: int = 47,
+            gnn_loss=nn.CrossEntropyLoss(reduction='mean'),
+            lm_loss=nn.CrossEntropyLoss(reduction='mean'),
+            alpha: float = 0.5,
+            beta: float = 0.5,
+            lm_dtype: torch.dtype = torch.bfloat16,
+            lm_use_lora: bool = True,
+            lora_target_modules: Optional[Union[List[str], str]] = None,
+            device: Union[str, torch.device] = torch.device('cpu'),
+    ):
+        super().__init__()
+        self.device = device
+        self.lm_loss = lm_loss
+        self.gnn = gnn_to_use
+        self.gnn_loss = gnn_loss
+        self.alpha = alpha
+        self.beta = beta
+        self.gnn_loss = gnn_loss
+        self.lm = lm_to_use
+        from transformers import AutoModelForSequenceClassification
+        self.lm = AutoModelForSequenceClassification.from_pretrained(
+            lm_to_use, num_labels=out_channels, torch_dtype=lm_dtype,
+            offload_folder="offload", trust_remote_code=True)
+        if lm_use_lora:
+            from peft import (
+                LoraConfig,
+                TaskType,
+                get_peft_model,
+                prepare_model_for_kbit_training,
+            )
+            print("Training LM with LORA!")
+            self.lm = prepare_model_for_kbit_training(self.lm)
+            config = LoraConfig(task_type=TaskType.SEQ_CLS, r=16,
+                                lora_alpha=16, lora_dropout=0.05, bias="none",
+                                target_modules=lora_target_modules)
+            self.lm = get_peft_model(self.lm, config)
+            self.lm.print_trainable_parameters()
+        self.lm.config.pad_token_id = self.lm.config.eos_token_id
+        self.lm_device = self.lm.device
+        if self.lm.num_labels != self.gnn.out_channels:
+            raise ValueError('''The output channel of language model \
+                             and gnn should be the same''')
+    def pre_train_gnn(self, train_loader: NeighborLoader,
+                      optimizer: torch.optim.Optimizer, num_epochs: int,
+                      patience: int, ext_pseudo_labels: torch.Tensor = None,
+                      is_augmented: bool = False, verbose: bool = True):
+        # Pretrain GNN, optional steps if you do not have pseudo labels.
+        best_acc = 0
+        early_stopping = 0
+        # training only based on gold data
+        for epoch in range(0, num_epochs):
+            acc, loss = self.train_gnn(train_loader, optimizer, epoch,
+                                       ext_pseudo_labels, is_augmented,
+                                       verbose)
+            if acc < best_acc:
+                early_stopping += 1
+                if early_stopping > patience:
+                    print(f'Early stopped by Epoch: {epoch}, '
+                          f'Best acc: {best_acc}')
+                    break
+            best_acc = max(best_acc, acc)
+    def pre_train_lm(self, train_loader: DataLoader,
+                     optimizer: torch.optim.Optimizer, num_epochs: int,
+                     patience: int, ext_pseudo_labels: torch.Tensor = None,
+                     is_augmented: bool = False, verbose: bool = True):
+        # Pretrain language model
+        best_acc = 0
+        early_stopping = 0
+        for epoch in range(1, num_epochs + 1):
+            acc, loss = self.train_lm(train_loader, optimizer, epoch,
+                                      ext_pseudo_labels, is_augmented, verbose)
+            if acc < best_acc:
+                early_stopping += 1
+                if early_stopping > patience:
+                    print(f'Early stopped by Epoch: {epoch}, '
+                          f'Best acc: {best_acc}')
+                    break
+            best_acc = max(best_acc, acc)
+    def train(self, em_phase: str, train_loader: Union[DataLoader,
+                                                       NeighborLoader],
+              optimizer: torch.optim.Optimizer, pseudo_labels: torch.Tensor,
+              epoch: int, is_augmented: bool = False, verbose: bool = False):
+        r"""GLEM training step, EM steps.
+        Args:
+            em_phase(str): 'gnn' or 'lm' choose which phase you are training on
+            train_loader(Union[DataLoader, NeighborLoader]): use DataLoader for
+                lm training, include tokenized data, labels is_gold mask.
+                use NeighborLoader for gnn training, include x, edge_index.
+            optimizer (torch.optim.Optimizer): optimizer for training
+            pseudo_labels(torch.Tensor): the predicted labels used as pseudo
+                labels
+            epoch (int): current epoch
+            is_augmented (bool): will use pseudo_labels or not
+            verbose (bool): print training progress bar or not
+        Returns:
+            acc (float): training accuracy
+            loss (float): loss value
+        """
+        if pseudo_labels is not None:
+            pseudo_labels = pseudo_labels.to(self.device)
+        if em_phase == 'gnn':
+            acc, loss = self.train_gnn(train_loader, optimizer, epoch,
+                                       pseudo_labels, is_augmented, verbose)
+        if em_phase == 'lm':
+            acc, loss = self.train_lm(train_loader, optimizer, epoch,
+                                      pseudo_labels, is_augmented, verbose)
+        return acc, loss
+    def train_lm(self, train_loader: DataLoader,
+                 optimizer: torch.optim.Optimizer, epoch: int,
+                 pseudo_labels: torch.Tensor = None,
+                 is_augmented: bool = False, verbose: bool = True):
+        r"""Language model Training in every epoch.
+        Args:
+            train_loader (loader.dataloader.DataLoader): text token dataloader
+            optimizer (torch.optim.Optimizer): model optimizer
+            epoch (int): current train epoch
+            pseudo_labels (torch.Tensor): 1-D tensor, predictions from gnn
+            is_augmented (bool): train with pseudo labels or not
+            verbose (bool): print training progress bar or not
+        Returns:
+            approx_acc (torch.tensor): training accuracy
+            loss (torch.float): loss value
+        """
+        all_out = []
+        total_loss = total_correct = 0
+        num_nodes = train_loader.dataset.indices.size(0)
+        self.lm.train()
+        if verbose:
+            pbar = tqdm(total=num_nodes)
+            pbar.set_description(f'Epoch {epoch:02d}')
+        for batch in train_loader:
+            inputs = {k: v.to(self.device) for k, v in batch['input'].items()}
+            out = self.lm(**inputs).logits
+            labels = batch['labels'].to(self.device).squeeze()
+            # training with pseudo labels or not
+            if is_augmented:
+                pl_batch = pseudo_labels[batch['n_id']].to(self.device)
+            else:
+                pl_batch = None
+            loss = self.loss(out, labels, self.lm_loss,
+                             batch['is_gold'].to(self.device), pl_batch,
+                             self.alpha, is_augmented)
+            loss.backward()
+            optimizer.step()
+            optimizer.zero_grad()
+            all_out.append(out)
+            total_correct += int(out.argmax(dim=-1).eq(labels).sum())
+            total_loss += float(loss)
+            if verbose:
+                pbar.update(batch['n_id'].size(0))
+        all_out = torch.cat(all_out, dim=0)
+        approx_acc = total_correct / num_nodes
+        loss = total_loss / len(train_loader)
+        if verbose:
+            pbar.close()
+        print(f'Epoch {epoch:02d} Loss: {loss:.4f} '
+              f'Approx. Train: {approx_acc:.4f}')
+        return approx_acc, loss
+    def train_gnn(self, train_loader: NeighborLoader,
+                  optimizer: torch.optim.Optimizer, epoch: int,
+                  pseudo_labels: torch.Tensor = None,
+                  is_augmented: bool = False, verbose: bool = True):
+        r"""GNN training step in every epoch.
+        Args:
+            train_loader (loader.NeighborLoader): gnn Neighbor node loader
+            optimizer (torch.optim.Optimizer): model optimizer
+            epoch (int): current train epoch
+            pseudo_labels(torch.tensor): 1-D tensor, predictions from lm
+            is_augmented(bool): use pseudo labeled node or not
+            verbose (bool): print training progress or not
+        Returns:
+            approx_acc (torch.tensor): training accuracy
+            loss (torch.float): loss value
+        """
+        self.gnn.train()
+        num_nodes = train_loader.input_nodes.size(0)
+        if verbose:
+            pbar = tqdm(total=num_nodes)
+            pbar.set_description(f'Epoch {epoch:02d}')
+        total_loss = total_correct = 0
+        all_out = []
+        for batch in train_loader:
+            batch = batch.to(self.device)
+            out = self.gnn(batch.x, batch.edge_index)[:batch.batch_size]
+            all_out.append(out)
+            labels = batch.y[:batch.batch_size].squeeze()
+            is_gold_batch = batch.is_gold[:batch.batch_size].squeeze()
+            # training with pseudo labels or not
+            if is_augmented and pseudo_labels is not None:
+                pl_batch = pseudo_labels[batch.n_id[:batch.batch_size]]
+            else:
+                pl_batch = None
+            loss = self.loss(out, labels, self.gnn_loss, is_gold_batch,
+                             pl_batch, self.beta, is_augmented)
+            loss.backward()
+            optimizer.step()
+            optimizer.zero_grad()
+            total_loss += float(loss)
+            total_correct += int(out.argmax(dim=-1).eq(labels).sum())
+            if verbose:
+                pbar.update(batch.batch_size)
+        all_out = torch.cat(all_out, dim=0)
+        loss = total_loss / len(train_loader)
+        approx_acc = total_correct / num_nodes
+        if verbose:
+            pbar.close()
+        print(f'Epoch: {epoch:02d} Loss: {loss:.4f} '
+              f'Approx. Train: {approx_acc:.4f}')
+        return approx_acc, loss
+    @torch.no_grad()
+    def inference(self, em_phase: str, data_loader: Union[NeighborLoader,
+                                                          DataLoader],
+                  verbose: bool = False):
+        r"""GLEM inference step.
+        Args:
+            em_phase(str): 'gnn' or 'lm'
+            data_loader(dataloader or Neighborloader):
+                dataloader: for lm training, include tokenized data
+                nodeloader: for gnn training, include x, edge_index
+            verbose(bool): print inference progress or not
+        Returns:
+            out (torch.Tensor): n * m tensor, m is number of classes,
+                n is number of nodes
+        """
+        out = None
+        if em_phase == 'gnn':
+            self.gnn.eval()
+            out = self.inference_gnn(data_loader, verbose)
+        elif em_phase == 'lm':
+            self.lm.eval()
+            out = self.inference_lm(data_loader, verbose)
+        return out
+    @torch.no_grad()
+    def inference_lm(self, data_loader: DataLoader, verbose: bool = True):
+        r"""LM inference step.
+        Args:
+            data_loader (Dataloader): include token, labels, and gold mask
+            verbose (bool): print progress bar or not
+        Returns:
+            preds (tensor): prediction from GNN, convert to pseudo labels
+                by preds.argmax(dim=-1).unsqueeze(1)
+        """
+        if verbose:
+            pbar = tqdm(total=data_loader.dataset._data.num_nodes)
+            pbar.set_description('LM inference stage')
+        self.lm.eval()
+        preds = []
+        for batch in data_loader:
+            inputs = {k: v.to(self.device) for k, v in batch['input'].items()}
+            logits = self.lm(**inputs).logits
+            preds.append(logits)
+            if verbose:
+                pbar.update(batch['n_id'].size(0))
+        if verbose:
+            pbar.close()
+        preds = torch.cat(preds)
+        return preds
+    @torch.no_grad()
+    def inference_gnn(self, data_loader: NeighborLoader, verbose: bool = True):
+        r"""GNN inference step.
+        Args:
+            data_loader(NeighborLoader): include x, edge_index,
+            verbose (bool): print progress bar or not
+        Returns:
+            preds (tensor): prediction from GNN,
+                convert to pseudo labels by preds.argmax(dim=-1).unsqueeze(1)
+        """
+        if verbose:
+            pbar = tqdm(total=data_loader.data.num_nodes)
+            pbar.set_description('GNN inference stage')
+        preds = []
+        self.gnn.eval()
+        for batch in data_loader:
+            batch = batch.to(self.device)
+            out = self.gnn(batch.x, batch.edge_index)[:batch.batch_size]
+            preds.append(out)
+            if verbose:
+                pbar.update(batch.batch_size)
+        if verbose:
+            pbar.close()
+        preds = torch.cat(preds, dim=0)
+        return preds
+    def loss(self, logits: torch.Tensor, labels: torch.Tensor,
+             loss_func: torch.nn.functional, is_gold: torch.Tensor,
+             pseudo_labels: torch.Tensor = None, pl_weight: float = 0.5,
+             is_augmented: bool = True):
+        r"""Core function of variational EM inference, this function is aming
+        on combining loss value on gold(original train) and loss value on
+        pseudo labels.
+        Reference:
+        <https://github.com/AndyJZhao/GLEM/blob/main/src/models/GLEM/GLEM_utils.py> # noqa
+        Args:
+            logits(torch.tensor): predict results from LM or GNN
+            labels(torch.tensor): combined node labels from ground truth and
+                pseudo labels(if provided)
+            loss_func(torch.nn.modules.loss): loss function for classification
+            is_gold(tensor): a tensor with bool value that mask ground truth
+                    label and during training, thus ~is_gold mask pseudo labels
+            pseudo_labels(torch.tensor): predictions from other model
+            pl_weight: the pseudo labels used in E-step and M-step optimization
+                        alpha in E-step, beta in M-step respectively
+            is_augmented: use EM or just train GNN and LM with gold data
+        """
+        def deal_nan(x):
+            return 0 if torch.isnan(x) else x
+        if is_augmented and (sum(~is_gold) > 0):
+            mle_loss = deal_nan(loss_func(logits[is_gold], labels[is_gold]))
+            # all other labels beside from ground truth(gold labels)
+            pseudo_label_loss = deal_nan(
+                loss_func(logits[~is_gold], pseudo_labels[~is_gold]))
+            loss = pl_weight * pseudo_label_loss + (1 - pl_weight) * mle_loss
+        else:
+            loss = loss_func(logits, labels)
+        return loss

torch_geometric/nn/models/gnnff.py CHANGED Viewed

@@ -19,7 +19,6 @@ class GaussianFilter(torch.nn.Module):
     def reset_parameters(self):
         r"""Resets all learnable parameters of the module."""
-        pass
     def forward(self, dist: Tensor) -> Tensor:
         dist = dist.view(-1, 1) - self.offset.view(1, -1)

torch_geometric/nn/models/graph_unet.py CHANGED Viewed

@@ -79,12 +79,21 @@ class GraphUNet(torch.nn.Module):
         for conv in self.up_convs:
             conv.reset_parameters()
-    def forward(self, x: Tensor, edge_index: Tensor,
-                batch: OptTensor = None) -> Tensor:
+    def forward(
+        self,
+        x: Tensor,
+        edge_index: Tensor,
+        batch: OptTensor = None,
+        edge_weight: Tensor = None,
+    ) -> Tensor:
         """"""  # noqa: D419
         if batch is None:
             batch = edge_index.new_zeros(x.size(0))
-        edge_weight = x.new_ones(edge_index.size(1))
+        if edge_weight is None:
+            edge_weight = x.new_ones(edge_index.size(1))
+        assert edge_weight.dim() == 1
+        assert edge_weight.size(0) == edge_index.size(1)
         x = self.down_convs[0](x, edge_index, edge_weight)
         x = self.act(x)

torch_geometric/nn/models/jumping_knowledge.py CHANGED Viewed

@@ -1,4 +1,4 @@
-from typing import List, Optional
+from typing import Dict, List, Optional
 import torch
 from torch import Tensor
@@ -41,8 +41,12 @@ class JumpingKnowledge(torch.nn.Module):
         num_layers (int, optional): The number of layers to aggregate. Needs to
             be only set for LSTM-style aggregation. (default: :obj:`None`)
     """
-    def __init__(self, mode: str, channels: Optional[int] = None,
-                 num_layers: Optional[int] = None):
+    def __init__(
+        self,
+        mode: str,
+        channels: Optional[int] = None,
+        num_layers: Optional[int] = None,
+    ) -> None:
         super().__init__()
         self.mode = mode.lower()
         assert self.mode in ['cat', 'max', 'lstm']
@@ -63,7 +67,7 @@ class JumpingKnowledge(torch.nn.Module):
         self.reset_parameters()
-    def reset_parameters(self):
+    def reset_parameters(self) -> None:
         r"""Resets all learnable parameters of the module."""
         if self.lstm is not None:
             self.lstm.reset_parameters()
@@ -94,3 +98,58 @@ class JumpingKnowledge(torch.nn.Module):
             return (f'{self.__class__.__name__}({self.mode}, '
                     f'channels={self.channels}, layers={self.num_layers})')
         return f'{self.__class__.__name__}({self.mode})'
+class HeteroJumpingKnowledge(torch.nn.Module):
+    r"""A heterogeneous version of the :class:`JumpingKnowledge` module.
+    Args:
+        types (List[str]): The keys of the input dictionary.
+        mode (str): The aggregation scheme to use
+            (:obj:`"cat"`, :obj:`"max"` or :obj:`"lstm"`).
+        channels (int, optional): The number of channels per representation.
+            Needs to be only set for LSTM-style aggregation.
+            (default: :obj:`None`)
+        num_layers (int, optional): The number of layers to aggregate. Needs to
+            be only set for LSTM-style aggregation. (default: :obj:`None`)
+    """
+    def __init__(
+        self,
+        types: List[str],
+        mode: str,
+        channels: Optional[int] = None,
+        num_layers: Optional[int] = None,
+    ) -> None:
+        super().__init__()
+        self.mode = mode.lower()
+        self.jk_dict = torch.nn.ModuleDict({
+            key:
+            JumpingKnowledge(mode, channels, num_layers)
+            for key in types
+        })
+    def reset_parameters(self) -> None:
+        r"""Resets all learnable parameters of the module."""
+        for jk in self.jk_dict.values():
+            jk.reset_parameters()
+    def forward(self, xs_dict: Dict[str, List[Tensor]]) -> Dict[str, Tensor]:
+        r"""Forward pass.
+        Args:
+            xs_dict (Dict[str, List[torch.Tensor]]): A dictionary holding a
+                list of layer-wise representation for each type.
+        """
+        return {key: jk(xs_dict[key]) for key, jk in self.jk_dict.items()}
+    def __repr__(self):
+        if self.mode == 'lstm':
+            jk = next(iter(self.jk_dict.values()))
+            return (f'{self.__class__.__name__}('
+                    f'num_types={len(self.jk_dict)}, '
+                    f'mode={self.mode}, channels={jk.channels}, '
+                    f'layers={jk.num_layers})')
+        return (f'{self.__class__.__name__}(num_types={len(self.jk_dict)}, '
+                f'mode={self.mode})')

torch_geometric/nn/models/lightgcn.py CHANGED Viewed

@@ -275,7 +275,7 @@ class BPRLoss(_Loss):
         \sum_{j \not\in \mathcal{N}_u} \ln \sigma(\hat{y}_{ui} - \hat{y}_{uj})
         + \lambda \vert\vert \textbf{x}^{(0)} \vert\vert^2
-    where :math:`lambda` controls the :math:`L_2` regularization strength.
+    where :math:`\lambda` controls the :math:`L_2` regularization strength.
     We compute the mean BPR loss for simplicity.
     Args:

torch_geometric/nn/models/metapath2vec.py CHANGED Viewed

@@ -5,9 +5,9 @@ from torch import Tensor
 from torch.nn import Embedding
 from torch.utils.data import DataLoader
+from torch_geometric.index import index2ptr
 from torch_geometric.typing import EdgeType, NodeType, OptTensor
 from torch_geometric.utils import sort_edge_index
-from torch_geometric.utils.sparse import index2ptr
 EPS = 1e-15
@@ -103,7 +103,7 @@ class MetaPath2Vec(torch.nn.Module):
         self.num_negative_samples = num_negative_samples
         self.num_nodes_dict = num_nodes_dict
-        types = set([x[0] for x in metapath]) | set([x[-1] for x in metapath])
+        types = {x[0] for x in metapath} | {x[-1] for x in metapath}
         types = sorted(list(types))
         count = 0
@@ -227,14 +227,13 @@ class MetaPath2Vec(torch.nn.Module):
         return pos_loss + neg_loss
     def test(self, train_z: Tensor, train_y: Tensor, test_z: Tensor,
-             test_y: Tensor, solver: str = "lbfgs", multi_class: str = "auto",
-             *args, **kwargs) -> float:
+             test_y: Tensor, solver: str = "lbfgs", *args, **kwargs) -> float:
         r"""Evaluates latent space quality via a logistic regression downstream
         task.
         """
         from sklearn.linear_model import LogisticRegression
-        clf = LogisticRegression(solver=solver, multi_class=multi_class, *args,
+        clf = LogisticRegression(solver=solver, *args,
                                  **kwargs).fit(train_z.detach().cpu().numpy(),
                                                train_y.detach().cpu().numpy())
         return clf.score(test_z.detach().cpu().numpy(),
@@ -256,6 +255,7 @@ def sample(rowptr: Tensor, col: Tensor, rowcount: Tensor, subset: Tensor,
     rand = torch.rand((subset.size(0), num_neighbors), device=subset.device)
     rand *= count.to(rand.dtype).view(-1, 1)
     rand = rand.to(torch.long) + rowptr[subset].view(-1, 1)
+    rand = rand.clamp(max=col.numel() - 1)  # If last node is isolated.
     col = col[rand] if col.numel() > 0 else rand
     col[mask | (count == 0)] = dummy_idx

pyg-nightly 2.6.0.dev20240319__py3-none-any.whl → 2.7.0.dev20250114__py3-none-any.whl

pyg-nightly 2.6.0.dev20240319py3-none-any.whl → 2.7.0.dev20250114py3-none-any.whl