Repository Issues
Lightning-AI/pytorch-lightning
Pretrain, finetune and deploy AI models on multiple GPUs, TPUs with zero code changes.
Issues
Open
Runtime events with support for custom handlers
featurehelp wantedlet's do it!logging
Has a beginner-friendly labelContributing guide available
9 comments4 reactions1 assignee
Open
Move reload_dataloaders_every_n_epochs to the DataHooks class
data handlingdeprecationdesignfeaturehelp wantedlet's do it!
Why recommendedHas a beginner-friendly label · Contributing guide available
Has a beginner-friendly labelContributing guide available
5 comments4 reactions1 assignee
Open
Pruning callback causes GPU memory leak when used iteratively
buggood first issuepriority: 1waiting on author
Why recommendedHas a beginner-friendly label · Contributing guide available
Has a beginner-friendly labelContributing guide available
11 comments0 reactions2 assignees
Open
Make lazy initialization in plugins more robust
distributedfeaturegood first issuehelp wantedlet's do it!
Why recommendedHas a beginner-friendly label · Contributing guide available
Has a beginner-friendly labelContributing guide available
4 comments0 reactions1 assignee
Open
Allow obtaining num_nodes from ClusterEnvironment
environmentfeaturegood first issuehelp wanted
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
8 comments0 reactions0 assignees
Open
Add checks for model spec and matching output values in `to_onnx()` method
featuregood first issuehelp wanted
Why recommendedHas a beginner-friendly label · Contributing guide available
Has a beginner-friendly labelContributing guide available
6 comments2 reactions2 assignees
Open
CI Testing ROCm
cifeaturehelp wanted
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
3 comments4 reactions0 assignees
Open
DDP with 2 GPUs doesn't give same results as 1 GPU with the same effective batch size
bughelp wantedpriority: 2strategy: ddpwon't fix
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
41 comments9 reactions0 assignees
Open
MLFlow Logger Makes a New Run When Resuming from hpc Checkpoint
bugcheckpointingenvironment: slurmhelp wantedlogger: mlflowpriority: 2won't fix
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
8 comments0 reactions0 assignees
Open
support len(datamodule)
data handlingfeaturegood first issuehelp wanted
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
14 comments0 reactions0 assignees
Open
CLI for inspecting checkpoints
checkpointingdesignfeaturehelp wanted
Why recommendedHas a beginner-friendly label · Contributing guide available
Has a beginner-friendly labelContributing guide available
2 comments7 reactions1 assignee
Open
Load callback states while testing.
checkpointingfeaturehelp wantedpriority: 1trainer: testtrainer: validate
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
21 comments0 reactions0 assignees
Open
Store logger experiment id in checkpoint to enable correct resuming of experiments
checkpointingfeaturehelp wantedlogger
Why recommendedHas a beginner-friendly label · Contributing guide available
Has a beginner-friendly labelContributing guide available
8 comments8 reactions1 assignee
Open
Resuming should allow to differentiate what to resume (steps/opti/weights)
featurehelp wantedpriority: 1
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
26 comments18 reactions0 assignees
Open
Returning None from training_step with multi GPU DDP training
distributedfeaturehelp wantedpriority: 1
Why recommendedHas a beginner-friendly label · Contributing guide available
Has a beginner-friendly labelContributing guide available
26 comments4 reactions1 assignee
Open
`lr_finder` fails when called after training for 1 or more epochs
bughelp wantedpriority: 1tuner
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
15 comments0 reactions0 assignees
Open
Clarify the model checkpoint arguments
callback: model checkpointhelp wantedrefactor
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
16 comments8 reactions0 assignees
Open
Easier change optimizer/learning rate instead of reading state_dict from checkpoint
featurehelp wanted
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
12 comments0 reactions0 assignees
Open
Support uneven DDP inputs with pytorch model.join
3rd partydistributedfeaturehelp wanted
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
27 comments13 reactions0 assignees
Open
Model Verification in Trainer
featurehelp wantedlet's do it!
Why recommendedHas a beginner-friendly label · Contributing guide available
Has a beginner-friendly labelContributing guide available
19 comments2 reactions1 assignee