Repository Issues
Lightning-AI/pytorch-lightning
Pretrain, finetune and deploy AI models on multiple GPUs, TPUs with zero code changes.
Issues
Open
LayerNorm / BatchNorm fp16 behavior is different in Pytorch Native and Deepspeed
bughelp wantedstrategy: deepspeed
No assignee yetHas a beginner-friendly labelContributing guide available
3 comments1 reaction0 assignees
Open
BUG when Trainer.test() with deepspeed stage 3
bughelp wantedrepro neededstrategy: deepspeed
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
2 comments2 reactions0 assignees
Open
Schedule in PyTorchProfiler doesn't work
bughelp wantedprofiler
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
6 comments1 reaction0 assignees
Open
HPC Resubmit resume on most recent epoch checkpoint
checkpointingenvironment: slurmfeaturehelp wanted
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
11 comments2 reactions0 assignees
Open
Add `enable_device_summary` flag to disable device printout
callbackfeaturegood first issuetrainer: argument
Why recommendedHas a beginner-friendly label · Contributing guide available
Has a beginner-friendly labelContributing guide available
15 comments3 reactions1 assignee
Open
Multiple GPU per node could fail silently with KubeflowEnvironment
bugenvironment: kubeflowhelp wanted
Why recommendedHas a beginner-friendly label · Contributing guide available
Has a beginner-friendly labelContributing guide available
22 comments2 reactions1 assignee
Open
Race condition with SLURM restart
environment: slurmfeaturehelp wanted
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
4 comments0 reactions0 assignees
Open
Use :emphasize-lines: in sphinx docs to highlight code.
docsgood first issuepriority: 1
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
11 comments2 reactions0 assignees
Closed
Improved control of device stats callbacks
callback: device statsdesignhelp wantedrefactor
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
20 comments4 reactions0 assignees
Open
Support batch size scaling with dataloaders passed directly to `fit()`
data handlingfeaturehelp wantedtuner
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
3 comments0 reactions0 assignees
Open
Use `FutureWarning` instead of `DeprecationWarning` for deprecation warning
featuregood first issue
Why recommendedHas a beginner-friendly label · Contributing guide available
Has a beginner-friendly labelContributing guide available
6 comments2 reactions1 assignee
Open
Tagging discussion with release number
docsfeaturehelp wanted
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
4 comments0 reactions0 assignees
Open
[RFC] Default to infinite epochs, not 1000
help wantedlet's do it!trainer: argument
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
18 comments0 reactions0 assignees
Open
Distributed mode overwrites the user's choice for dataloaders shuffling
data handlingfeaturehelp wanted
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
8 comments0 reactions0 assignees
Open
ModelCheckpoint: save_top_k > 1 cannot recognize ordering of models from ckpt names
checkpointingfeaturehelp wanted
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
18 comments1 reaction0 assignees
Open
Allow shuffling when overfit_batches is active
featurehelp wantedrefactor
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
19 comments0 reactions0 assignees
Open
Progress bar doesn't show up on Kaggle TPU with `num_workers` greater than `0`.
accelerator: tpubughelp wanted
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
33 comments0 reactions0 assignees
Open
Syncing the log_dir across ranks is not valid with multiple nodes
bugdistributedhelp wantedloggingpriority: 1
Why recommendedHas a beginner-friendly label · Contributing guide available
Has a beginner-friendly labelContributing guide available
3 comments0 reactions1 assignee
Open
AdvancedProfiler: ValueError: Attempting to stop recording an action (run_test_evaluation) which was never started.
buggood first issuehelp wantedpriority: 1
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
18 comments0 reactions0 assignees
Open
Save training metadata with the fault tolerance checkpoint
fault tolerancehelp wantedlet's do it!
Why recommendedNo assignee yet · Has a beginner-friendly label
No assignee yetHas a beginner-friendly labelContributing guide available
3 comments0 reactions0 assignees