温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

Checkpoint检查点怎么设

发布时间:2026-09-28 11:31:42 来源:亿速云 阅读:95 作者:小樊 栏目:数据库

“Checkpoint(检查点)”在不同领域设置方法差别很大,下面按常见场景给你分别说明:

1. 深度学习 / 机器学习(如 PyTorch、TensorFlow)

目的:保存模型权重、优化器状态,方便断点续训或回滚。

PyTorch 示例

# 保存
torch.save({
    'epoch': epoch,
    'model_state_dict': model.state_dict(),
    'optimizer_state_dict': optimizer.state_dict(),
    'loss': loss,
}, 'checkpoint.pth')

# 加载
checkpoint = torch.load('checkpoint.pth')
model.load_state_dict(checkpoint['model_state_dict'])
optimizer.load_state_dict(checkpoint['optimizer_state_dict'])

常见设置策略

  • 每 N 个 epoch 存一次
  • 验证集指标最好时存(best model)
  • 固定步数(step)存一次

2. 数据库 / 分布式系统(如 Flink、Spark、PostgreSQL)

目的:记录一致状态,故障恢复用。

Flink 示例

env.enableCheckpointing(5000); // 每 5 秒一个检查点
env.getCheckpointConfig().setCheckpointingMode(CheckpointingMode.EXACTLY_ONCE);

设置要点

  • 间隔时长
  • 一致性语义(at-least-once / exactly-once)
  • 存储位置(HDFS、S3)

3. 训练大模型(LLM,如 LLaMA、ChatGLM)

  • 通常按 steps 或 epoch
  • 保存:optimizer / lr_scheduler / rng_state
  • 多卡训练时注意用 torch.distributed 同步

4. 游戏 / 程序开发(存档点)

  • 玩家到达关键位置自动存
  • 手动存盘
  • 定时自动存

5. 通用建议

  • 不要存太频繁(IO 开销)
  • 保留最近 N 个 + 最好一个
  • 检查点文件要可恢复、可校验

如果你说的是某一个具体框架或场景(比如 TensorFlow、Ray、数据库、游戏引擎),告诉我,我可以直接给你对应代码和配置。

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI
助
手