Replicate 历史故障记录

记录在 Replicate 提供方官方状态页上的过往事件,包括发生时间、持续时长、规模与官方链接(可获取的范围因提供方而异)。

  1. 部分故障持续时长: 3 小时 8 分
    A100 hardware partial outage
    开始: 2026年8月27日 06:17恢复: 2026年8月27日 09:25
  2. 延迟持续时长: 40 分钟

    Delayed scaling due to node failure

    开始: 2026年8月11日 06:05恢复: 2026年8月11日 06:45
  3. 正常持续时长: 2 小时 4 分

    Significant degradation

    开始: 2026年8月5日 18:30恢复: 2026年8月5日 20:33
  4. 正常持续时长: 9 分钟

    API degraded for A100s

    开始: 2026年8月3日 01:09恢复: 2026年8月3日 01:18
  5. 延迟持续时长: 2 小时 15 分

    Degraded scale-out due to failed setups pulling from huggingface

    开始: 2026年8月1日 06:25恢复: 2026年8月1日 08:39
  6. 延迟持续时长: 26 小时 29 分

    Hitting GPU Capacity for H100s creating large queue times for some models

    开始: 2026年7月22日 20:51恢复: 2026年7月23日 23:19
  7. 正常持续时长: 7 小时 33 分

    HuggingFace download issues

    开始: 2026年7月16日 17:31恢复: 2026年7月17日 01:04
  8. 延迟持续时长: 25 小时 1 分

    H100 GPU shortage resulting in high queue times

    开始: 2026年7月14日 01:26恢复: 2026年7月15日 02:27
  9. 延迟持续时长: 8 小时 13 分

    High contention on H100 hardware

    开始: 2026年7月10日 23:50恢复: 2026年7月11日 08:04
  10. 延迟持续时长: 5 小时 34 分

    Limited H100 capacity

    开始: 2026年6月30日 22:55恢复: 2026年7月1日 04:29
  11. 部分故障持续时长: 1 小时 7 分
    We're seeing long setup times and high contention for models on some L40S and H200 clusters.
    开始: 2026年6月4日 02:59恢复: 2026年6月4日 04:06
  12. 延迟持续时长: 1 小时 47 分

    Degraded performance on flux-2-klein-4b

    开始: 2026年5月28日 21:30恢复: 2026年5月28日 23:17
  13. 延迟持续时长: 1 小时 50 分

    Prediction and Training status updates delayed

    开始: 2026年5月22日 06:38恢复: 2026年5月22日 08:28
  14. 部分故障持续时长: 6 小时 56 分
    Constrained H100 capacity
    开始: 2026年5月22日 00:09恢复: 2026年5月22日 07:05
  15. 延迟持续时长: 4 小时 16 分

    Constrained capacity for H100 hardware

    开始: 2026年5月13日 00:27恢复: 2026年5月13日 04:43
  16. 延迟持续时长: 26 分钟

    Degraded A100 hardware

    开始: 2026年4月19日 23:36恢复: 2026年4月20日 00:02
  17. 部分故障持续时长: 47 分钟
    A100 capacity unavailable during storage maintenance
    开始: 2026年4月10日 01:43恢复: 2026年4月10日 02:30
  18. 延迟持续时长: 9 小时 37 分

    Downstream errors for Black Forest Labs models

    开始: 2026年3月24日 00:57恢复: 2026年3月24日 10:34
  19. 正常持续时长: 5 小时 21 分

    Degraded performance on Flux Schnell

    开始: 2026年3月10日 21:56恢复: 2026年3月11日 03:17
  20. 部分故障持续时长: 1 小时 0 分
    Model Predictions Stuck at "Starting"
    开始: 2026年2月20日 21:13恢复: 2026年2月20日 22:12
  21. 正常持续时长: 7 小时 44 分

    Increased setup failures for T4 models

    开始: 2026年1月26日 16:33恢复: 2026年1月27日 00:16
  22. 延迟持续时长: 1 小时 30 分

    Predictions and training unavailable for multiple models

    开始: 2026年1月21日 07:53恢复: 2026年1月21日 09:22
  23. 延迟持续时长: 3 小时 9 分

    Flux Schnell unavailable

    开始: 2026年1月21日 05:58恢复: 2026年1月21日 09:07
  24. 部分故障持续时长: 2 小时 56 分
    Prediction Errors
    开始: 2026年1月15日 16:38恢复: 2026年1月15日 19:34
  25. 延迟持续时长: 34 小时 4 分

    High demand for H100 hardware type

    开始: 2025年12月19日 04:06恢复: 2025年12月20日 14:10
  26. 延迟持续时长: 1 小时 11 分

    Limited availability of L40S hardware

    开始: 2025年12月12日 05:38恢复: 2025年12月12日 06:49
  27. 大规模故障持续时长: 6 小时 45 分
    Global network outage
    开始: 2025年11月18日 20:57恢复: 2025年11月19日 03:42
  28. 正常持续时长: 106 小时 52 分

    sora-2-pro currently unavailable

    开始: 2025年11月13日 12:12恢复: 2025年11月17日 23:03
  29. 部分故障持续时长: 21 小时 1 分
    Downstream Service Disruption
    开始: 2025年10月30日 04:04恢复: 2025年10月31日 01:04
  30. 部分故障持续时长: 1 小时 59 分
    Luma models not running
    开始: 2025年10月22日 23:05恢复: 2025年10月23日 01:05
  31. 延迟持续时长: 2 小时 11 分

    Intermittent issues with `cog push` with large images

    开始: 2025年10月21日 20:07恢复: 2025年10月21日 22:18
  32. 大规模故障持续时长: 7 小时 18 分
    Replicate Platform Outage
    开始: 2025年10月21日 04:28恢复: 2025年10月21日 11:46
  33. 延迟持续时长: 12 小时 7 分

    Widespread service degradation

    开始: 2025年10月20日 23:37恢复: 2025年10月21日 11:44
  34. 部分故障持续时长: 47 小时 18 分
    Heygen models outage
    开始: 2025年10月1日 02:37恢复: 2025年10月3日 01:55
  35. 部分故障持续时长: 2 小时 22 分
    Google Models are down
    开始: 2025年9月30日 03:26恢复: 2025年9月30日 05:48