知识库

Infrastructure

聚焦数据中心自动化、Python 探针、DCIM 和 AI 内容流水线。

返回首页
Infrastructure

从零搭建备份体系:Windows备份、File History 与 3-2-1 规则实战指南

好,我知道你在想什么——备份这事儿,听起来跟换个路由器密码一样无聊。但上周我有个朋友,一块 4TB 的硬盘直接挂了,里面是他五年的摄影作品、客户合同、还有他儿子的满月视频。他当时就傻了。他问我:“我该怎么办?” 我说:“你应该三年前就来问我这个问题。” 这玩意儿不是闹着玩的。我在 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

Infrastructure

HPE iLO 6 错误代码修复实战:从踩坑到根治的工程指南

前言:iLO 6 翻车现场,你永远不想经历 上周末,我们团队在升级一批 HPE Gen10 Plus 服务器时,集体翻车了。iLO 6 固件从 1.59 升级到 1.69 后,三台机器直接失联——不是网络问题,不是配置问题,而是 iLO 卡死在了某种诡异的中间状态。监控告警炸了, …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

Infrastructure

Proxmox VE 8 生产环境最佳实践:存储、网络与安全硬核调优

为什么这篇文章值得你花十分钟? 我见过太多人在 Proxmox 上翻车了。去年有个朋友在 Reddit 上发帖,说他的单节点 PVE 跑着跑着,ZFS 池直接挂了,所有虚拟机数据全丢。评论区一片哀嚎——“我特么也没做备份”,“我以为 RAID 就够了”。这不是个例。 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

Infrastructure

FLOPPINUX 实战:如何在 1.44MB 软盘里塞进一个完整的嵌入式 Linux

一、这玩意儿到底有啥用?一个“过时”技术背后的硬核价值 2026 年了,还有人折腾软盘? 说实话,我第一次看到 FLOPPINUX 这个项目时,第一反应跟你一样——这怕不是哪个老古董在怀旧。但仔细看了 Krzysztof Krystian Jankowski 的实现后,我服了。这 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

Infrastructure

HPE iLO 6 生产环境最佳实践:从安全加固到性能调优的硬核指南

兄弟们,今天聊点硬核的——HPE iLO 6。 这东西说白了就是 ProLiant 服务器的“带外”管理大脑,你服务器挂了、系统崩了、网络不通了,只要 iLO 还活着,你就能远程搞定一切。听起来很牛逼对吧?但现实是,我见过太多团队把 iLO 当成一个“能点亮就行”的玩意儿,默认密 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

Infrastructure

CCNA在线考试翻车实录:如何把线上预约改成线下考点(Pearson VUE血泪指南)

一、核心问题:线上考试翻车了,怎么办? 上周Reddit上有个老哥发帖,说他早上准备参加CCNA在线考试,Lockdown浏览器死活识别不了他的麦克风。考试时间到了,他还在跟技术支持扯皮。 这种情况不是个例——我见过至少三个同事在考试当天因为网络波动、摄像头驱动、或者某个傻逼的 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

Infrastructure

Proxmox 9.x 升级后 SATA SSD 读写异常排查与修复:一个 Homelab 踩坑实录

警告: 本文基于真实社区案例和工程实践。如果你正被 Proxmox 9.x 下的 SATA SSD 读写问题折磨,别急着换硬件,先试试这里面的方法。我踩过的坑,你大概率也会遇到。 一、症状:升级后,SSD 变“废盘” 事情是这样的。我们 homelab 群里最近炸了锅——好几个人 …

Tan Jia Hui

Tan Jia Hui

DCIM ENG

Infrastructure

大厂故障通知机制深度拆解:从PagerDuty到内部Status Page的基建实践

一、核心痛点:为什么大厂的通知体系比小公司复杂十倍? 上周跟一个刚跳槽到某FinTech的朋友喝酒,他吐槽了一件事:原公司(200人左右)出故障就是群里吼一声,或者直接打电话。到了新公司,光是搞清楚“故障发生时该通知谁”就花了两周。 这其实是个经典问题。Reddit …

Tan Jia Hui

Tan Jia Hui

DCIM ENG