Epoll vs. io_uring:我压测了三个通宵,发现 naive 用法 io_uring 居然更慢
先说结论:别急着把 epoll 全换了 最近团队在做网关重构,核心问题就是 IO 模型选型。我花了三个通宵在 5.15 和 6.6 内核上做了全套压测,结论有点反直觉——naive 的 io_uring 替换 epoll,性能反而会翻车。 这不是我瞎说的。社区里有人直接挂了个 …
聚焦数据中心自动化、Python 探针、DCIM 和 AI 内容流水线。
先说结论:别急着把 epoll 全换了 最近团队在做网关重构,核心问题就是 IO 模型选型。我花了三个通宵在 5.15 和 6.6 内核上做了全套压测,结论有点反直觉——naive 的 io_uring 替换 epoll,性能反而会翻车。 这不是我瞎说的。社区里有人直接挂了个 …
先说说为什么你该看这篇 上周我们团队在生产环境翻车了。一个用了vLLM 0.6.x的推理集群,在流量高峰时P99延迟从400ms飙到8秒,直接打爆了监控。排查了一整天,最后发现是 max_num_seqs 和 max_model_len 的组合配置搞的鬼。 这不是个例 …
序章:一个时代的终结 Reddit 上 r/hypeurls 的帖子 “Long Wave radio era set to end with Droitwich switch-off” 热度只有 49 分,但这事儿在无线电圈子里炸了锅。 2026 年 6 …
兄弟们,Prometheus 告警规则这玩意儿,看着简单,真上线了全是坑。 我见过太多团队,规则写了几百条,结果 PagerDuty 半夜疯狂报警,第二天一看全是噪音。或者反过来——集群都挂了十分钟了,告警邮件还在路上慢悠悠地飘。 2026 年了,Prometheus 生态早就不 …
别再用 Web 界面了,iLO 6 的 REST API 才是真生产力 说实话,我见过太多运维兄弟还在浏览器里点 iLO 的 Web 界面。点一下刷新,再点一下,一台两台还行,等你管着几百台 ProLiant 的时候,手指头都能点抽筋。 HPE iLO 6 的 RESTful …
说实话,我第一次刷到 Gerrymandle 这玩意的时候,第一反应是:又来一个蹭政治热点的破游戏?结果玩了一局之后直接打脸——这玩意儿比我想象的硬核太多了。 Gerrymandle 本质上是一个每日谜题,给你一张由红蓝两色格子组成的选区地图,你的任务就是重新划分选区边界,让你所 …
别被“Drop-in”骗了——但这次是真的香 上周我重构了团队的核心编排层。原来的 Temporal Server 集群吃掉了我们每月 $800 的 infra 成本,加上那个 Java Worker 动不动就 OOM,运维同学已经骂娘骂了三个月。 然后我看到了 …
症状:你的 Lambda 部署炸了 事情是这样的。上周五下午,我在部署一个 Lambda 函数,代码结构大概是这样的: my-project/ ├── terraform/ │ ├── main.tf │ ├── modules/ │ │ └── lambda/ │ │ └── …
前几天在 r/sysadmin 上看到一个帖子,一个7人IT小公司的运维老哥吐槽:“我们公司就爱把密码写在便利贴上,我想改变这个现状。” 这哥们儿的处境我太熟了——3个开发,其他人包括他自己是IT运维,全公司就他一个懂密码管理的。评论区一堆人共鸣:小公司搞 …
兄弟们,今天聊个硬核话题:机架密度与散热。 最近我们团队在做一个边缘节点的扩容,机柜空间就那么多,电力和散热预算卡得死死的。选型锁定了两台机器:Lenovo ThinkSystem SR650 V3 和 Dell PowerEdge R660。两台都是 1U 的密度型选手,但散热 …