@ForgeDayi
iAccount based inEast Asia!
About this account
- Account based in
- East Asia
- Connected via
- East Asia App Store
! X says this location may be affected by a proxy or VPN.
Account-level information from X, not a live location or the device used for a specific post.
加一勺梗图,让生活多点乐趣; 加一勺AI,让agnet自己工作; 加一勺博弈论,让多空互相倾轧; 最后加一点杠杆来....我去,加多爆仓了! 研究:Crypto · Data Science · Agent 非金融从业者,只研究技术与市场
伊苏
Joined August 2022
- Tweets1.1K
- Following1.7K
- Followers1.4K
- Likes5K
接下来登场的是全球最残酷最恶臭最具批判性最唯成绩论的27互联网秋招,这里没有可惜,没有遗憾,没有鼓励,没有容忍,没有hc,只有谁机考不作弊谁犯罪,谁脏面评被针对,谁跟面试官把线对,谁家hr没有人情味,谁的简历造假没到位。
欢迎来到世界第一伪好就业专业计算机,这里没有年少轻狂,只有包装为王。所有vibe的论文和项目都是为了争夺一封为期一小时的约面邮件,你的token无人报销,你的演技必须高超。
简历挂叫惊天一条区,一面挂叫本质简历挂,二面挂叫方向不匹配,三面挂叫横向被干掉,四面挂叫不如一面挂,暑期转正挂叫没有hc,实习生招进来只是帮忙吸甲醛。
只有拿到了offer才能赢得尊重—骗你的,就算拿到了offer,也要活过630、730、830、930来证明自己。输家没有任何可以宽容的地方,赢家第二天仍然是挑战者。
读完 Meta 这篇《Auto-RecSys》(arxiv.org/abs/2609.10922),最深刻的感受是:AI Agent 走向工业级深水区,决定成败的早就不再是底层模型的推理智商,而是围绕它搭建的系统工程外壳(Harness)。
过去行业习惯把 LLM 当作直接执行脚本的“程序员”,但在工业级推荐系统这种重资产、长周期的场景下,这种思路几乎必然崩溃。
从这篇工作中提炼出几点关于工业级 Agent 架构的深层思考 🧵 (1/5)
1/ 放弃对 LLM 端到端控制的幻想:工程确定性兜底 (2/5)
玩具级基准测试(如 SWE-bench)允许智能体不断报错、不断即时重试,因为单次反馈只要十几秒。但在工业推荐场景,单次分布式训练动辄两三天,耗费数万 GPU 时,试错成本极高。
Auto-RecSys 给出的答案是认知与流程的彻底分治:
* 把状态流转抽象为严格的有限状态机(FSM),高危的集群调度与代码合规全部收编为确定性脚本;
* LLM 只被允许在被限制的沙盒内做高阶抽象工作(假设构思、因果诊断)。
这印证了一个趋势:生产环境越复杂,越要剥夺 Agent 直接敲打命令行(Bash)的自由度,把不确定性限制在决策层,而非执行层。
2/ 解决知识断层:将隐性工程经验“代码化” (3/5)
大公司算法团队最昂贵的资产往往不是模型代码,而是资深工程师脑子里的“踩坑经验”——哪些参数会导致分布式通信阻塞、哪个版本的 CUDA 算子有暗坑。
论文中设计的“执行演进环(Model-Specific Playbooks)”本质上是在做组织隐性知识的沉淀:
* 智能体经历的环境适配、算子编译排错过程被自动固化为结构化规程;
* 当下次启动新实验或环境漂移时,系统调用的是演进后的先验知识,而不是每次都从零提示词去撞墙。
让 Agent 能够“自我固化工程记忆”,是跨越长反馈周期的关键基础设施。
3/ 算法工程师的生态位正在发生质变 (4/5)
Auto-RecSys 并不是要取代算法工程师,而是把人从“人肉实验员”的角色中解耦:
* 过去:80% 的精力消耗在写胶水代码、查分布式日志、盯显存和指标看板;
* 未来:工程师的核心价值转移到更高维度的两件事:
* 定义假设探索空间(Search Space Design):告诉系统向哪个业务方向寻找增量;
* 评估指标防偏(Guarding against Goodhart's Law):防止 Agent 为了单纯追逐短期离线 AUC,设计出过度复杂、危害在线推理延迟的畸形架构。
4/ 结语 (5/5)
从 Auto-RecSys 可以看出,未来企业级 Agent 的护城河,不会是“调用了哪家最强的大模型 API”,而是一套能够管理长状态、容忍节点宕机、沉淀工程规程的持久化 Harness 系统。
这套工程哲学同样适用于工业 EDA 芯片设计、量化策略挖掘、AI 制药等任何具有“长反馈周期 + 高系统复杂度”的重资产研发场景。值得所有关注 Agent 生产落地的团队深入推敲。