AI Builder · AI Systems Architect
我关心的不是「模型还能多聪明」,而是:怎样把一个模糊的真实问题,组织成可理解、可验证、能持续运行的 AI 系统。
I turn messy workflows into reliable AI systems with explicit context, state, evaluation, and human authority.
模型能力越来越强,但真实工作依然会失败:上下文会丢、状态会过期、工具会误用、结果无法验收,责任也常常没有明确归属。
我的工作方式是先理解用户、业务和约束,再设计 Context、State、Tool、Evaluation 与 Feedback Loop。AI 负责处理信息和执行任务,人保留目标、取舍与最终责任。
模型负责能力,Harness 负责可靠性,人负责方向。
把「投资时保持纪律」从意志要求改造成系统约束:判断会过期,高风险动作有时间锁,执行者不能给自己签字,正式写入必须经过 Reviewer、Validator 与 Human Merge。
AI Harness · Human-in-the-loop · Evaluation · 189 validation tests
不是再做一个运动数据面板,而是回答一个人的真实问题:今天身体为这次训练付出了什么,以及为什么? 系统把 Apple Health / COROS、天气和个人历史基线放进同一条解释链,并默认保护路线隐私。
Local-first · Personal baseline · Health data · 35/35 E2E
把多平台信息获取、筛选、深度萃取、队列调度和消息交付组织成稳定管线。目标不是读得更多,而是减少噪音,让真正有增量的信息进入可追踪的知识系统。
Production pipeline · Multi-source · LLM evaluation · 332 tests
从「信息抓取」继续向「信息消费」推进:把深度萃取、阅读、批注和再生产放进一个完整产品界面。它是对产品形态和商业边界的探索,而不只是一个抓取脚本。
Product thinking · Full-stack · Prompt as configuration
大多数 Agent 教程在解释怎么写代码,这个项目换了一个问题:面对一个业务场景,产品真正需要演进到哪一级 Agent 能力? 用框架对比练习架构判断,而不是追逐框架名称。
Architecture decisions · Product thinking · Learning system
从真实兴趣出发的轻量产品实验:根据徒步者的性格、体能和体验底线推荐路线,验证「用户理解 → 产品判断 → 快速实现」的完整过程。
Product prototype · User context · TypeScript
真实的人与场景
↓
理解上下文,定义真正的问题
↓
选择数据、AI、工具与流程
↓
建立 Harness、权限与失败边界
↓
用 Evaluation 验证结果
↓
人做取舍,反馈进入下一轮系统
我不追求把所有细节都交给 AI,也不把实现本身当作目标。我更在意:问题是否值得解决、系统是否真的可靠、结果能否被验证,以及它是否为真实的人创造了价值。
- AI Harness Engineering
- Data & AI Productization
- Human-in-the-loop Systems
- Evaluation, State & Feedback Loops
- Business Context → Reliable Delivery
正在把这些项目里的方法迁移到真实 B2B 工作流:从需求访谈开始,把一个具体流程推进到可验证、可交付、异常有人负责。
背包、摄影、徒步,也看阿森纳。对我来说,探索不是收集更多新鲜事物,而是走进真实现场,再把看到的问题做成能运行的东西。

