202609-21
日常要 AI 干的活,很大一部分不是写而是判。TypeSafe 9 月发布的 Jev 换掉了这个接口:不生成文字,直接返回带校准概率的类型化答案。全文分七节拆开它——从 RLHF / RLVR / RLCD 三代训练目标的差异讲清接口错配,到 Noul、Choice、Score 三种原语与并行求值的三个工程性质;重点落在 confidence:它由概率分布的形状导出(工单归入 billing 的概率 0.84,置信度却只有 0.596),据此构成低置信转人工、中置信复核、高置信自动的三段路由。评测数字被放回条件里读:官方 67.8% 的参考答案取自两个最强模型的平均,属一致率而非正确率;独立复现显示 50 份多语种发票 50/50、每千次 0.025 美元,但业务规则未写进请求时会 19/24 出错、其中 15 条置信度高于 0.90。最后给出三条接入路径、两个必须避开的坑、一份五步起步清单,以及它在实证研究文本变量构造与课程教学中的可操作切入点;文末另补四条面向实证研究的警示:并行答案在统计上并不独立、“文本提及”不等于“事件发生”、引用核验的用法、上线评估要看覆盖率与错误率而非只看准确率。配四张原创示意图。
决策模型 Jev 校准概率 置信度路由 Agent 文本变量
阅读全文 →
202609-17
产业数据说落地浅(德勤 3235 家企业仅 21% 成熟、Anthropic 报告却显示 57% 已跑多阶段工作流),网商银行却把 Agent 推进了信贷审批核心区——矛盾本身就是线索。汇编四路材料拆解企业级 Agent:瓶颈的三重错配(模型通用对知识私有、个人用法对生产要求、智能化预算对数字化底子),范式收敛(Claude Tag、飞书 8.0 与豆包工作伙伴、WorkBuddy 企微 CLI、千问嵌入钉钉四条路线对照),网商银行 Agent First 的四个改变与四个抓手(定 OKR、企业「图书馆」、权责边界、可靠运行),信贷审批专家牛学峰「AI 教练」模式带来的近 20 倍处理能力提升与 160 万客户重获授信机会。不止于分析:给出飞书侧六步落地路径(容器化与智能纪要、治理先行、认领工作伙伴、多维表格字段捷径智能体、工作小队与自动化、纠偏回流),每步对应官方帮助中心的可核实入口;最后是三点观察:上下文正在入表、数字化不再是纯前置、评价指标从跑分迁移到智能密度。附需求杠铃、交互三阶段、Agent+容器架构、经验沉淀闭环四张示意图。
企业级 Agent 上下文 SaaS AI 协作 数字化
阅读全文 →
202609-15
数据门户给了连接串和一段「数据表 略」,AI 却连表名都猜不到——MCP 系列第二课把这个缺口补上。以 103G 内部数据(PostgreSQL / SQL Server / MongoDB 三类引擎、10 个数据集)为真实场景,用 Python 官方 SDK 一步步写一个数据 MCP Server:datasets.json 当「数据通讯录 + 踩坑笔记」,把后复权价、时间字段存错、3 亿行大表这些隐性知识装进协议层让每个客户端自动继承;五个工具组成「数据探索阶梯」(list → describe → run_sql / mongo_find → run_python 预注入连接);安全上是账号 / 连接 / 语句三层只读防线加 500 行兜底;最后经 run.sh 统一启动脚本挂载到 WorkBuddy、Trae、豆包办公、Codex CLI、Zcode 等客户端,附 Codex TOML 与沙箱的坑。全文输出均为真实运行结果:协议级握手、五工具发现、真实取数 2545 行。
MCP 数据 MCP Python SDK PostgreSQL MongoDB 只读安全
阅读全文 →
202609-09
大模型再聪明也碰不到你电脑上的日历——MCP 就是那座桥。以「一句话写入本机日历」为教材,从协议原理讲起:MCP 是什么、MCP Client(协议会话层)与 MCP Server(工具提供方)的角色分工与三大常见误区、一次工具调用的四阶段 JSON-RPC 消息流、stdio 与 HTTP 传输怎么选;再一步步用 TypeScript 搭建跨 macOS/Windows 的日历 MCP——平台探测、CalendarAdapter 适配器抽象、双平台打包,做出一套可被豆包办公、WorkBuddy、DeepSeek Harness 等多个 Agent 端复用的 Server,最后附调试坑清单、公众号会议通知一键写日历的进阶场景与三阶学习路线。
MCP MCP Server MCP Client 智能日历 stdio 跨平台
阅读全文 →
202609-09
收藏夹几百篇文章,期末写综述时一篇都想不起来?从 Obsidian 的两条底层设计(本地 Markdown、双向链接)讲起,用一张对照表说清 Notion、Logseq、Roam、flomo 各管哪一段;重点拆解 Karpathy 的「LLM 知识库」工作流——raw/wiki/outputs 三层分层、增量编译、问答落文件,以及 Obsidian CEO Kepano 的边界提醒「给 AI 另建一个脏乱的库」;最后是今天就能跑通的五步上手清单,附界面与图谱视图截图。
Obsidian LLM 知识库 双向链接 笔记工具选型 Evergreen Notes
阅读全文 →
202609-02
还不会自己蒸馏?先用别人蒸馏好的成品。以段永平视角技能为例,讲清技能文件的结构(SKILL.md + 六维调研档案)、三种安装方式怎么选(npx 一行命令 / git clone / 网页下载 zip)、各 AI 工具的 skills 目录对照表,以及为什么「新开会话」是九成「装了没反应」的原因,附触发词验证的预期效果与调用边界。
思维蒸馏 Skills 人物视角 安装指南 Agent
阅读全文 →
202609-02
从化学蒸馏、知识蒸馏到思维蒸馏的三层含义讲起,把「从公开资料里提取一个人的认知框架」拆成可照做的六步:建目录、六路并行采集、三重验证提炼、构建 SKILL.md、质量验证与双 agent 精炼;对照女娲、awesome-nuwa、colleague-skill、darwin-skill 四个开源项目学方法,最后讲清自己写一个蒸馏器的三要素与专家出新资料时的增量更新法。
思维蒸馏 心智模型 Skills nuwa 知识蒸馏
阅读全文 →
202608-28
出厂状态的 WorkBuddy 只能给通用答案,效率上限由四层配置决定:模型、技能、连接器、知识库。以 DeepSeek API 四步接入为示例讲透外接模型的三条路线,技能的三种来路(内置、SkillHub、skill-creator 自建),MCP 连接器全景与腾讯会议 tmeet-skill 的台历式用法,以及 IMA 知识库"先收后取"的素材库打法——附知识库检索与网络搜索的对照表、四条配置纪律与十八张可对照的界面截图。
WorkBuddy 外接模型 Skills 连接器 腾讯会议 知识库
阅读全文 →
202608-20
零基础可跟做的上手指南:先认识 WorkBuddy 与 Obsidian 各是什么(Markdown、Vault、Karpathy 的 LLM wiki 一次讲清),为什么不选 Notion 与本地 docx,从安装、新建 Vault、连接模型到三段提示词逐步搭建——双链、反向链接、知识图谱全部配官方文档截图演示,附站内讲义与技能库作为首批入库资料,进阶介绍 WeSight 知识大脑。
WorkBuddy Obsidian LLM wiki 知识管理 学习指南
阅读全文 →
202608-15
上下文窗口再长,也不是记忆。从记忆科学的三层抽屉讲到技能文件的渐进式披露机制,最后给出论文复现、数据库取数口径、期刊投稿等五个可直接照做的科研场景,以及技能化的四个常见坑。
Agent Skills 程序性记忆 工作流
阅读全文 →
202608-14
生成式大模型动态对齐、采样随机、版本漂移,同一文本跑两遍结果就变;BERT 编码器权重冻结、前向确定,才是能进回归的"测量仪器"。从魔搭模型本地化、预处理参数写死、最后四层 CLS 平均特征,到 LONGBLOB 入库 MySQL 的完整流程,附两次运行零差异、读回字节级一致的真实运行记录与六篇专利摘要的下游演示。
BERT 可复现性 文本计量 特征提取 MySQL
阅读全文 →