X 每日精华

577 条推文 · Following: 520, For You: 57

今天最值得追踪的变化,是 AI 的判断开始被当作独立工程部件,而判断本身也开始接受检验Jev 的完成检查实验出现了关键澄清,上下文压缩的反例提醒我们重新计算整段任务的成本;Android 开发文档解析的新评测,则把“看起来做完了”拆成更具体的验收标准。另一边,Muse 开放连接器让服务开始争取 Agent 的调用,Meta 的领域专家系统展示如何把纠错留下来。贯穿这些进展的问题是:谁判断成功,依据是什么,判断错了如何修正?

0 / 7 解锁
#01
Jev 开始检查“完成”,但验证器也要验收
#02
压缩更快,整段任务未必更便宜
#03
99% 的完成度,也可能没有一次通过
#04
文档解析:总分之外,还要看能否定位原文
#05
Muse 开放连接器,服务争取新的调用入口
#06
专家纠错如何变成下一次的可靠性
#07
外部评估承诺出现合作方,独立性仍待条款说明
原型的价值,也包括允许它被丢弃
有些问题在代码里验证,比在 Figma 里讨论两天便宜。前提是工程接受第一版是临时的。
💭 当可运行原型越来越便宜,团队需要允许它完成验证任务后被丢弃。否则,生成速度越快,未经验证的设计就越容易沉淀为维护负担。可以把原型的验收目标写成“回答哪个问题”,并标明哪些部分尚不能进入生产。
  • Cloudflare security-audit — 据项目介绍,这套安全审计 Skill 将漏洞发现与反证交给不同 Agent:发现者不能自行确认,验证者先尝试推翻候选漏洞,最终区分确认、待核实与已排除。 GitHub_Daily (值得借鉴的是反证流程与证据分级。材料为二手介绍;一次运行的覆盖率有限,适合作为审查的补充。)
  • capcut-cli — 非官方剪映命令行工具,据介绍可直接修改本地草稿,完成静音裁剪、字幕和多语言草稿处理,同时保留可手工调整的轨道。 GitHub_Daily (独特价值是让 Agent 做粗剪、人继续精修;最终导出仍需手动操作,具体草稿版本兼容性需自行验证。)
  • guizang-product-video-skill — 作者发布的产品宣传视频 Skill,会读取代码库中的组件、配色和素材,生成文案与前端动效,并以代码制作配乐。 op7418 (复用真实产品组件有助于保持视觉一致;发布前仍需核对它从代码中推断的更新内容是否已经交付。)