Databricks AI Dev Kit:让 Coding Agent 真懂你的湖仓平台
让 Coding Agent 写普通 Web 代码已经不新鲜了。难的是让它进入一个复杂数据平台:Spark、Unity Catalog、Jobs、MLflow、Model Serving、权限、表结构、流水线规范全都在场。 `Databricks AI Dev Kit` 解决的是这个问题:给 Claude Code、C
共 66 篇文章
让 Coding Agent 写普通 Web 代码已经不新鲜了。难的是让它进入一个复杂数据平台:Spark、Unity Catalog、Jobs、MLflow、Model Serving、权限、表结构、流水线规范全都在场。 `Databricks AI Dev Kit` 解决的是这个问题:给 Claude Code、C
企业里最浪费时间的动作,可能是找东西。文件在 Drive,决策在 Slack,需求在 Jira,线索在邮件,代码在 GitHub,最后每个人脑子里还有一份“只有我知道”的隐性地图。 `Xyne` 盯上的正是这个问题:给工作场景做一个开源的 AI 搜索与问答引擎。 仓库地址:xynehq/xyne ## 它不是普通知识库
手机上写代码这件事,听起来一直有点别扭。屏幕小、键盘慢、上下文看不全,真让人把一台手机当开发机,多少有点遭罪。 `Lunel` 的有趣之处在于,它没有把手机伪装成开发机,而是把手机变成 AI Coding 的遥控台。 仓库地址:lunel-dev/lunel ## 三层架构,比远程桌面克制 Lunel 大致分三层:移动
小米 MiMo-V2.5 系列开源之后,又给开发者放了一波更直接的东西:MiMo Orbit Token 激励。表面看,这是一次免费额度活动;往深一点看,这是国产模型主动争取 AI builder 的一次入口战。 别把它只理解成“薅点 Token”。如果只是领完额度、跑几个聊天问题、截个图发朋友圈,那这波额度基本就浪费
TypeScript 团队做 Agent,常见路线是从前端或 Node 服务里拼一个聊天 demo:接模型、写工具、加一点 memory,再接到页面。能演示,但上线后很快缺东西:trace 看不见,工具失败不好查,RAG 数据难管,guardrail 没地方放,部署也像临时脚本。 VoltAgent 想把这条路工程化:
Agent 想做研究,最先卡住的不是模型,而是“看不见”。网页能不能读,YouTube 字幕怎么拿,Reddit 讨论怎么搜,GitHub 信息怎么查,RSS 怎么订阅,微博客平台怎么处理登录态——这些事情分散又琐碎。 Agent Reach 把问题拆成一套互联网工具箱:网页、RSS、GitHub、YouTube/B
让 Agent 还原 Figma 设计时,最常见的做法是丢一张截图。问题是截图只能给视觉结果,给不了布局层级、间距、字体、颜色 token、frame 结构和命名。模型看得到“长这样”,但很难知道“为什么这样”。 Framelink MCP for Figma 做的是把 Figma 文件、frame 或 group 的
Agent 应用最怕“演示很好,上线就飘”。本地试十次都对,真实用户换个问法就错;工具调用在测试里正常,生产里突然走偏;你知道它失败了,却不知道失败发生在哪一步。 Future AGI 想做的是一条完整质量闭环:评测、追踪、模拟、数据集、网关、防护都放在一个平台里。它不是单点 eval 工具,而是更像 Agent 应用
把 Agent 接进 CI/CD,听起来很诱人:自动整理 issue、修小 bug、更新文档、跑评审、生成 PR。问题是,Agent 一旦进了仓库自动化链路,权限、输出和审计就不能再靠一句“相信模型”。 GitHub Agentic Workflows 的方向很值得看:用自然语言 Markdown 写 agentic
AI 编程最大的问题之一,是同一句“修这个 bug”,今天和明天可能跑出两种完全不同的过程。一次它先读测试,一次它直接改代码;一次会写计划,一次把计划省了;一次跑验证,一次嘴上说完成。 Archon 的思路很直接:不要把工程流程交给模型临场发挥,而是把计划、实现、测试、review、审批和 PR 创建写成工作流。模型负
AI 编程现在有个越来越明显的断层:代码最后进了 Git,但代码是怎么被 AI 写出来的,往往不在 Git 里。 你能看到 commit diff,能看到谁合了 PR,却很难回答几个更关键的问题:当时给 Agent 的任务是什么?它读过哪些文件?中间跑过哪些命令?为什么放弃了第一版方案?有没有把一个错误假设带进最终代码
Obscura 需要纳入评估,不是因为它喊出了“替代 Chrome”。这个说法太大,也容易误导。它更有意思的地方,是在完整浏览器和普通 HTTP 爬虫之间,挤出了一层更轻的执行底盘。 很多 AI Agent 做网页任务时,并不需要真的渲染像素。它们需要的是打开页面、跑一段 JavaScript、拿 DOM、处理 Cook
DeepSeek V4 这次降价,最值得看的不是“又便宜了”,而是便宜的位置。DeepSeek V4 Flash 的百万输入缓存命中价格,从 0.2 元降到 0.02 元;V4 Pro 的百万输入缓存命中价格,也从 1 元降到 0.1 元。
很多 AI Agent 做网页任务时,最尴尬的不是不会写代码,而是看不见真实网络。浏览器里点一下,背后跑了哪些 API、带了什么 Cookie、哪里做了签名、哪个请求失败了,Agent 往往只能靠页面结果猜。 `anything-analyzer` 把这个问题往工程侧推了一步:内嵌浏览器抓包、MITM 代理、JS Ho
AI 编程工具用久了,大家都会遇到一个问题:你明明只想让它修个登录 bug,它偏偏开始设计一套“可扩展身份系统”;你让它写一段营销文案,它先给你上价值,再给你编十个受众画像。不是模型不会干活,而是角色没定住。 `agency-agents-zh` 值得看的地方,不是“有 211 个 AI 专家角色”这个数字,而是它把角
以前聊 Playwright,重点多半落在“怎么点按钮、怎么找元素、怎么稳定跑 CI”。到了 Agent 这一步,问题其实变了:不是让 AI 多会操作浏览器,而是让它别把测试写成一锅粥。 Playwright Test Agents 有意思的地方就在这儿。它没有把“写测试”塞给一个万能 Agent,而是拆成三个角色:P
Deep Researcher Agent 火,不是因为它又包装了一个“AI 科研助手”的概念,而是它盯准了研究里最磨人的一层:实验运营。 改超参、跑训练、看日志、整理结果、再改。真正有价值的是 idea 和判断,但研究者大量时间耗在等待和机械复盘上。Deep Researcher Agent 想接过去的,正是这段重复
前端工程师转 AI Agent,最容易掉进一个坑:以为补一轮 Prompt、学会调 OpenAI API、弄懂几个 Agent 框架,就算入门了。 这只能算摸到门把手。真正把 Agent 跑进业务里,硬骨头在后面:HTTP、鉴权、任务队列、数据库、向量检索、日志、权限边界、失败重试。模型负责“想”,系统负责“能不能安全
Beads 的定位很清楚:给 Coding Agent 用的 distributed graph issue tracker,底层用 Dolt,提供结构化、可合并、可查询的任务记忆。它想替代那种越来越乱的 Markdown TODO、聊天记录计划和临时任务清单。长任务里,Agent 最容易忘的不是代码,而是“现
RTK 的定位很直接:CLI proxy,减少 LLM 在常见开发命令上的 token 消耗。它不是让模型更会写代码,而是让 Agent 别把钱和上下文窗口浪费在 `ls`、`cat`、`grep`、重复日志和巨长输出上。README 里提到在常见开发命令上能减少 60% 到 90% 的 token 消耗,这个数字先别