🔥51CTO热榜:2026-08-14

随着Anthropic、OpenAI等模型公司也在向能够独立运行数小时甚至数天的智能体方向发展,能写不出错的代码已变成了这个赛道门槛和及格线。
浙江大学ReLER团队提出并开源PhyEdit,用显式3D几何preview指导DiT图像编辑,让模型更准确地处理物体远近、尺度、遮挡和多物体操作。论文已被ACM MM 2026接收。
Multica 的核心并非某个新模型,而是一组工程约束:一个接口配多份实现,一套工作目录约定,一个单一真相源,以及一份将多数规则都标注了对应触发 bug 的工程文档。对于研究「人与 Agent 协作」如何落地的开发者,它是一个值得逐行阅读的开源参考实现。
有个服务为了省 Redis 调用,用 static HashMap 做本地缓存。上线后跑了一周,内存曲线只升不降,最后 Full GC 都回收不掉,因为那些对象被 Map 强引用着。
模型能力再强,也得靠工具和工作流把活干完。DeepSeek Harness 把这些能力全部开放出来,开发者可以自己换模型、改插件和定制模式,这条路跟封闭的一体化产品很不一样。
今天,OpenAI重磅发布《GPT-5.6构建者指南》,交出了一份亮眼的成绩单。在ARC-AGI-3上,GPT-5.6 Sol的性能从13.3%飙到38.3%,输出Token暴降6倍。
eepSeek Harness 目前还只是 v0.1 Developer Preview。官方也明确提醒,项目正在快速迭代,后续甚至可能出现破坏兼容性的变更,因此现阶段更适合体验、研究和插件开发。但它背后的方向很值得关注。
最值钱的是第 6 条和第 10 条。第 6 条是我这次实测里最反常识的一条——​​json_object​​ 开了照样给你 ​​"high"​​,而真正管住形状的 ​​json_schema​​ 大部分教程压根没提;第 10 条是我自己翻车的地方,一句 ​​err.message​​ 就能把内网主机名送到客服话术里。
这道面试题看似是在问技术方案,实际上是在考察你有没有"生产环境安全意识"。也难怪我那句"单独管理就好"会让面试官冷笑。这四个字背后藏着的坑,够写一整篇架构设计文档了。
DeepSeek V4 Pro 昨天发布,DeepSeek Harness(dsh)开发者预览版同步开源。本文从实战演示到源码架构,逐层拆解这套系统的设计哲学与技术细节。
V4 Pro 负责理解任务、推理和选择下一步。Responses API 在客户端与模型之间传递输入、输出和工具结果。DSH 负责调度后续执行,并把会话过程记录下来。Agent 往往要连续调用多轮模型和工具,账单最后取决于整次任务跑了多少轮。
把大型代码库逆向成元模型,本质上是一次认知范式的转换:从"读懂项目"转向"把项目建成可导航、可验证、可持续维护的知识资产"。 渐进式探索是这场转换的方法论——先地图后细节、先索引后展开、先稳定后可变,配合证据分级对抗记忆漂移,配合进度检查点实现跨会话续跑,配合一致性校验保证产物可用。
DeepSeek Harness 的设计理念是一切皆插件,基于插件式的开放架构来构建 Agent Harness ,Harness 中的模型、工具、技能、会话、沙箱、存储、循环、调度、UI 等所有 Agent 能力均由插件组合而成,可自由替换、灵活重组。
AI 系统不是科幻,而是工程。它由四个部件(环境、传感器、执行器、决策机制)组成,靠一条循环(Agent Loop)持续运转,靠一组工具(Function Calling)接触现实世界。
一个DaemonSet部署节点监控,一个Deployment部署MySQL监控,又一个Deployment部署Redis监控...配置文件满天飞,版本号不一致,资源配额难以控制。
Milvus、pgvector、Qdrant这三个向量库选哪个不都差不多,无非就是存一下向量数据、再进行语义相似度检索吗?可真上手才发现水有多深。
多数员工直到换帅消息对外公布时,才知道DeepMind即将发生重大调整。如今,他们又要面对一连串尚未得到回答的问题:究竟哪些团队会被迁走?谁来决定剩余项目的命运?那些不直接服务Gemini的研究,还能获得多少资源?
回答 Deep Research 时,先说明它是一类研究型 Agent 架构,而不是 LangChain 核心包中的一个开关。官方参考实现与通用 Deep Agents 框架定位不同,但它们都可以借助 LangChain 和 LangGraph 的模型、工具、状态与编排能力。
什么时候选 MCP,什么时候选 Skills?如果你的 AI 应用需要访问实时数据,而且要用比较受控、有权限边界的方式访问,那 MCP 更合适。如果你只是想给 AI 增加一个可复用的自定义能力,那配置 MCP 可能就有点重。这时候 Skills 更合适。
看完这篇文章,你会知道,问题不一定出在模型不够聪明,也不一定是向量数据库不行,而是复杂文档本身就不是一个干净的答案库。我们先从最简单的 RAG 流程说起。