🔥51CTO热榜:2026-08-06

Canvas UI 的出现,本质不是又一个 UI 库,而是在尝试解决一个新问题:如何让开发者更低成本地创造具有视觉冲击力的 Web 体验。
本文主要介绍来自该团队的最新论文 Music-to-Dance Generation via Atomic Movements。
只需输入少量不同视角、无需提供相机位姿的图片,即可在一次前向推理中,秒级生成可自由切换视角的 3D 场景。
我们发布了 ActiveVision——一个专门测量这种「主动观察」能力的视觉推理基准。
当行业还在争论Agent能不能自己反思、自己纠错、甚至越用越聪明时,斯坦福的两位实战派教授Dr.Aakanksha Chowdhery和Azalia Mirhoseini已经把这个问题拆成了一门完整的教学课程CS329A《自我进化AI智能体》。
AI会画图,已经不是新闻,真正值得讨论的是,当大模型越来越强以后,它还能做什么?
有这样一支清华系团队再展锋芒,规模不大、实力却不小——抢先用MoE架构把视频生成模型卷上千亿参数,代码权重还全!开!源!
清华大学唐杰教授团队、新加坡国立大学(NUS)以及Bosch AI联合发布了一篇针对大模型记忆架构前沿的详尽综述。
整体而言,SpaceX的AI业务亏损在收窄,但绝对规模仍然很大。
先是菲尔兹奖得主官宣入职,紧接着翁荔爆出加入,如今又来了一位大佬。
今天这篇,就把两遍阅读都交代一下。前半篇讲方法,A-Mem确实有不少巧思,值得认真拆解。后半篇聊聊我发现的不对劲,以及我认为它真正值得借的东西。
模型已不再是瓶颈,「不会用」才是。于是,OpenAI亲自出手,一口气拿出三款插件,要把「不会用」这道门槛给磨平。
来自清华大学智能产业研究院(AIR)与UC Berkeley BAIR的研究团队提出了ODEWorld——全球首个连续时间具身世界模型。
本文目标是建立一套可用于实际工作的框架:面对一个模型、一组 GPU、一个业务流量目标,你能够计算显存、并发、吞吐、延迟、实例数和成本,并知道每个优化手段解决的到底是什么问题。做推理优化,很核心的一个能力就是要学会算数。
当 Codex 可以同时跑很多个任务,Claude Code 可以长时间留在工程现场,Cursor 可以让多个 Agent 在不同 worktree 里并行工作,“完成”会越来越便宜,也会越来越频繁。
数据仓库是用来存储和分析大量结构化数据的;数据湖更像个大水池,什么数据都能往里扔,包括日志、图片、视频这些非结构化数据。它们更多是大数据架构层面的概念。
每个人都在用 AI 提效,为什么整体交付周期没有显著缩短?因为真正影响效率的,不只是单点任务的执行速度,更是角色之间的等待、交接、信息损耗与重复返工。只有围绕 AI 重新设计流程和协作方式,才能从“更快的局部”走向“更短的整体”。
真正值得做的是两件事:一件事,把 Agent 工作中学到的经验,压缩成可验证、可传播、可撤销的控制对象。另一件事,把多 Agent 协作里的确定性部分交还给程序,让任务覆盖、结果格式、失败重试、权限边界和最终合并都有稳定协议。
腾讯&中科院信工所的 RARG,给出了一个干脆利落的解法:相关性既不当筛子、也不当饭碗,而是当导航——Embedding 只负责把语料库排成"按相关性排序的队列",grep 沿着队列挨个深挖。
Loop Engineering,在我的理解里,它解决的是“自动化”的问题。即如何在不脱离人类目标的前提下,让 AI 能够自动运转、自我迭代,尽可能减少人的手动干预。