上海交大提出ICRDrag:首个上下文区域拖拽模型,实现精准可控图像编辑
上海交大提出ICRDrag:首个上下文区域拖拽模型,实现精准可控图像编辑还在用 DragGAN、DragDiffusion 拖拽修图?点选拖拽容易变形、边界割裂、细节丢失的时代落幕了!ECCV 2026 ICRDrag 首创上下文区域拖拽模型,用掩码精准定位局部区域,移动、缩放、变形全都丝滑自然,兼顾精准度与画面真实感。
搜索
还在用 DragGAN、DragDiffusion 拖拽修图?点选拖拽容易变形、边界割裂、细节丢失的时代落幕了!ECCV 2026 ICRDrag 首创上下文区域拖拽模型,用掩码精准定位局部区域,移动、缩放、变形全都丝滑自然,兼顾精准度与画面真实感。
近日,上海AI Lab等团队提出了一种面向专业软件智能体的新范式——ComAct(COM-as-Action)。它的核心思想在于:不再把鼠标点击和键盘输入作为Agent的action,而是让Agent直接生成COM代码,通过软件底层对象模型操纵真实专业软件。
vLLM 社区推出的 Semantic Router 除了专注上面三个方向,正在更进一步:我们认为:router 不只是选择模型,还可以提升模型能力。用户不用改权重,也不用让每个 Agent 团队都自己搭一套 Graph,而是在一次普通 Model API 调用的内部,组织出一支有边界、有预算、有验证、有回退的 “小队”。
今天来好好盘点 2026 年上半年的图片与视频模型,伴随模型更新时间轴出现的,还有我一些当时的测试文章。也算是对不怎么努力也没什么收获的上半年做个总结汇报了。
浙江大学等五所高校的研究团队提出 EgoTSR。研究从第一人称机器人视角出发,希望让 VLM 学会判断任务状态,并把这种能力进一步扩展到长程规划。团队构建了包含 4600 万条样本的 EgoTSR-Data,并设计了三阶段课程学习流程。
今天,我们将面向任何用户推出OmicOS Science正式版(https://omicos.cn/),无论您处于世界上的任何区域,无论您使用的是任何模型,都可以享受AI时代的红利!我们深知,科学研究最关键的一环是可审计与可复现性。在OmicOS Science中,点击生成的每一张图,你都能看见这张图绘制的代码
AI新云赛道再现巨额融资。成立于2022年的AI新云(Neocloud)公司Together AI,于7月1日正式宣布完成8亿美元C轮融资,投后估值达到83亿美元。Together AI的核心业务是出租NVIDIA GPU集群及其他AI专用基础设施,为企业提供运行开源大模型的云平台。
2026 年,风向掉头了。几个最受关注的年轻 AI 人才,开始走进大厂。罗福莉,四川宜宾乡村出身,北大硕士,DeepSeek-V2 作者之一。被雷军点名后,“天才少女”四个字在热搜上挂了很久。她去了小米,负责大模型 MiMo。
就在昨天,网友们激动发现:Codex应用的底层代码中惊现GPT-5.6 Sol、Terra和Luna三大子模型标识。更令人期待的是,一个全新的「速度拨盘」功能也出现在代码中。根据爆料,OpenAI已经在内部定下了死命令:GPT-5.6发布的目标窗口直指下周二(7月7日)至7月9日。
Github热榜持续屠榜,短短几天一路狂揽15.4k stars,甚至一度冲到了Top 1的位置。不是啥大厂项目,也不是啥新模型。而是一个叫OpenMontage的开源「视频制作」系统~(剪辑人狂喜.jpg)