TokenIT
模态GAP不存在了?图文领域首个token级大一统基座诞生
CLIP、DINO、SAM 基座的重磅问世,推动了各个领域的任务大一统,也促进了多模态大模型的蓬勃发展。 然而,这些经过图像级监督或弱语义训练的基座,并不是处理细粒度密集预测任务的最佳选择,尤其在理解包含密集文字的文档图像上。 为解决这一限制,上交联合美团实现了图文对齐粒度的新突破,其具备三大核心优势:构建业内首个 token 级图文数据集 TokenIT:该数据集包含 2000 万条公开图像以及 18 亿高质量的 Token-Mask 对。
3/18/2025 10:40:00 AM
机器之心
- 1
资讯热榜
OpenAI开源超Agent:Codex CLI,五小时内破 5000 颗星
基于 Spring AI + MCP + DeepSeek-R1-7B 构建企业级智能 Agent 工具调用系统
OpenAI 发布“智能体构建实战指南”实用性文档(附文档资源)
OpenAI发布34页智能体实践指南:从网络搜索到代码编写
ChatGPT重磅更新:新增图像库功能,可查看自己用GPT生成的所有图片
别再只玩ChatGPT了!OpenAI悄悄发布《构建 Agent 实战指南》 手把手教你打造智能体
Figma 推 AI 革命:开发智能应用制作器与网站创建工具
Midjourney图像编辑器迎来重大更新:全新UI、图层功能与智能工具上线
标签云
人工智能
OpenAI
AIGC
AI
ChatGPT
DeepSeek
AI绘画
数据
机器人
谷歌
模型
大模型
Midjourney
智能
用户
学习
开源
GPT
微软
Meta
AI创作
图像
技术
论文
Stable Diffusion
马斯克
Gemini
算法
蛋白质
生成式
芯片
代码
英伟达
腾讯
神经网络
计算
研究
Sora
Anthropic
AI for Science
3D
AI设计
机器学习
GPU
开发者
场景
华为
预测
人形机器人
伟达
Transformer
百度
深度学习
苹果
AI视频
模态
xAI
字节跳动
驾驶
文本
搜索
Claude
大语言模型
具身智能
Copilot
神器推荐
LLaMA
算力
安全
应用
视频生成
视觉
科技
亚马逊
大型语言模型
干货合集
特斯拉
2024
AGI
训练