Gemini 2.0成P图神器,各种P图只需一句话的事儿,可把网友馋哭了

Gemini 2.0说说话就能一键P图的功能爆火,把玩不了的大伙儿都馋哭了! 比如一辆小车车:输入指令“把这辆车改装成敞篷车”,它就能立马将文字指令和图片结合起来,完成一键P图。 让我们来找茬儿,发现除了车变成了敞篷的,其它元素木有变化,很好地保持了一致性。

Gemini 2.0说说话就能一键P图的功能爆火,把玩不了的大伙儿都馋哭了!

比如一辆小车车:

图片

输入指令“把这辆车改装成敞篷车”,它就能立马将文字指令和图片结合起来,完成一键P图。

图片

让我们来找茬儿,发现除了车变成了敞篷的,其它元素木有变化,很好地保持了一致性。

不仅于此,Gemini 2.0还有点“多模态版o1”那味儿。

继续输入指令:想象一下,这辆车内装满了海滩用品。接着,将车身颜色改为一种令人联想到夏日的颜色,并在改变过程中进行说明。

然后Gemini 2.0就开始图文并茂地一步步推理生成了,先把车变成了明亮的黄色,接着又再车里装满了遮阳伞等海滩用品。

图片

这就是Gemini 2.0系列的原生图像输出能力。

评论区底下,一水儿都是求具体上线时间的:

图片

被谷歌挖走的OpenAI大将Logan Kilpatrick回应,大伙儿别急,明年年初将更广泛地推出。

图片

各种P图都是一句话的事儿

除了上面展示的简单P图,你甚至可以同时P图片中的多个元素,还能把一个物件变成另一个。

比如,把蓬松的夹克变成一个小枕头,并且拿掉毯子:

图片

这还没完,结合不同的图来P也行。

猫和抱枕结合,就得到了一个很有质感的猫猫抱枕:

图片

把猫猫和滑板结合就得到了猫猫代言滑板。

遵从文字指令,Gemini 2.0成功将猫猫变成了插画贴纸形态。

图片

除此之外,Gemini 2.0 P图时还能更有想象力。

比如一个箱子,把箱子打开就变成了酱婶儿:

图片

开头展示的小车车,也能变成“飞车”:

图片

另外,还有一种玩法。

在图像中圈出需要P的区域,只需“Open this”,Gemini 2.0可以直接结合文字指令理解图像,知道“this”的指代:

图片

不得不说,那些有内测资格的玩家,可算了把大伙儿馋坏了。

图片

参考链接:https://x.com/OfficialLoganK/status/1868364831948251419。

相关资讯

91.1% 准确率,性能远超 GPT-4 系列模型,谷歌推出多模态医学大模型 Med-Gemini

编辑 | 萝卜皮各种复杂的医疗应用给人工智能带来了巨大挑战:需要先进的推理、获取最新的医学知识以及对复杂的多模态数据的理解。Gemini 模型在多模态和长上下文推理方面具有强大的通用能力,为 AI 在医学领域应用提供了可能性。基于 Gemini 的核心优势,谷歌的研究人员推出了 Med-Gemini,这是一个功能强大的多模态模型系列,专门用于医学,能够无缝使用网络搜索,并且可以使用自定义编码器有效地针对新颖的模态进行定制。研究人员用 14 项医疗基准评估 Med-Gemini,在其中 10 项上建立了新的最先进(S

谷歌发布 3 款 Gemini 实验 AI 模型:1.5 Pro 冲榜第二、1.5 Flash 从第 23 蹿升至第 6

谷歌 AI Studio 产品总监洛根・基尔帕特里克(Logan Kilpatrick)今天(8 月 28 日)在 X 平台发布推文,宣布推出 3 款 Gemini 实验性模型。AI在线附上谷歌本次推出的 3 款实验性 Gemini AI 模型如下:Gemini 1.5 Flash-8BGemini 1.5 Flash-8B 是 Gemini 1.5 Flash 的更小尺寸模型,拥有 80 亿参数,专为多模态任务而设计,包括大容量任务和长文本摘要任务。Gemini 1.5 Pro Exp-0827主要增强编程、复杂

AI 聊天机器人大战升温:谷歌 Gemini 预告片展示惊艳语音视频交互能力

人工智能聊天机器人领域烽烟再起,谷歌和 OpenAI 之间激烈的竞争态势愈演愈烈。就在谷歌一年一度的 I / O 开发者大会召开前夕,这家科技巨头发布了一段视频,展示了疑似经过升级的 Gemini 聊天机器人。视频中,Gemini 可以同时实时处理来自视频和语音的输入。这段视频貌似是在 I / O 大会搭建现场拍摄的,视频展示了 Gemini 在一台 Pixel 手机上流畅地处理实时视频和语音提问,并准确地提供信息。当被问到正在进行的布置工作时,Gemini 正确识别出这是为一个重要活动做的准备。 整个对话过程自然