本地部署 DeepSeek Janus Pro 文生图大模型
在这个春节期间最火的显然是 DeepSeek 了。据不负责统计朋友圈每天给我推送关于 DeepSeek 的文章超过 20 篇。打开知乎跟 B 站也全是 DeepSeek 相关的内容。不过大部分的内容都是关于 DeepSeek R1 推理模型有多牛逼。在这里就不多说关于 R1 的废话了,因为大家已经看腻了。R1 在本地用 ollama 跑了一下,太简单了,都没必要写个教程。除了 R1 今天还在本地部署成功了 DeepSeek 的 Janus Pro 模型。
什么是 Janus Pro
Janus-Pro 是一种创新的自回归框架,其统一了多模态理解与生成任务。该框架通过将视觉编码解耦到不同的处理路径(同时仍使用单一统一的 Transformer 架构进行信息处理),有效解决了先前方法的局限性。这种解耦机制不仅缓解了视觉编码器在理解与生成双重角色间的冲突,还显著提升了框架的灵活性。Janus-Pro 在性能上超越了以往的统一模型,并达到甚至超越了专用任务模型的表现水平。凭借其架构简洁性、高度灵活性和卓越有效性,Janus-Pro 有望成为下一代统一多模态模型的重要技术方向。
以上内容来自 Janus Pro github 仓库的介绍,非常的学术。简单说它是文生图的模型,类似 DALL-E 3, Stable Diffusion。
以下就让我们看看这么在本地的 PC 电脑来运行 Janus Pro 模型吧。
1. 安装 conda
从以下地址下载 anaconda 的 windows 安装包https://www.anaconda.com/download

安装完成后需要把安装目录配置到环境变量 PATH 上
2. 创建 python 虚拟环境
注意:Python 3.10 是经过验证的兼容版本,避免使用其他版本导致依赖冲突
3. 克隆 janus 仓库到本地
4. 安装依赖
注意:pip 安装依赖的时候可能会遇到网络问题,建议配置代理
5. 安装 Gradio
到时候我们会通过 Gradio 的界面跟 janus 进行交互
6. 使用 janus pro 1B 模型
janus pro 默认启动的时候使用的是 7B 参数的模型,本地电脑跑起来的话太卡了。这里我们会修改成使用 1B 模型,这样的话大概 8G 的显存也能勉强跑一跑,7B 的话对显存的要求会更高。
找到我们克隆下来的仓库。使用编辑器打开 demo/把第 15 行改成:
7. 启动 Janus Pro
注意:启动期间会从 huggingface 拉取 1B 模型,大小大概 4G,所以还是需要指定代理。启动成功后如下图:

8. 使用 Gradio 界面进行交互
启动成功后在浏览器里输入: http://127.0.0.1:7860 即可访问 Gradio 页面。

9. 图片理解
先来试试 janus pro 对图片的理解。

这个解释到位的有点吓人。
10. 文生图
再来试试文字生成图片
prompt:

图片是我从 Hugging Face 直接运行得到的。在我本地运行了 30 分钟都没出结果,我直接 ctrl-c 取消了。可能是我的显卡太垃圾了(RTX4060 Mobile)。
总结
以上我们在本地 windows 上成功部署了 DeepSeek janus pro 模型。按照以上 step by step 的方式也没什么难度。通过测试 janus pro 对图片的理解非常到位。但是文生图的测试失败了,可能是我的显卡太垃圾,如果有同学有 4090 这种显卡可以试一试本地文生图的性能。
文章转载自:Agile.Zhou
原文链接:https://www.cnblogs.com/kklldog/p/18706887/deepseek-januspro-local
评论