【通义千问】大模型Qwen GitHub开源工程学习笔记（2）--使用Qwen进行推理的示例代码解析，及transformers的使用

大表哥汽车人

已于 2024-01-14 14:44:12 修改

阅读量3.3k

点赞数 1

CC 4.0 BY-SA版权

分类专栏：人工智能、大语言模型学习笔记文章标签：学习笔记人工智能语言模型深度学习

于 2023-09-29 00:09:03 首次发布

本文链接：https://blog.csdn.net/weixin_46481662/article/details/133394354

人工智能、大语言模型学习笔记专栏收录该内容

30 篇文章 ¥19.90 ¥99.00

订阅专栏

超级会员免费看

本文介绍了如何使用Transformers库加载和运行预训练的大规模语言模型Qwen，包括从预训练模型加载分词器、设置生成配置、处理超时问题、精度匹配以及使用本地模型文件。在实践中，遇到网络超时和库版本问题，通过降低urllib3版本解决了下载问题。此外，探讨了模型的精度选项，如BF16和FP16，以及如何利用本地已下载的权重文件避免重复下载。最后，分析了模型的返回信息，包括警告、依赖导入失败以及模型加载过程。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

使用Transformers来使用模型

如希望使用Qwen-chat进行推理，所需要写的只是如下所示的数行代码。请确保你使用的是最新代码，并指定正确的模型名称和路径，如Qwen/Qwen-7B-Chat和Qwen/Qwen-14B-Chat

这里给出了一段代码

from transformers import AutoModelForCausalLM, AutoTokenizer
from transformers.generation import GenerationConfig

# 可选的模型包括: "Qwen/Qwen-7B-Chat", "Qwen/Qwen-14B-Chat"
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen-7B-Chat", trust_remote_code=True)

# 打开bf16精度，A100、H100、RTX3060、RTX3070等显卡建议启用以节省显存
# model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen-7B-Chat", device_map="auto", trust_remote