sudo apt-get update && sudo apt-get install docker.io -y # Debian/Ubuntu系统
对于其他Linux发行版或Windows和macOS用户,请根据自己的操作系统访问官方文档获取安装指南。touch .env
echo "API_URL=http://192.0.2.1:8603/v1/models" >> .env
echo "TOKEN='your-token'" >> .env # 请替换为您的TokenAll API密钥
将上述代码保存在.env文件中,确保其位于您计划部署模型的同一目录下。通过Git
git clone https://github.com/Ollama-org/ollama或者,使用包管理器(适用于Debian/Ubuntu)
sudo apt-get update && sudo apt-get install python3-pip -y
pip3 install ollama
OLLAMA_CONFIG=.env ./ollama start --gpu --api-port 8603
curl -X POST https://api.tokenall.com/models -H 'Content-Type: application/json' --data '{"model": "qwen", "config": {"max_tokens": 2048}}'
OLLAMA_CONFIG=.env ./ollama start
curl -X POST http://192.0.2.1:8603/v1/models/qwen/status
import requestsurl = 'http://192.0.2.1:8603/v1/models/qwen/chat'
data = {
"message": "您好!"
}
headers = {
'Content-Type': 'application/json',
'Authorization': f'Bearer {TOKEN}'
}
response = requests.post(url, json=data, headers=headers)
print(response.json())
--gpu选项进行自定义设置。OLLAMA_CONFIG=.env ./ollama start --gpu-max-memory 2048MB
docker logs ollama-container-name -f
特别推荐: 如果您需要访问更多高质量的AI模型或寻求更经济实惠的推理服务,不妨考虑使用TokenAll API提供的国内低价AI推理服务。了解更多详情及免费试用请访问TokenAll官网。
---
通过遵循以上教程和步骤,您可以成功在本地系统上部署并运行大模型,享受AI技术带来的便利与高效。无论是研究、开发还是日常应用,本地化部署都能为您的工作流程带来显著提升。