=========== embedding =========== docker run -d --gpus all \ --name tei-embedding \ -p 16001:80 \ -v /DATA/exlink/models:/data \ --pull never \ --restart always \ ghcr.io/huggingface/text-embeddings-inference:hopper-1.8 \ --model-id /data/qwen3-embedding-8b \ --port 80 \ --max-batch-tokens 40960 curl 127.0.0.1:16001/embed \ -X POST \ -d '{"inputs":"안녕하세요, 임베딩 테스트 중입니다."}' \ -H 'Content-Type: application/json' =========== embedding =========== =========== reranker =========== docker rm -f vllm-reranker docker rm -f vllm-reranker docker run -d --gpus all \ --name vllm-reranker \ -p 16002:8000 \ -v /DATA/exlink/models:/data \ --ipc=host \ --restart always \ -e HF_HUB_OFFLINE=1 \ -e TRANSFORMERS_OFFLINE=1 \ vllm/vllm-openai:latest \ python3 /data/reranker_server.py curl http://127.0.0.1:16002/v1/rerank \ -X POST \ -H "Content-Type: application/json" \ -d '{ "model": "/data/qwen3-reranker-4b", "query": "사과는 어떤 과일인가요?", "documents": [ "사과는 빨간색 과일이며 비타민이 풍부합니다.", "서울은 대한민국의 수도입니다." ] }' =========== reranker =========== =========== LLM =========== docker run -d --gpus all \ --name vllm-server \ --memory 32g \ -p 16000:8000 \ -v /DATA/exlink/models:/data \ --ipc=host \ --restart always \ --network bridge \ -e HF_HUB_OFFLINE=1 \ -e HF_HOME=/data/cache \ -e TRANSFORMERS_OFFLINE=1 \ --entrypoint python3 \ vllm/vllm-openai:latest \ -m vllm.entrypoints.openai.api_server \ --model /data/Qwen3.5-27B-FP8 \ --host 0.0.0.0 \ --port 8000 \ --gpu-memory-utilization 0.65 \ --max-model-len 5120 \ --max-num-seqs 8 \ --enable-chunked-prefill \ --max-num-batched-tokens 4096 \ =========== LLM ===========