TensorRT-LLMs

mirror of https://github.com/NVIDIA/TensorRT-LLM.git synced 2026-01-14 06:27:45 +08:00

History

Zongfei Jing c7548ad72c perf: Add optimizations for deepseek in min latency mode (#3093 ) * Add optimizations for deepseek min latency Signed-off-by: Zongfei Jing <20381269+zongfeijing@users.noreply.github.com> * Fix compile error Signed-off-by: Zongfei Jing <20381269+zongfeijing@users.noreply.github.com> * Update internal cutlass kernel libs Signed-off-by: Zongfei Jing <20381269+zongfeijing@users.noreply.github.com> * Format code Signed-off-by: Zongfei Jing <20381269+zongfeijing@users.noreply.github.com> * Resolve conflicts Signed-off-by: Zongfei Jing <20381269+zongfeijing@users.noreply.github.com> --------- Signed-off-by: Zongfei Jing <20381269+zongfeijing@users.noreply.github.com>		2025-04-02 09:05:24 +08:00
..
allReduce	perf: Add optimizations for deepseek in min latency mode (#3093 )	2025-04-02 09:05:24 +08:00
cudaCoreGemm	Update TensorRT-LLM (#2755 )	2025-02-11 03:01:00 +00:00
fused_gated_gemm	Update TensorRT-LLM (#2755 )	2025-02-11 03:01:00 +00:00
sampling	Update TensorRT-LLM (#2873 )	2025-03-11 21:13:42 +08:00
smoothQuant	Update TensorRT-LLM (#2755 )	2025-02-11 03:01:00 +00:00
weightOnly	Update TensorRT-LLM (#2755 )	2025-02-11 03:01:00 +00:00
banRepeatNGramsKernelsTest.cpp	Update TensorRT-LLM (#2755 )	2025-02-11 03:01:00 +00:00
CMakeLists.txt	Update (#2978 )	2025-03-23 16:39:35 +08:00
decodingKernelTest.cpp	refactor: Improve decoder finalize function (#3077 )	2025-03-28 14:33:59 +08:00
logitsBitmaskTest.cpp	Update TensorRT-LLM (#2755 )	2025-02-11 03:01:00 +00:00
mixtureOfExpertsTest.cu	perf: Add optimizations for deepseek in min latency mode (#3093 )	2025-04-02 09:05:24 +08:00
ropeTest.cu	Update TensorRT-LLM (#2873 )	2025-03-11 21:13:42 +08:00
shiftKCacheKernelTest.cu	Update TensorRT-LLM (#2755 )	2025-02-11 03:01:00 +00:00
stopCriteriaKernelsTest.cpp	Update TensorRT-LLM (#2755 )	2025-02-11 03:01:00 +00:00