TensorRT-LLMs

mirror of https://github.com/NVIDIA/TensorRT-LLM.git synced 2026-01-14 06:27:45 +08:00

History

Lucas Liebenwein dcfd3ef81c [#4593 ][feat] AutoDeploy: Linear Attention Support (SSM + causal_conv + Bamba + Nemotron-H) (#8068 ) Signed-off-by: William Zhang <133824995+2ez4bz@users.noreply.github.com> Signed-off-by: Lucas Liebenwein <11156568+lucaslie@users.noreply.github.com> Signed-off-by: Chenghao Zhang <211069071+nvchenghaoz@users.noreply.github.com> Signed-off-by: Frida Hou <201670829+Fridah-nv@users.noreply.github.com> Signed-off-by: Suyog Gupta <41447211+suyoggupta@users.noreply.github.com> Co-authored-by: William Zhang <133824995+2ez4bz@users.noreply.github.com> Co-authored-by: Chenghao Zhang <211069071+nvchenghaoz@users.noreply.github.com> Co-authored-by: Frida Hou <201670829+Fridah-nv@users.noreply.github.com> Co-authored-by: Suyog Gupta <41447211+suyoggupta@users.noreply.github.com>		2025-09-29 22:41:06 -04:00
..
__init__.py	Update TensorRT-LLM (#613 )	2023-12-08 17:49:24 +08:00
bench.py	Update TensorRT-LLM (#2849 )	2025-03-04 18:44:00 +08:00
build.py	[None][chroe] Rename TensorRT-LLM to TensorRT LLM for source code. (#7851 )	2025-09-25 21:02:35 +08:00
eval.py	[None][fix] refine `backend` option handling for commands (#7829 )	2025-09-24 10:54:33 +08:00
prune.py	Update TensorRT-LLM (#2008 )	2024-07-23 23:05:09 +08:00
refit.py	Update TensorRT-LLM (#2532 )	2024-12-04 21:16:56 +08:00
serve.py	[#4593 ][feat] AutoDeploy: Linear Attention Support (SSM + causal_conv + Bamba + Nemotron-H) (#8068 )	2025-09-29 22:41:06 -04:00