Когда вокруг LLM говорят о производительности, разговор почти всегда уходит в модели и ускорители. Сколько параметров, сколько HBM, сколько GPU в стойке, какой interconnect между чипами. Это важные вопросы, но...
inference
775
35
Архитектура и назначение платформы Context Memory Storage NVIDIA Inference Context Memory Storage Platform – это новая архитектура хранения данных, специально разработанная для ускорения инференса крупных моделей за счет эффективной работы...
775
35