El año pasado tuvimos una conversación con una startup de inferencia de IA en Singapur que ilustra perfectamente por qué existen SSD personalizados para aplicaciones de alto rendimiento.. Estaban utilizando unidades NVMe de consumo de primer nivel, del tipo que obtiene puntos de referencia y reseñas de YouTube, en sus servidores de inferencia perimetrales.. Los propulsores alcanzan cifras impresionantes en pruebas sintéticas. Pero bajo su carga de trabajo real (lecturas aleatorias mixtas que alimentan los modelos de aprendizaje automático con resultados de registro de escrituras en ráfaga), el rendimiento fue inconsistente. Los picos de latencia durante las ventanas de recolección de basura provocaban tiempos de espera de inferencia. Los discos no eran lentos. eran impredecibles. Y para aplicaciones de alto rendimiento, Impredecible es peor que lento.. Les creamos una configuración NVMe personalizada con programación determinista de recolección de basura y firmware optimizado para QoS.. Su latencia P99 disminuyó 60%. Misma NAND, misma plataforma de controlador, comportamiento fundamentalmente diferente en el mundo real.

Las aplicaciones de alto rendimiento exigen más que hardware rápido: exigen información predecible., comportamiento de almacenamiento consistente bajo cargas de trabajo reales.
Conclusiones clave
- Las aplicaciones de alto rendimiento necesitan un rendimiento constante bajo cargas de trabajo reales, no sólo números máximos en puntos de referencia sintéticos.
- Ajuste personalizado del firmware NVMe: programación de recolección de basura, prioridad de calidad de servicio, Gestión del búfer de escritura: ofrece mejoras de latencia mensurables.
- La selección de NAND y el sobreaprovisionamiento impactan directamente el rendimiento de escritura sostenido y la resistencia bajo cargas de trabajo pesadas..
- Las unidades PCIe Gen4 NVMe ofrecen hasta 7,400 Rendimiento secuencial de MB/s, pero lograrlo de manera constante requiere firmware que coincida con su patrón de E/S.
- La validación específica de la aplicación en su hardware real no es negociable: las especificaciones describen el potencial, las pruebas prueban la realidad.
Tabla de contenido
- La brecha de rendimiento de la que nadie habla
- Nvme: La Fundación del Rendimiento
- Por qué el firmware es más importante que las especificaciones
- Selección NAND para rendimiento sostenido
- Casos de uso de alto rendimiento que hemos resuelto
- Pruebas que demuestran el rendimiento
- Preguntas frecuentes
- Diseñado para el rendimiento, No sólo comercializado
La brecha de rendimiento de la que nadie habla
Abra cualquier página de producto SSD y verá números como “7,400 Lectura secuencial de MB/s” o “1,000,000 IOPS.” Impresionante. Pero esos números tienen asteriscos., y los asteriscos importan.
Las velocidades de lectura secuencial se miden en unidades vacías con profundidades de cola ideales. Las cifras de IOPS provienen de cargas de trabajo sintéticas diseñadas para alcanzar el máximo rendimiento. Las aplicaciones reales no funcionan así. Mezclan lecturas y escrituras., fragmentan los datos con el tiempo, no mantienen profundidades de cola perfectas, y se ejecutan en sistemas donde el SSD compite con otras E/S por el ancho de banda PCIe.
La brecha entre el rendimiento de la hoja de especificaciones y el rendimiento sostenido en el mundo real puede ser del 30% al 50% en unidades estándar. Para aplicaciones de alto rendimiento: cargas de trabajo del centro de datos, canales de producción de vídeo, Entrenamiento de IA/ML, comercio de alta frecuencia, análisis en tiempo real: esa brecha es la diferencia entre un sistema que funciona y uno que no cumple con los SLA.
Los SSD personalizados cierran esa brecha. No usando hardware mágico, pero alineando todos los parámetros ajustables: comportamiento del firmware, Configuración NAND, sobreaprovisionamiento, estrategia de almacenamiento en caché: con su carga de trabajo específica. Es la diferencia entre un traje estándar y uno hecho a medida. Misma tela, ajuste dramáticamente diferente.
Nvme: La Fundación del Rendimiento
Si está optimizando el rendimiento, NVMe sobre PCIe es el único punto de partida serio. SATA alcanzó su punto máximo hace años a ~550 MB/s. NVMe elimina ese techo.
Nuestro Unidades NVMe Gen4 x4 proporcionar hasta 7,400 Lectura secuencial de MB/s y 6,500 Escritura secuencial MB/s. Cuatro carriles PCIe a velocidades Gen4 le brindan un ancho de banda teórico de ~8 GB/s, y nuestras unidades se acercan notablemente a ese máximo teórico bajo cargas de trabajo secuenciales..
Pero el ancho de banda NVMe bruto es solo la base. Lo que importa para las aplicaciones de alto rendimiento es qué sucede con ese ancho de banda cuando:
- El disco es 80% lleno y fragmentado
- Las E/S aleatorias y secuenciales se mezclan simultáneamente
- La NAND necesita recolección de basura mientras usted necesita escrituras
- Las condiciones térmicas empujan al controlador hacia la aceleración.
- Múltiples procesos compiten por la E/S de la unidad
El firmware estándar maneja estas condiciones con algoritmos genéricos diseñados para ser “suficientemente bueno” para la mayoría de los usuarios. El firmware personalizado los maneja con algoritmos ajustados para su escenario específico. La diferencia en el rendimiento sostenido es sustancial.
Por qué el firmware es más importante que las especificaciones
Lo hemos dicho antes y lo seguiremos diciendo.: El firmware es el cerebro del SSD.. Dos unidades con NAND y controladores idénticos pueden funcionar de manera completamente diferente según el ajuste del firmware. Esto es lo que personalizamos para aplicaciones de alto rendimiento:
Gestión del búfer de escritura. Los SSD utilizan el almacenamiento en caché en modo SLC para absorber escrituras en ráfaga a máxima velocidad. Cuando el caché se llena, el rendimiento cae, a veces dramáticamente, mientras los datos se pliegan de SLC a TLC/MLC. Dimensionamos la caché SLC y configuramos el comportamiento de plegado según sus características de ráfaga de escritura.. Si su aplicación escribe ráfagas de 2 GB con intervalos de 30 segundos, el caché y el cronograma de plegado se ven completamente diferentes que para el modo continuo 500 Escrituras sostenidas en MB/s.
Programación de recolección de basura.. GC recupera bloques con datos no válidos para dejar espacio para nuevas escrituras. Los algoritmos predeterminados activan GC de forma reactiva, cuando el espacio libre se agota. Para cuando eso suceda, el rendimiento de escritura ya está degradado. Para aplicaciones de alto rendimiento, Implementamos GC proactivo durante períodos de inactividad conocidos o a velocidades controladas que evitan que el espacio libre alcance umbrales críticos..
Prioridad de E/S y QoS. No todas las E/S son iguales. En una carga de trabajo mixta, las lecturas que atienden las solicitudes de los usuarios pueden ser más sensibles a la latencia que las escrituras en segundo plano y los datos de registro. Podemos configurar clases de prioridad de E/S en el firmware., Garantizar que las operaciones críticas para la latencia reciban un trato preferencial..

Nuestra plataforma NVMe comercial: la base para configuraciones personalizadas de alto rendimiento.
Lectura anticipada y captación previa. Las aplicaciones de lectura secuencial se benefician de una captación previa agresiva: el firmware predice qué datos necesitará a continuación y los recupera antes de que usted los solicite.. Las cargas de trabajo aleatorias necesitan esa característica desactivada porque las precargas mal predichas desperdician ancho de banda. Adaptamos la estrategia de captación previa a su patrón de acceso.
Selección NAND para rendimiento sostenido
Debajo del firmware, La selección de NAND impacta directamente las características de rendimiento sostenido.
MLC-NAND Programa y lee más rápido que TLC a nivel físico: menos estados de voltaje significan una programación más rápida y lecturas más confiables.. Para aplicaciones de alto rendimiento con uso intensivo de escritura, MLC proporciona velocidades de escritura sostenidas inherentemente más consistentes.
Pero MLC cuesta más por gigabyte. Entonces, la elección correcta depende de si su cuello de botella es el rendimiento de escritura. (MLC gana) o capacidad por dólar (TLC gana, especialmente con una buena optimización del firmware). Hemos creado configuraciones personalizadas de alto rendimiento en ambos, dependiendo de las compensaciones específicas que cada cliente necesitaba.
El exceso de aprovisionamiento también juega un papel fundamental. Más OP significa más bloques de repuesto para la recolección de basura, lo que significa que el controlador tiene más espacio para gestionar escrituras sin degradación del rendimiento. Las unidades estándar asignan entre un 7% y un 12% de OP. Para aplicaciones de alto rendimiento, podemos configurar entre un 20% y un 28%: intercambiar capacidad utilizable por un rendimiento de escritura sostenido dramáticamente más consistente y por más tiempo. vida útil de la unidad.
Casos de uso de alto rendimiento que hemos resuelto
Producción y postprocesamiento de vídeo.. Una empresa de producción de medios del Reino Unido necesitaba unidades capaces de mantener 3 Escrituras en GB/s para ingesta de vídeo de 8K de transmisión múltiple. Las unidades NVMe de consumo alcanzaron esa velocidad inicialmente, pero cayeron a 1.5 GB/s después de llenar el caché SLC. Configuramos la asignación de caché SLC extendida y optimizamos el programa de plegado de TLC para su flujo de trabajo de ráfaga-pausa-ráfaga.. El rendimiento de escritura sostenida se mantuvo por encima 2.8 GB/s a través de sesiones completas.
Inferencia de IA de borde. Una plataforma de vehículo autónomo necesitaba una latencia de lectura extremadamente baja para la carga del modelo combinada con escrituras sostenidas desde el registro del sensor.. Estos son requisitos competitivos: IOPS de lectura aleatoria elevada y escrituras secuenciales sostenidas simultáneamente.. El firmware personalizado con priorización de clases de E/S proporcionó latencia garantizada a las lecturas mientras que las escrituras se administraban en segundo plano..
Sistemas de comercio financiero. Determinismo de microsegundo nivel. Los SSD estándar introducen una latencia impredecible durante las operaciones en segundo plano. Desactivamos todas las tareas en segundo plano no esenciales durante el horario de mercado y las programamos para períodos de mantenimiento fuera del horario de atención.. El resultado: La latencia de E/S en el peor de los casos se redujo de ~2 ms a menos de 200 μs durante las sesiones de negociación..
Clústeres informáticos de alto rendimiento. Un instituto de investigación que ejecutaba dinámica de fluidos computacional necesitaba un rendimiento de lectura paralelo en múltiples unidades. Optimizamos la configuración de la cola de envío de NVMe y la compatibilidad con múltiples espacios de nombres para su configuración RAID., mejorar el rendimiento de lectura agregado al 25% en comparación con las configuraciones de firmware predeterminadas.

Nuestro laboratorio de pruebas ejecuta cargas de trabajo específicas de la aplicación para validar el rendimiento antes de la producción..
Pruebas que demuestran el rendimiento
Para aplicaciones de alto rendimiento, no solo probamos, elaboramos perfiles. Antes de cerrar sesión en una configuración personalizada, ejecutamos su carga de trabajo real (o un equivalente sintético representativo) en el camino y mida las métricas que le importan. No sólo el rendimiento máximo, pero latencia P99, rendimiento sostenido durante horas, consistencia del desempeño (calidad de servicio), y comportamiento térmico bajo carga.
Proporcionamos informes de prueba detallados que muestran el rendimiento durante todo el ciclo de vida de la unidad, desde vacía hasta llena., incluidas las transiciones críticas donde la mayoría de las unidades muestran un rendimiento degradado. Si ha definido SLA o umbrales de rendimiento, validamos con esos números específicos.
Este enfoque de validación es la misma disciplina que aplicamos en toda nuestra gama de productos, desde unidades SATA a SSD industriales M.2. El marco de calidad es consistente; Los parámetros de prueba se personalizan según los requisitos de cada aplicación..
Preguntas frecuentes
¿Cuánta mejora de rendimiento puedo esperar de manera realista del firmware personalizado??
Depende en gran medida de la brecha entre su carga de trabajo y el objetivo de optimización del firmware predeterminado.. Hemos visto mejoras que van desde 15% (para cargas de trabajo razonablemente cercanas a las genéricas) a 60%+ (para patrones altamente específicos como el ejemplo de inferencia de IA). La mejor manera de saberlo es describir su carga de trabajo y dejarnos estimar, o mejor aún, prototipemos y midamos.
¿Necesito NVMe Gen4?, o Gen3 es suficiente para aplicaciones de alto rendimiento?
Gen3 NVMe alcanza su punto máximo 3,500 MB/s secuencial: más que suficiente para muchos “alto rendimiento” aplicaciones. Gen4 duplica ese techo. Si su carga de trabajo está limitada por IOPS (E/S aleatoria) en lugar de rendimiento limitado (secuencial), Gen3 y Gen4 funcionan de manera muy similar. Si estás realizando grandes transferencias secuenciales, Gen4 marca una verdadera diferencia. Contamos con ambos y le ayudamos a decidir en función del análisis de requisitos reales., no presión de marketing. Nuestro Guía de selección de SSD cubre los fundamentos.
¿Pueden los SSD personalizados coincidir con las unidades de clase empresarial de las principales marcas??
Para la mayoría de las optimizaciones específicas de cargas de trabajo, sí, a menudo a un costo significativamente menor. Unidades empresariales de Samsung, Intel, o Kioxia están diseñados para manejar cualquier carga de trabajo posible razonablemente bien. Nuestras unidades personalizadas están diseñadas para manejar excepcionalmente bien su carga de trabajo específica.. Si necesita una amplia versatilidad en cargas de trabajo desconocidas, Los generalistas empresariales tienen sentido.. Si conoces tu carga de trabajo, La personalización gana tanto en rendimiento como en precio.. El caso de inversión es convincente.
Diseñado para el rendimiento, No sólo comercializado
El almacenamiento de alto rendimiento no se trata del número más grande en una caja. Se trata de coherencia, Rendimiento confiable bajo las condiciones específicas que crea su aplicación.. Eso es lo que ofrecen las soluciones SSD personalizadas, y es lo que nuestro proceso de fabricación está construido para producir. Listo para cerrar la brecha entre el rendimiento de la hoja de especificaciones y sus requisitos del mundo real? Comience con nuestra gama de productos, entonces póngase en contacto con nuestro equipo de ingeniería con los detalles de tu carga de trabajo. Volveremos con una propuesta concreta, generalmente dentro de 48 horas.

Shenzhen, China · Este. 2014
Somos ingenieros de SSD que se especializan en la optimización del rendimiento, desde el ajuste del firmware y la selección de NAND hasta la validación de aplicaciones específicas.. Nuestras soluciones SSD personalizadas sirven aplicaciones de alto rendimiento en 80+ países. Cuéntenos sobre su desafío de desempeño.

