Mostrando entradas con la etiqueta experiencias. Mostrar todas las entradas
Mostrando entradas con la etiqueta experiencias. Mostrar todas las entradas

jueves, 2 de febrero de 2017

AMD Bulldozer: HotChips23 – LowLevelHardware

Estos días se está celebrando el HotChips 23, una de las convenciones anuales donde se discuten los nuevos diseños de procesadores de sobremesa, servidores, memorias, procesadores de bajo consumo para dispositivos móviles… todo lo relacionado con el mundo del silicio en 2011.

Y claro está, también ha habido alguna nueva información sobre Bulldozer y mucha viejas ideas “refritas” sobre este nuevo core. Lamentablemente, ninguna estimación prestacional, puro silicon para entendidos en la materia.

AMD ha entrado en detalle en algunos aspectos del diseño del chip Zambezi (4 módulos y 8 INT cores) fabricado por Global Foundries en 32 nm SOI HKMG.

Nuevas fotografías del die de Bulldozer

En este slide de la presentación en HotChips vemos una nueva toma del die de Bulldozer.

640_1

Aparece con mayor altura que en anteriores vistas, si comparáis con anteriores artículos míos veréis claramente la diferencia. No hay modo de saber cual es la correcta, si esta o las antiguas (más alargadas), hasta que haya samples comerciales.

Ampliación del die:

640_2

Lo que me llama poderosamente la atención es la grandísima cantidad de espacio desaprovechado: No utilizado ni por cores (lógica) ni cachés ni por las controladoras de memoria y buses Hyper Transport 3.

En varios de mis numerosos artículos sobre Intel Sandy Bridge, mencioné el enrutado de todo el cableado del Ring Bus bajo la caché L3. Todo este esfuerzo de ingeniería se realizó para ahorrar espacio de die y reducir el tamaño de Sandy Bridge. Cito textualmente (Extraído de Microarquitectura Intel Sandy Bridge. Parte 1. Actualizado – LowLevelHardware. Martes 14 de septiembre de 2010):

“ Lo más llamativo del bus en anillo de Sandy Bridge (y Nehalem EX) es su implementación respetuosa con el consumo y el área de die, me explico:

Todos recordamos el famoso procesador Radeon HD 2900 de ATI con un ring bus de 512 bits, que debido a su desmesurada disipación térmica y consumo no pudo competir con sus análogos de nVidia hasta que ATI lo eliminó sustituyéndolo por una arquitectura convencional en su serie Radeon HD 3800.

En Sandy Bridge Intel ha utilizado power gating y clock gating extensivamente, además de aplicar un voltaje bajísimo al ring bus para conseguir una disipación térmica muy baja.

Por otro lado, es un dato muy importante, según los ingenieros de Intel, no ha representado un incremento de área ya que la infinidad de conductores necesarios para el Ring Bus se enrutan por otras capas del diseño bajo la caché L3. “

AMD simplemente no dispone de los extensos recursos económicos y humanos de Intel y no puede permitirse el lujo de este tipo de optimizaciones, bastante tiene con llevar a cabo el diseño de un semiconductor de tal complejidad como Bulldozer.

El espacio “muerto” lo he coloreado en GRIS, son muchos, muchos mm2:

640_2B

Superficie del die de AMD Bulldozer

Por fin conocemos el verdadero tamaño de Bulldozer y debo decir que estoy algo decepcionado: nada menos que 315 mm2… muy caro de producir.

Bulldozer_Die_size

Estoy convencido de que AMD sin duda optimizará este diseño en sucesivas iteraciones (con el paso a 22 nm en un par de años) e incluso antes con el lanzamiento de la versión de 5 módulos y 20 cores producida también en 32 nm.

Infraestructura de AMD Zambezi. AM3+

640_3

Como vemos la versión de sobremesa de Bulldozer solo activa uno de los 4 enlaces HT3 para comunicación con el chipset (los demás permanecen deshabilitados, en su versión Opteron se utilizan como conexión directa con hasta tres chips más).

La latencia L3 se me antoja como he comentado en numerosas ocasiones muy alta, creo firmemente que rondará los 50+ ciclos.

640_4

Ni rastro de las extrañas AGLU, ahora las llaman AGen, es decir una normal y corriente AGU. Además solamente hay dos pipes de enteros (INT pipes) una con circuitería MUL y la otra según AMD con un divisor por hardware (DIV). Viendo las latencias de división entera de Bulldozer me da la impresión de que tal divisor no existe y la división se ejecuta por micro código o tiene un diseño extremadamente simplificado y poco efectivo.

AMD Turbo Core en Bulldozer

En Bulldozer, AMD presenta un Turbo Core de dos niveles.

640_5

All Core Boost: Todos los módulos (conjuntos de dos cores con su SIMD FPU Unit y los 2 MB de L2) aumentan su frecuencia por encima de la nominal si el TDP y la temperatura lo permite.

Se da en cargas de trabajo que implique a TODOS los cores, sea con carga parcial elevada o máxima 100%.

Max Turbo Boost: Si dos de los módulos (cuatro INT cores, dos SIMD FPUs y dos L2 de 2 MB) se hallan en estado Sleep C6 (power gated) el resto (los otros dos módulos) pueden incrementar su frecuencia hasta en 1 GHz sobre la nominal.

Esto conlleva algunas consideraciones prestacionales extrañas y fastidiosas que detallaré cuando tenga hardware funcional comercial en las manos. A ver si en un mes y algo…

En múltiples artículos he analizado en detalle el diseño interno de BD 32 nm. Cito los más destacables:

AMD Bulldozer. Perspectivas – LowLevelHardware

La L3 cache multibanco en AMD Bulldozer. Actualizado – LowLevelHardware

AMD AGLUs, Bulldozer INT cores. Actualizado – LowLevelHardware

AMD Bulldozer. Primeros benchmarks. Actualizado – LowLevelHardware

AMD Bulldozer – ProfessionalSAT

La micro arquitectura de AMD Bulldozer. Actualizado – LowLevelHardware

Novedades y expectativas 2010. Actualizado – LowLevelHardware

AMD Bulldozer. Prestaciones estimadas – LowLevelHardware

Micro arquitectura AMD Bulldozer 2011. Actualizado – LowLevelHardware

Previo AMD Bulldozer. Actualizado – LowLevelHardware

Conclusiones

Poco se puede concluir hasta que no haya datos objetivos de steppings finales. Los actuales samples de Bulldozer son realmente lentos debido a numerosos bugs en los primeros steppings A y B1 que han hecho necesario deshabilitar características clave de las controladoras de memoria, cachés, TLBs, etc.

Queda ver como será Bulldozer con todos sus subsistemas a punto y cuales son las frecuencias finales comerciales. Sin duda estas no serán indicativas del verdadero potencial final en frecuencia de Bulldozer en 32 nm; AMD mejora sus procesos paso a paso a lo largo del tiempo en que este está en el mercado.

La historia fue realmente brillante en 90 nm cuando culminó en unos excelentes 3.2 GHz con el Athlon 64 X2 6400+ partiendo de los iniciales 1.8 GHz.

En el proceso de 65 nm SOI la historia fue diferente y empezó realmente mal. Los primeros Athlon 64 X2 eran claramente más lentos por ciclo (IPC) que los anteriores de 90 nm y les era imposible llegar a los 3 GHz. Con el tiempo llegaron a 3.1 GHz, un mal resultado e inferior al anterior de 90 nm SOI.

En aquel tiempo AMD lanzó Barcelona (Phenom) quad core también en 65 nm con unas frecuencias decepcionantes de 2.3 GHz en pico y una ridículamente pequeña caché L3 de 2 MB y elevada latencia. Con los meses llegó a 2.6 GHz y por fin llegaron los 45 nm.

Los 45 nm para AMD han sido un éxito rotundo, los Phenom II Shanghai subieron rápidamente de frecuencia y el incremento a 6M de la caché L3 le permitió ganar prestaciones por ciclo (IPC) respecto a Barcelona. A esto se añadió la excelente versión de 6 cores con Turbo Core, el Phenom II X6, también con 6 MB de L3.

Gracias al exitoso proceso de 45 nm AMD ha podido sobrevivir con un anticuado diseño de CPU que data de 2003, (remozado en 2007 con Barcelona, aunque igual en la parte de enteros) y esto lo escribo en Agosto de 2011…

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

Novedades y expectativas 2010. Actualizado – LowLevelHardware

Estamos en una época de transición, tanto AMD como Intel presentan en breve novedades importantes que incluyen reformas microarquitecturales profundas.

GloFo32nm El proceso de 32 nm va a traer muchas novedades al portafolio de CPUs de AMD.

Ya he escrito varios artículos sobre los nuevos Intel Sandy Bridge 32 nm:

y sobre los esperadísimos AMD Bulldozer de 32 nm:

Roadmap de AMD para 2011.Roadmap de AMD 2010. Ontario 32 nm.

AMD_CPU_roadmap_2010Roadmap de AMD para 2011.

AMD tiene previsto para finales de este año (Q4 2010) su nuevo procesador Ontario. Un dual core con GPU DX11 integrada. Los cores de Ontario son los nuevos Bobcat de los que hablé en un pasado artículo.

AMD_Notebook_Roadmap_2010_1[1] Ontario formará parte de la plataforma Brazos.

Si el proceso de 32nm SOI de Global Foundries evoluciona según lo esperado será el primer procesador fabricado en este nuevo nodo por AMD.

amd_bobcat_coreAMD Bobcat core. En Ontario habrá dos de ellos además de una GPU DX11 integrada.

AMD posiciona a Bobcat como competidor de los anémicos cores de los procesadores Intel Atom. Según AMD sus prestaciones serán netamente superiores.

Contará con dos pipelines de enteros y una unidad FPU simplificada con dos pipelines. Su TDP por core irá desde  algo menos de 1 W hasta los 10 W en función de las frecuencias y voltajes aplicados.

AMD_fusionAMD Fusion, su primer representante de 32 nm será Ontario.

En mi opinión serán cores capaces de mover Windows 7 con cierta alegría y gracias a la presencia de la GPU integrada DX11 (basada en la arquitectura ATI Radeon HD 5000) espero prestaciones decorosas en video HD y juegos. Todo ello con un consumo que permitirá su integración en netbooks de gama alta.

Llano 32 nm, retrasado a principios de 2011.

El segundo procesador de AMD para 2010 y fabricado igualmente en 32 nm por GloFo iba a ser Llano según los roadmaps de AMD. Desafortunadamente y debido a retrasos en su diseño ha sido pospuesto a principios de 2011. Será la CPU destinada a sustituir los Phenom II X2 y X4 de 45 nm.

AMD_Desktop_Roadmap_2010_20 La plataforma Lynx contará con procesadores Llano.

Será un procesador con GPU integrada (también DX11) más potente que la de Bobcat (se rumorean 400 – 480 SPs) y dos o cuatro cores derivados de los que encontramos actualmente en los Phenom II.

AMD_Llano_coreDie de uno de los cores de Llano 40 nm.

Cada core contará con 1 MB de L2 privada, no habrá caché L3 compartida y las controladoras de memoria (2 canales de DDR3) darán servicio a los 4 cores y a la GPU.

AMD_K10.6_32nm Otra vista de uno de los cores de Ontario.

Los cores presentan numerosas mejoras respecto a los conocidos K10.5 de Phenom II, en el análisis del  die ya se aprecian bastantes reformas destinadas a mejorar el rendimiento en enteros y en FPU.

LlanoPowegate[1] Mejoras en los cores de Llano.

  • La ventana de instrucciones ha aumentado de 72 a 84 entradas (desde los K10.5).Es utilizada por el hardware OOO (Out of Order Execution) para extraer paralelismo y ejecutar en el orden óptimo el stream de instrucciones con la máxima ocupación de las unidades de proceso.
  • Se ha dotado a la unidad de enteros de hardware para la división.
  • Se ha reducido la latencia de las instrucciones de coma flotante FPU.
  • Se ha mejorado el prefetch de datos para aumentar las tasas de aciertos de las cachés L1 y L2.
  • Se ha reducido las latencias de transición entre los estados de caché y ha aumentado la velocidad escritura en memoria.
  • Como en todo procesador actual se ha trabajado duramente en reducir su consumo, ampliando el clock gating y dotándolo de core gating.

AMD_Lano_cut Fotografía parcial del die de AMD Ontario 32 nm.

Se observan los cuatro cores cada uno con 1 MB de L2 y abajo la GPU integrada, la fotografía está cortada por su parte inferior.

Llano32nm AMD Llano 32 nm.

Aunque a mi modo de ver, si AMD diseña Llano con un número de SPs elevado (más de 320) estará claramente limitado por su ancho de banda de memoria (2 canales DDR3 1333 para gráficos es poca cosa…)

Veremos cono se plasma todo en los diseños definitivos, a mediados de Agosto AMD desvela la microarquitectura detrás de Bulldozer, os mantendré informados.

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

AMD Bulldozer. Prestaciones estimadas - LowLevelHardware

En el tercero de esta serie de artículos dedicados a la próxima micro arquitectura de AMD voy a aventurar mis previsiones sobre su nivel prestacional. Además lo compararé con los diseños actuales y con su muy evolucionado y perfeccionado futuro competidor, Intel Sandy Bridge.

Bulldozer_server AMD Bulldozer, la próxima micro arquitectura.

Bulldozer module, el módulo Bulldozer:

BulldozerModuleAMD Bulldozer module.

AMD llama módulo al conjunto siguiente:

  • Las etapas de Fetching
  • La circuitería de Decodificación X64
  • Los tres Schedulers independientes
  • Las cachés L1i
  • Los 2 cores de enteros compuestos de 2 ALUs y 2 AGUs
  • Una doble FPU con capacidad FMAC de 128 bit
  • Las cachés L1d
  • La L2 compartida para todas las unidades funcionales dentro del módulo

Este concepto se contrapone a la actual acepción de core. En los actuales diseños entendemos como core al conjunto del procesador excluyendo las interfaces externas, el North Bridge y en todo caso la caché L3 compartida (de haberla).

AMD nos obliga a cambiar el concepto para subrayar que cada módulo contiene dos cores funcionales e independientes de proceso de enteros.

Prestaciones por ciclo esperadas

A estas alturas tengo absolutamente claro que el tamaño en mm2 de la parte lógica (excluyendo L2 e interfaces) de Bulldozer será notable, claramente superior a sus actuales cores K10.5.

AMD ha comunicado que su núcleo K10 fabricado en 32 nm SOI HKMG por GloFo ocupa solamente 9.69 mm2 para 35 M Transistores, 17.7 mm2 incluyendo 1 MB de L2 (110 MT).

AMD_K10_32nm AMD K10 32 nm core 1 MB L2.

Estimo que el área lógica (ALUs + FPU) de Bulldozer se irá a la zona de los 20 mm2 en 32 nm, el doble que K10 32 nm y más área de die que los actuales cores K10.5 de 45 nm de Phenom II (unos 17 mm2).

K10.5_45nm_1MBAMD K10.5 45 nm 1 MB de L2.

Prestaciones en coma flotante (FPU)

Donde habrá un gran incremento en número de transistores será en la gran FPU doble de 128 bit con capacidad FMAC.

La actual implementación en K10.5 de 45 nm (Phenom II) comprende 3 pipelines de coma flotante especializados de 128 bit:

  • FMUL
  • FADD
  • FMISC

Esta limitación reduce su capacidad de proceso FPU puesto que cada unidad procesa un tipo de instrucciones y cada tipo de instrucción debe ir a su unidad y no otra.

En Bulldozer ambos pipelines son generales (ejecutan cualquier instrucción FPU) y simétricos y por ello resulta una arquitectura mucho más potente en cálculo matemático.

En coma flotante espero un gran avance en prestaciones clock for clock respecto a los actuales diseños de AMD, cifrado en torno a un 50% para 4 módulos Bulldozer con sus 4 FPUs dobles frente a las 6 FPUs con 3 pipelines de 128 bit cada una del hexacore Istambul.

Istambul45nm AMD Istambul hexacore, Bulldozer lo superará en un 50% en potencia FPU.

Prestaciones en proceso de enteros

Los Int cores muy probablemente serán más cortos en transistores que los actuales cores de enteros de Phenom II. De hecho reducen su capacidad de 3 ALUs mas 3 AGUs a 2 mas 2 respectivamente. AMD claramente apuesta por un futuro multithread…

Las prestaciones por Int core en cambio serán muy probablemente inferiores a las actuales en Phenom II.

Según las propias estimaciones de AMD, un MCM Bulldozer con 16 Int cores será un 37% más rápido que el doble hexa core Magny Cours. Si calculamos, a igualdad de cores, llegamos a un empate técnico.

Es decir, las prestaciones multithreaded en proceso de enteros serán equivalentes. En cambio, en algoritmos single threaded parece que Bulldozer será inferior a los actuales cores de AMD. Me puedo equivocar pero a la luz de los datos conocidos…

Frecuencias estimadas

La frecuencia de trabajo de un microprocesador actual la determinan numerosos factores:

  • La capacidad de la lógica de procesamiento (ALUs, FPUs…) de funcionar con corrección y estabilidad a esa frecuencia con un voltaje razonable.
  • La capacidad de realizar las comunicaciones inter core en un tiempo suficientemente corto para finalizar la transferencia antes del siguiente tick de reloj.
  • Frecuencia máxima de las cachés a la latencia y voltaje estipulado.
  • Entrar dentro del TDP de diseño (Thermal envelope) a esa frecuencia y voltaje en carga máxima combinada.

Como vemos, por un lado la frecuencia viene determinada por las capacidades del chip, del “silicio”, y por otro lado de no excederse en disipación térmica.

La velocidad de propagación de las señales eléctricas es limitada (y muy, muy inferior a la de la luz contrariamente a lo que algunos piensan) y por ello transcurre un tiempo finito desde que una unidad envía un resultado hasta que otra unidad lo recibe y puede comenzar su procesamiento sobre él. Esto limita la frecuencia de los procesadores y motiva que su diseño sea extremadamente complejo pues hay que posicionar las unidades que necesitan comunicación mutua lo más cerca posible (no en distancia, sino en tiempo – latencia –).

La disipación térmica depende de la frecuencia linealmente y del voltaje. La dependencia del voltaje es con una potencia entre 2 y 3:

  • Doble frecuencia, doble disipación.
  • Doble voltaje, de 4 a 8 veces mayor disipación térmica.

Como todos sabéis, a mayor voltaje (dentro de las limitaciones del diseño y el proceso de fabricación) mayor fiabilidad y linealidad en el rendimiento de los transistores de los que está compuesto el chip.

Todos estos condicionantes dan un rango de voltaje utilizable en el procesador, cuanto más nos acercamos al máximo obtendremos una mayor frecuencia estable pero con un gran consumo y en cambio, en la parte baja del rango obtendremos una menor frecuencia pero un excelente performance per watt.

Estimo que las frecuencias de Bulldozer se moverán en el mismo rango que los actuales cores Shanghai y Interlagos, sus frecuencias máximas rondarán los 3+ GHz. No veo probable cruzar los 4 GHz con TDPs razonables (máximo de 140W).

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

Uncore clock en Core i7 920 stepping D0. Actualizado - LowLevelHardware

El procesador Core i7 es un complejísimo ingenio con una estructura eminentemente modular. Los ingenieros de Intel lo diseñaron de este modo para dotar de flexibilidad al producto pudiendo así fabricar diversas versiones para distintos nichos de mercado.

En este artículo analizo en profundidad la influencia de la frecuencia del Uncore en las prestaciones de un Core i7 920 fuera de especificación con los núcleos a 3.5 GHz y 3.628 GHz, con multiplicador de cores X20 y Uncore X20 con BCLK de 175 y 181 MHz respectivamente sin Turbo Mode en Memtest86+ 2.11.

En Windows, en cambio con Turbo Mode X21 en cores.

UncoreColoreados los cuatro núcleos de Nehalem. El resto es el uncore.

Una característica clave de todos los procesadores actuales es su naturaleza asíncrona. En el procesador Core i7 hay tres frecuencias de reloj diferenciadas por su multiplicador derivado de un reloj maestro, el BCLK:

  • Frecuencia de los núcleos de ejecución
  • Frecuencia del uncore
  • Frecuencia de los enlaces QPI

La frecuencia de los núcleos es la más conocida e inmediatamente relacionamos su incremento con mayor capacidad de cálculo. En el procesador Core i7 este dominio de reloj comprende los cuatro procesadores con SMT y sus cachés privadas L1 y L2.

En el sistema fuera de especificación que estoy preparando, la frecuencia objetivo es de 3.8 GHz (BCLK 181 y multiplicador X21 Turbo Mode).

PIC02645 Pasando Prime 95 Blend en Windows XP Pro 24h.

Por su parte, la frecuencia del buses QPI no tiene gran importancia en sistemas de un solo socket, pues solo se utiliza para la comunicación con el chipset X58. En sistemas multiprocesador (varios sockets) su función principal es la comunicación entre varios chips Nehalem (Xeon), por ello incorporan tres enlaces de 4.8 a 6.4 GHz.

Frecuencia del uncore en Core i7

En cambio, mucho menos conocida es la influencia de la frecuencia del uncore, o lo que no son los cores (núcleos). El Uncore comprende la caché L3 de 8 MB y sus buses y también las tres controladoras de memoria DDR3 integradas con sus buffers de escritura y los mecanismos de hardware prefetch.

En el modelo i7 920, la frecuencia nominal del uncore son unos meros 2133 MHz para 2666 MHz en los cores sin turbo mode (2.8 GHz en turbo Mode).

Si incrementamos este parámetro obtenemos un claro incremento de prestaciones en software que haga un uso intensivo de la caché L3 y de la RAM e incluso podemos llegar a un diseño síncrono con los núcleos.

Datos experimentales obtenidos en Memtest86+ 2.11 sin Turbo Mode:

Multiplicador CPU X20, Uncore X16 – X20. Las cinco primeras configuraciones con BCLK 175 MHz, la última 181 MHz. En las dos últimas obtenemos sincronía entre los núcleos y el Uncore con multiplicador en ambos casos X20.

Image1 Velocidades en MB/s de los diferentes niveles de caché y memoria para distintos ajustes.

La velocidad de acceso a la L3 compartida (shared) de 8 MB se incrementa en cuanto superamos el multiplicador 2:1 con la memoria (memoria 1400 MHz, uncore 2800 MHz) y a partir de ahí se mantiene en un valor constante, en este sistema 34314 MB/s. (Todas las medidas con BCLK 175 MHz):

imageVelocidad de la caché L3 de 8 MB para distintas frecuencias del Uncore. Cores a 3.5 GHz.

En cambio, la velocidad de acceso a memoria principal por el triple canal DDR3 tiene un comportamiento más curioso con dos inflexiones:

Empieza en 14286 MB/s para un multiplicador Uncore:RAM de 2:1, incrementándose a 15555 MB/s a frecuencias de 2982, 3158 y 3333 MHz del uncore. En cambio cuando sincronizamos el Uncore con los núcleos se incrementa notablemente su velocidad hasta los 17157 MHz.

Esto es debido a que no es necesaria ya resincronización alguna entre los dos dominios de frecuencia, con la latencia añadida que este proceso comporta.

imageVelocidad de la RAM para diferentes frecuencias del Uncore. Cores a 3.5 GHz.

Más de 17 GB/s es un excelente resultado teniendo en cuenta que he utilizado 3 GB en un triple canal de DDR3 1333 normal y corriente Kingston CAS 9 (9-9-9-24 2T). Eso sí, las latencias las he configurado manualmente a 7-7-7-21 con 1T de acceso con una modificación manual de todos los parámetros relevantes en BIOS incluyendo los voltajes.

Capturas de pantalla Memtest86+ 2.11:

PIC02637Cores 3.5 GHz, Uncore 2.8 GHz, memoria triple channel 1400 MHz 7-7-7-21 1T.

Con todo optimizado al máximo incluidos los timings de memoria a 7-7-7-21 1T, el resultado son 14286 MB/s con la memoria en triple channel 1400 MHz. La caché L3 llega a unos 32 GB/s.

PIC02638Cores 3.5 GHz, Uncore 2.98 GHz, memoria triple channel 1400 MHz 7-7-7-21 1T.

Aquí vemos el primer incremento de velocidad en lectura de memoria y caché L3. Respectivamente de 14286 a 15556 MB/s y de 32 a 34 GB/s para la L3.

PIC02779 Cores 3.5 GHz, Uncore 3.50 GHz, memoria triple channel 1400 MHz 7-7-7-21 1T.

Aquí tenéis el segundo punto de inflexión con un gran incremento de ancho de banda (de 15555 a 17157 MB/s), con relojes síncronos cores-uncore a 3.5 GHz.

PIC02644 Core i7 920 @ 3620 MHz cores y 3620 MHz Uncore. Core i7 síncrono (!!).

Estos hechos me hacen sospechar una importante reducción de latencia con estos ajustes; lo comprobaré en unos días ya en Windows.

El diseño asíncrono

Como siempre se ha demostrado estos resultados apoyan la mayor velocidad de los diseños síncronos, aunque por consideraciones de consumo y disipación térmica son más adecuados los diseños asíncronos como Phenom II y core i7.

Señalar por último, que el incremento de la frecuencia del uncore debe de ir acompañado a su vez de un incremento en su voltaje de alimentación, con lo que crece también el consumo y disipación térmica de esta parte del procesador. Por lo que es crítico contar con un adecuado sistema de refrigeración.

Nota: No existe método de conocer la temperatura del uncore o de la caché L3 de 8 MB (no poseen sensores térmicos, al menos visibles al usuario…) con lo que recomiendo prudencia.

Para la segunda parte de este artículo visita este enlace de ProfessionalSAT, con resultados prestacionales excepcionales en Windows.

domingo, 25 de diciembre de 2011

¡Felices fiestas desde LowLevelHardware! – LowLevelHardware

¡Felices fiestas a todos desde LowLevelHardware!

Como es obligada tradición estos días estoy con la familia celebrando las fiestas pero desde el día 27 empiezo a sustituir 12 de mis Sistemas de Altas Prestaciones basados en CPUs Sandy Bridge Core i7 2600K @ 4.4 GHz por antiguos, venerables y probados Nehalem Core i7 930 y 950 @ 4 GHz.

SB_4C_630p_cores_thumb[1]

¿Extraño? Simplemente los Sandy Bridge son un 30% más lentos que los Nehalem en los cálculos matemáticos intensivos que emplea uno de mis mejores clientes… he descubierto un “defecto” en la excelentísima nueva  arquitectura de Intel.

Tras semanas de testing he descubierto la causa, recordáis la caché de micro operaciones de 1500 uOps nueva en SB, pues en estos algoritmos crea un GRAVE problema prestacional.

Lo denomino “micro code cache inter thread thrashing”. Un thread expulsa de la uOp cache los datos del otro thread constantemente y hace que la velocidad de cálculo sostenida del procesador baje alarmantemente.

SB_uopcache_thumb[1]

Un Core i7 Nehalem @ 4 GHz realiza 1000 iteraciones del cálculo con ocho threads simultáneos en 3100 s, un SB @ 4.4 GHz tarda unos absurdos 4050 s.

Es un resultado absolutamente repetible con una variación de máquina a máquina máxima de 50 s y lo he probado con 12 CPUs distintas SB y 24 Nehalem y con placas base SB P67 y Z68. Única opción: volver a los antiguos i7…

die_thumb[1]El venerable y efectivo Nehalem de 45 nm.

Disfrutemos de estos días antes de ponernos manos a la obra… lo dicho, ¡Felices Fiestas!

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

domingo, 1 de marzo de 2009

Phenom II X4 940 3.6 GHz: BIOS en detalle. Actualizado - LowLevelHardware

En ProfessionalSAT he tratado este sistema de un modo más superficial, aquí describiré los detalles más interesantes de la configuración BIOS de un AMD Phenom II X4 940 en overclock.

PIC02060

Los parámetros (frecuencias, multiplicadores, voltajes, …) han sido elegidos para un uso continuado sin fallos con cargas del 100 % en cores con total estabilidad y exactitud en los cálculos. Es un sistema pensado para cálculo continuo e ininterrumpido en entorno profesional.

Componentes utilizados:

  • Placa Base ASUS M4A79-DeLuxe AM3. Chipset AMD 790FX – AMD 750
    • Soporta procesadores AM3, AM2+ y AM2 con memoria DDR2 hasta 1066.

PIC02054

  • 4 GB en dos módulos Kingston HyperX DDR2 1066 5-5-5-15 2T 2.2V
  • Procesador AMD Phenom II X4 940 Black Edition

    • Cores con multiplicador 18X para una frecuencia de  3.6 GHz @ 1.425V (+20 %)
    • Uncore a 2.4 GHz (+33%) (incluye la L3 de 6 MB y las dos controladoras de memoria DDR2)
    • Los buses de comunicaciones HyperTransport a 3.6 GHz (sin cambios)

Shanghai_ANÁLISIS

Procesador Phenom II X4 940.

El overclock de los núcleos aumentará las prestaciones linealmente con la frecuencia (sobre el 20%), pero lo más interesante será la influencia del más importante incremento del 33% en la L3 y las IMC.

PIC02050

Sobre el bus HT, en placas monoprocesador se utiliza para comunicación con el PCIEx y el SouthBridge. No se aprecia incremento de prestaciones variando su frecuencia.

PIC01987

Los más de 11 GB/s son producto del incremento de frecuencia IMC/L3 a 2.4 GHz.

Configuración de BIOS:

PIC02046

Vcore 1.425 V, CPU/NB AUTO  y DDR2 2.20V.

Con la L3 y controladoras de memoria a 2.4 MHz aseguramos un ancho de banda más acorde con el dual channel 1066. Recordemos que el AMD Phenom dispone de un exiguo bus de 64 bit entre los núcleos y el uncore.

Con una frecuencia de 2.4 GHz obtenemos un ancho de banda máximo de 19.2 GB/s, suficiente para un dual channel DDR2 1066 (17 GB/s). En la segunda parte de este artículo veremos si esto es suficiente …

PIC02047

Spread Spectrum disabled.

Voltajes CPU VDDA, HT, NB, NB 1.8V y SB siempre en valores mínimos absolutos para mantener la menor disipación térmica y consumo.

PIC02049

Timings de memoria.

Ajustados a 5-5-5-18 2T a 2.20 V. Desafortunadamente, es imposible hacer estable la memoria 1066 MHz a 1T independientemente del voltaje aplicado …

PIC02051

Phenom II X4 940 3600 MHz / 2400 MHz NB clock.

Manteniendo Cool’n’Quiet activado pese al overclock permitimos que el procesador regule automáticamente la frecuencia y el voltaje entre los siguientes estados:

  • Carga máxima: Núcleos 3600 MHz – Uncore 2400 MHz – memoria 1066 MHz – 1.425 V
  • Carga mínima:  Núcleos  800 MHz – Uncore 2400 MHz – memoria 1066 MHz – 1.000 V

De este modo, cuando el sistema está en reposo o con cargas de trabajo bajas, las temperaturas rondan los 25 - 28 ºC en los núcleos y en carga máxima se acerca a los 60 ºC.

En el siguiente artículo un análisis exhaustivo del subsistema de memoria incluyendo las cachés en RMMA y RMMT.

Etiquetas de Technorati: ,,,,

lunes, 15 de septiembre de 2008

El cambio necesario en AMD

AMD se dispone a dar un giro estratégico radical. De la mano de Dirk Meyer, actual CEO, va a iniciar la venta de sus plantas de producción de semiconductores.

Image2

AMD está en un momento económico difícil, sus resultados financieros son alarmantes desde la adquisición de ATI Technologies en 2006 y está al borde de un callejón de difícil salida.

Podemos observar su cotización bursátil:

Image1

Cotización AMD en NASDAQ. Fuente: NASDAQ.com

Dirk MeyerDirk meyer, un ingeniero que fue jefe de diseño del exitoso procesador Athlon, es el encargado de llevar a cabo esta nueva estrategia conocida como Asset Smart.

Meyer entró en AMD en 1995 proveniente de Intel corp. y ha ido ascendiendo hasta ser presidente y finalmente CEO.

AMD, bajo la dirección de Meyer, ha decidido prescindir de sus emblemáticas fábricas de Dresden, Alemania, en un giro estratégico radical.

Esta opción tiene ventajas y desventajas, por un lado AMD dispondrá de unos fondos ingentes cuando lleve a cabo la venta de sus instalaciones para dedicar al diseño de los microprocesadores futuros y al refinamiento de la tecnología de fabricación presente y ... a tapar el inmenso agujero económico que actualmente padece.

Pero en el lado negativo, al ser una compañía fabless, pierde el control sobre el proceso de fabricación.

Todos sabemos que Intel es Intel en parte a sus excelentes procesos de fabricación, siempre va una generación o nodo por delante de la competencia lo que le permite una gran ventaja competitiva.

AMD por su parte deberá delegar en terceros como TSMC ,IBM o incluso Fujitsu (quién sabe) la fabricación de sus procesadores lo que le supondrá un varapalo competitivo debido a la tecnología no tan puntera de estos fabricantes de "segunda fila".

Además veremos como responderán estas terceras empresas ante los picos de demanda del mercado, cuando todos sus clientes quieran aumentar la producción y AMD solo sea uno entre tantos.

Recordar que nVidia y ATI tienen un modelo fabless y con bastante éxito, a mi juicio el problema para AMD radica en que la fabricación de una moderna CPU multicore es más exigente que la de una GPU debido a sus mayores frecuencias máximas a igualdad de proceso o nodo.

Sino puede ocurrirle como a nVidia con su nuevo G200 fabricado por TSMC con su tecnología de 65 nm general o 65G, lo que ha llevado su superficie (die area) a 583 mm2 (!!), un chip extremadamente caro de fabricar.

gt200[1]

El brutalmente gigantesco nVidia G200 fabricado por TSMC.

Etiquetas de Technorati: ,,,,

domingo, 14 de septiembre de 2008

El que no corre vuela ...

Examinando patentes ... siempre he tenido cierta tendencia a los "inventos", he encontrado esta tan llamativa:

SOLAR SYSTEM POSITIONING SYSTEM

dn14640-2_754

Un sistema análogo al GPS pero diseñado para posicionarse con precisión en el sistema solar, en este caso llamado SSPS (Solar System Positioning system).

Ha sido patentado por Arthur M. Dula, un ex-NASA y abogado especialista en Derecho Espacial (sí, algo así existe ...)

Para que veáis que hay algunos que van un paso por delante ...

Texto de la patente.

Etiquetas de Technorati: ,,

martes, 8 de julio de 2008

Consumo sistema ATI HD4850 en reposo

Un sistema Core2Quad, con componentes correctamente elegidos, no tiene porqué amargarnos el fin de mes por su consumo.

Configuración del sistema:

  • Core2Quad Q6600 a frecuencia nominal @ 1.225V
  • Placa Gigabyte GA-DS3R BIOS F12f
  • 2 x 1 GB Kingston HyperX800 4-4-4-12 @ 2.0V
  • ATI HD4850 512MB GDDR3
  • HD WD 5000 AAKS modelo nuevo (platos de 320 GB)
  • 3 ventiladores 12 cm en torre controlados por software (SpeedFan)
  • F/A 300W alto rendimiento 80% eficiencia con ventilador 12 cm Noctua NF-P12

Consumo sistema en reposo: 136 W.

08-07-08_1724

La HD4850 con su frecuencia nominal 2D por defecto:

  • Núcleo: 500 MHz
  • Memoria: 750 MHz DDR (1500 MHz efectivos)

Consumo en modo 2D "optimizado": (ver artículo anterior)

08-07-08_1725

Frecuencias:

  • Núcleo: 200 MHz
  • Memoria: 500 MHz DDR (1000 MHz efectivos)

Baja a unos 129 - 131 W. La gráfica, gracias al intensivo uso del clock gating consigue de por sí un consumo ridículo.

Con el Q6600 a 100% de uso y la HD4850 en reposo:

(4 núcleos al 100% de uso)

08-07-08_1732

En esta instantánea, en la que podéis ver parte de mi mano, vemos como el consumo ya empieza a ser respetable: 193 W.

Próximamente las medidas con la ATI en carga 70 - 100%, es decir, en un juego real, RFactor.

Etiquetas de Technorati: ,,,,,,