Mostrando entradas con la etiqueta Istambul. Mostrar todas las entradas
Mostrando entradas con la etiqueta Istambul. Mostrar todas las entradas

jueves, 2 de febrero de 2017

AMD Bulldozer. Prestaciones estimadas - LowLevelHardware

En el tercero de esta serie de artículos dedicados a la próxima micro arquitectura de AMD voy a aventurar mis previsiones sobre su nivel prestacional. Además lo compararé con los diseños actuales y con su muy evolucionado y perfeccionado futuro competidor, Intel Sandy Bridge.

Bulldozer_server AMD Bulldozer, la próxima micro arquitectura.

Bulldozer module, el módulo Bulldozer:

BulldozerModuleAMD Bulldozer module.

AMD llama módulo al conjunto siguiente:

  • Las etapas de Fetching
  • La circuitería de Decodificación X64
  • Los tres Schedulers independientes
  • Las cachés L1i
  • Los 2 cores de enteros compuestos de 2 ALUs y 2 AGUs
  • Una doble FPU con capacidad FMAC de 128 bit
  • Las cachés L1d
  • La L2 compartida para todas las unidades funcionales dentro del módulo

Este concepto se contrapone a la actual acepción de core. En los actuales diseños entendemos como core al conjunto del procesador excluyendo las interfaces externas, el North Bridge y en todo caso la caché L3 compartida (de haberla).

AMD nos obliga a cambiar el concepto para subrayar que cada módulo contiene dos cores funcionales e independientes de proceso de enteros.

Prestaciones por ciclo esperadas

A estas alturas tengo absolutamente claro que el tamaño en mm2 de la parte lógica (excluyendo L2 e interfaces) de Bulldozer será notable, claramente superior a sus actuales cores K10.5.

AMD ha comunicado que su núcleo K10 fabricado en 32 nm SOI HKMG por GloFo ocupa solamente 9.69 mm2 para 35 M Transistores, 17.7 mm2 incluyendo 1 MB de L2 (110 MT).

AMD_K10_32nm AMD K10 32 nm core 1 MB L2.

Estimo que el área lógica (ALUs + FPU) de Bulldozer se irá a la zona de los 20 mm2 en 32 nm, el doble que K10 32 nm y más área de die que los actuales cores K10.5 de 45 nm de Phenom II (unos 17 mm2).

K10.5_45nm_1MBAMD K10.5 45 nm 1 MB de L2.

Prestaciones en coma flotante (FPU)

Donde habrá un gran incremento en número de transistores será en la gran FPU doble de 128 bit con capacidad FMAC.

La actual implementación en K10.5 de 45 nm (Phenom II) comprende 3 pipelines de coma flotante especializados de 128 bit:

  • FMUL
  • FADD
  • FMISC

Esta limitación reduce su capacidad de proceso FPU puesto que cada unidad procesa un tipo de instrucciones y cada tipo de instrucción debe ir a su unidad y no otra.

En Bulldozer ambos pipelines son generales (ejecutan cualquier instrucción FPU) y simétricos y por ello resulta una arquitectura mucho más potente en cálculo matemático.

En coma flotante espero un gran avance en prestaciones clock for clock respecto a los actuales diseños de AMD, cifrado en torno a un 50% para 4 módulos Bulldozer con sus 4 FPUs dobles frente a las 6 FPUs con 3 pipelines de 128 bit cada una del hexacore Istambul.

Istambul45nm AMD Istambul hexacore, Bulldozer lo superará en un 50% en potencia FPU.

Prestaciones en proceso de enteros

Los Int cores muy probablemente serán más cortos en transistores que los actuales cores de enteros de Phenom II. De hecho reducen su capacidad de 3 ALUs mas 3 AGUs a 2 mas 2 respectivamente. AMD claramente apuesta por un futuro multithread…

Las prestaciones por Int core en cambio serán muy probablemente inferiores a las actuales en Phenom II.

Según las propias estimaciones de AMD, un MCM Bulldozer con 16 Int cores será un 37% más rápido que el doble hexa core Magny Cours. Si calculamos, a igualdad de cores, llegamos a un empate técnico.

Es decir, las prestaciones multithreaded en proceso de enteros serán equivalentes. En cambio, en algoritmos single threaded parece que Bulldozer será inferior a los actuales cores de AMD. Me puedo equivocar pero a la luz de los datos conocidos…

Frecuencias estimadas

La frecuencia de trabajo de un microprocesador actual la determinan numerosos factores:

  • La capacidad de la lógica de procesamiento (ALUs, FPUs…) de funcionar con corrección y estabilidad a esa frecuencia con un voltaje razonable.
  • La capacidad de realizar las comunicaciones inter core en un tiempo suficientemente corto para finalizar la transferencia antes del siguiente tick de reloj.
  • Frecuencia máxima de las cachés a la latencia y voltaje estipulado.
  • Entrar dentro del TDP de diseño (Thermal envelope) a esa frecuencia y voltaje en carga máxima combinada.

Como vemos, por un lado la frecuencia viene determinada por las capacidades del chip, del “silicio”, y por otro lado de no excederse en disipación térmica.

La velocidad de propagación de las señales eléctricas es limitada (y muy, muy inferior a la de la luz contrariamente a lo que algunos piensan) y por ello transcurre un tiempo finito desde que una unidad envía un resultado hasta que otra unidad lo recibe y puede comenzar su procesamiento sobre él. Esto limita la frecuencia de los procesadores y motiva que su diseño sea extremadamente complejo pues hay que posicionar las unidades que necesitan comunicación mutua lo más cerca posible (no en distancia, sino en tiempo – latencia –).

La disipación térmica depende de la frecuencia linealmente y del voltaje. La dependencia del voltaje es con una potencia entre 2 y 3:

  • Doble frecuencia, doble disipación.
  • Doble voltaje, de 4 a 8 veces mayor disipación térmica.

Como todos sabéis, a mayor voltaje (dentro de las limitaciones del diseño y el proceso de fabricación) mayor fiabilidad y linealidad en el rendimiento de los transistores de los que está compuesto el chip.

Todos estos condicionantes dan un rango de voltaje utilizable en el procesador, cuanto más nos acercamos al máximo obtendremos una mayor frecuencia estable pero con un gran consumo y en cambio, en la parte baja del rango obtendremos una menor frecuencia pero un excelente performance per watt.

Estimo que las frecuencias de Bulldozer se moverán en el mismo rango que los actuales cores Shanghai y Interlagos, sus frecuencias máximas rondarán los 3+ GHz. No veo probable cruzar los 4 GHz con TDPs razonables (máximo de 140W).

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

Previo AMD Bulldozer. Actualizado - LowLevelHardware

La próxima generación del core de AMD está despertando una gran excitación entre los profesionales de la arquitectura de procesadores, e incluso entre los propios ingenieros en Intel. Tal como ahora la conocemos será un rotundo éxito si es llevada a buen puerto como apuntan los numerosos rumores y las escuetas informaciones del fabricante.

Bulldoxer_4module_8int_cores_L3shared_630 AMD Bulldozer Zambezi 8 cores: 4 módulos y 8 threads con 8 INT cores.

En un artículo anterior, de Enero de este año, hice una pequeña lista de peticiones (wish list) para la próxima generación de procesadores AMD. Todos sabemos que el diseño definitivo del procesador que sustituirá, ya fabricado en 32 nm, a los actuales Opteron y Phenom II basados en núcleos Shanghai es definitivo hace meses y con alta probabilidad están ya en los previos al tape-out del primer stepping bootable.

Un poco de historia: Intel y la era Netburst

Durante años, desde la aparición del flamante Athlon64 en 2003, AMD gozó de una etapa de clara supremacía de sus diseños en prestaciones, consumo y disipación térmica. Intel ya desde el año 2000 comercializó su línea Netburst, unas CPUs basadas en pipelines extraordinariamente largos con la excusa de altísimas frecuencias y con un desafortunado e intrusivo (aunque necesario) mecanismo de Replay de micro operaciones.

Fueron procesadores que más bien parecían diseñados por los equipos de márqueting que por los excelentes grupos de ingeniería en Intel…

Las primera iteración del procesador Pentium 4 (Willamette 180nm) salió a la venta en 2000 compitiendo con el excelente y equilibrado procesador AMD Athlon. Con un pipeline de enteros de 20 etapas (!!) después de los decoders y la trace caché.

Contaba con unos tamaños de caché claramente insuficientes: la ínfima caché L1 de 8 KB y la L2 de 256 KB. El tamaño de la L2 de 256 KB se rumorea que fue una víctima de las prisas de Intel por llevar al mercado el diseño en 180 nm. Sus frecuencias finales fueron de 1.3 a 2.0 GHz.

die_180nm[1]Intel Pentium 4  Willamette 180 nm 256 KB L2.

Era una CPU muy cara y difícil en fabricación dado su tamaño y complejidad, casi toda su superficie era lógica. Contaba con un FSB quad pumped (4 x 100 MHz) de 400 MTs para un dual channel RAMBUS a 800 MHz y 16 bit (en el año 2000 !!). En fín, una plataforma de un coste estratosférico para finalmente y en la práctica obtener rendimientos similares o inferiores a un AMD Athlon con simple memoria SDRAM.

A finales de 2001 llegó, en mi opinión, el mejor integrante de la saga: el procesador Northwood de 130 nm ya con 512 KB de L2 y posteriormente dotado con HyperThreading. Partió de los 2 GHz (FSB 400 MHz) para escalar rápidamente. En esta época ya competía con los Athlon XP de AMD de 180 nm.

die_130nm[2]Intel Pentium 4  Nothwood 130 nm 512 KB L2.

Cuando llegó a frecuencias desde los 2.8 GHz y con un FSB de 800 MHz empezó a ser el líder en prestaciones y los modelos 3.2 y 3.4 gozaron de gran fama y un excelente rendimiento.

En 2004 llegó Prescott en 90 nm (1 MB L2) con un pipeline absurdamente dilatado a más de 30 atapas (!!).

Fue un rediseño absoluto de Netburst, poco tenía que ver con Willamette o Northwood. Incluso se rumoreó el nombre de Pentium 5, posteriormente introdujo el proceso de 64 bit. Sus prestaciones finales fueron desalentadoras, de hecho era algo más lento clock for clock que Northwood… Además su disipación térmica ponía en aprietos al mejor sistema de refrigeración de la época.

die_90nm_1m[1] Intel Pentium 4 Prescott 90 nm 1 MB L2.

Todavía recuerdo cuando probé los primeros engineering samples de Prescott a 2.8 GHz sustituyendo un excelente Nortwood HT a 3.2 GHz obteniendo 20ºC más de temperatura y un rendimiento muy inferior… La cuerpo del disipador daba miedo…

Prescott se diseño para frecuencias máximas sobre los 5 GHz, pero problemas de diseño (excesivo leakage del proceso de 90 nm en Prescott) y su incontenible consumo eléctrico y consiguiente disipación térmica lo hicieron inviable. Intel incluso tuvo en sus roadmap versiones a 4 y 4.2 GHz que más tarde canceló.

En 2005 Intel tenía previsto el lanzamiento de Tejas (con un pipeline previsto sobre 50!!!!!! etapas). Los primeros samples fueron una gran decepción, consumos excesivos rayando lo imposible en plataformas de consumo y un rendimiento decepcionante. Fue sabiamente cancelado.

En Intel se cortaron algunas cabezas en los staff directivos y se replanteó totalmente el diseño de sus futuros microprocesadores. El management dio paso al diseño del equipo en Haifa (Israel), los padres del excelentísimo procesador Pentium M Banias de 90 nm derivado del núcleo Pentium III.

El despertar de un gigante, Intel Conroe (Core 2 Duo / Quad) 65 nm

Tras todos estos hechos, AMD equivocadamente pensó o más bien confió en que Intel continuaría con la evolución de Netburst eternamente.

Se durmieron en los laureles del K8, dedicaron muchos recursos al proyecto K9, un procesador con un pipeline extra largo tipo Netburst y con SMT al estilo HyperThreading que fue tardíamente aunque acertadamente cancelado.

merom_die_image Intel Core 2 Duo Conroe 65 nm, dual core 4 MB L2.

Intel sacó al mercado en 2006 Conroe, el famoso Core 2, dando un vuelco radical mercado y consiguiendo un dominio absoluto en todos los segmentos desde portátiles a sobremesa de consumo y servidores dual core.

En el terreno multisocket AMD mantenía su liderato absoluto en 4 sockets gracias a su más avanzada arquitectura con enlaces HT (HyperTransport) frente al arcaico FSB de Intel. En los servidores de dos socket había una encarnizada pelea, Intel contaba con mejores núcleos de ejecución pero AMD ganaba en ancho de banda.

El éxito de Conroe reside en su poderoso núcleo de ejecución de enteros de cuatro pipelines y sus bien dimensionadas FPU de 128 bit, además de su excelente arquitectura de cachés inclusivas y de gran tamaño (2 MB de L2 por core en 65 nm y 3 MB de L2 por core en 45 nm).

La decepción del AMD Barcelona 65 nm

AMD llegó tarde al mercado con los procesadores Opteron quad core y Phenom basados en cores Barcelona de 65 nm.

Con una exigua caché L3 compartida de solo 2 MB para cuatro núcleos (512 KB por core). Una caché L3 de diseño totalmente asíncrono con los núcleos que imponía altas latencias de acceso cifradas en unos 48 ciclos a frecuencias nominales. Además y debido a su pequeño tamaño, unas bajas tasas de aciertos L3 (cache hits) y grandes cargas en el dual channel DDR2 lo que causaba contención en acceso.

phenom AMD Barcelona 65 nm, quad core nativo con 2 MB de L3 compartida.

Intel hacía meses que disponía del doble dual core Clovertown de 65 nm con dos L2 de 4 MB que aumentó más si cabe el diferencial de prestaciones con AMD, además de ser más barato de fabricar dada su poca superficie y avanzada tecnología de fabricación.

Estaba formado por dos dies Core 2 Duo en un chip:

intel-core-2-quad-q6600-cpus1[2] El Intel Core 2 Quad, un MCM de dos Core 2 Duo. 4 + 4 MB de L2 en 65 nm.

Rápidamente Intel sacó al mercado la evolución de 45 nm de Core 2, los núcleos Penryn con 6 MB de L2 compartida. Contaban con numerosas mejoras que lo hacían sobre un 16% más rápido que su antecesor de 65 nm y recuerdo como todos mis mejores clientes sustituyeron sus CPUs Conroe por Penryn en pocos meses debido a su gran mejora en algoritmos conteniendo divisiones.

Penryn_58 Intel Core 2 Duo Penryn 45 nm, dual core con 6 MB L2 compartida.

Barcelona fue un débil rival para tales procesadores y esto se agravó cuando Intel presento el sustituto de Yorkfield, Harpertown, dotado de cuatro núcleos Penryn y 2 L2 de 6MB y proceso de 45 nm.

penryn_quadcore Los Core 2 quad de la serie 9000, fabricados en 45 nm.

Nivelando el terreno, AMD Shanghai

Por fin AMD introdujo en el mercado, esta vez sí, un procesador competente con la oferta de su rival Intel: el core Shanghai de 45 nm. Lo he analizado en multitud de artículos y desde todos los ángulos en LowLevelHardware (ordenados por fecha):

Y en ProfessionalSAT:

Ha poblado las series Opteron y Phenom II dotado de una L3 de 6 MB y 48 vías desplazando al mediocre chip Barcelona. Con esta evolución logró al fin doblegar a los invencibles hasta el momento Core 2 Quad Penryn. Actualmente se comercializa en versiones hasta los 3.4 GHz (Phenom II X4 965 BE) y este modelo en particular supera a cualquier Core 2 Quad en la media de benchmarks.

K10%20processor%2045nm%20architec%201[1]AMD Shanghai 45 nm, quad core nativo con 6 MB de L3 compartida.

Intel Tick–Tock. Microarquitectura Nehalem con SMT

El pasado año 2008 (en Q4) Intel dio a luz a su última microarquitectura de altas prestaciones: Nehalem. Salió a la venta con el nombre comercial de Core i7.

Este procesador lo he tratado extensamente (quizás me quedo corto…) en varios de mis blogs:

En LowLevelHardware he detallado su microarquitectura:

die Intel Nehalem 45 nm, quad core con SMT (8 threads) y 8 MB L3 compartida.

Su gran  baza es reside en el SMT, el Turbo Mode  y un brutal y desorbitado ancho de banda dado por el triple channel DDR3 además de su excelente arquitectura de caché de tres niveles con unos 38 ciclos de latencia L3 y unas ultrarrápidas L2 de 10 ciclos y 256 KB.

Con Nehalem, Intel ha logrado el liderato destacado en prestaciones en todos los terrenos: enteros, coma flotante, single thread, multithreading, ancho de banda, latencia… y AMD está pasando tiempos difíciles compitiendo con su única arma, el precio… y la inteligencia de su líder.

Un Phenom II X4 965 BE (el tope de gama) compite actualmente con el procesador benjamín de la gama Nehalem el Lynnfield Core i5 750 sin SMT (HyperThreading) y con dual channel DDR3 en prestaciones y precio.

die-angle-620[1] Intel Lynnfield 45 nm. Integra el controlador PCIe 2.0 en el die (a la izquierda).

Por encima de ellos se sitúan los Core i7 Lynnfield de socket LGA1156 con SMT, Turbo Mode agresivo y dual DDR3 Core i7 860 y 870. Este procesador, al integrar el bus PCIe en el die prescinde de los enlaces QPI y del chipset X58.

Lynnfield45nmIntel Lynnfield. 45 nm, 8 MB L3, SMT y PCIe integrado.

La superior gama i7 LGA1366 con SMT y triple DDR3 (asociado por un QPI de 4.8 a 6.4 GT/s con el chipset X58) no cuenta a día de hoy con un procesador equivalente en velocidad en AMD aunque tampoco en precio.

Servidores AMD e Intel en 2009

El año 2009 ha sido excelente para Intel, ha podido desplegar su arquitectura Nehalem hasta los dos sockets. En este terreno AMD no tiene una alternativa en paridad aunque se acerca bastante con su diseño Istambul, un hexa core nativo con 6 MB de L3 y fabricado en 45 nm:

Istambul45nmAMD Istambul. 6 núcleos y 6 MB L3 en 45 nm.

En el espacio 4 socket AMD es imbatible ya que Intel mantiene sus mastodónticos e ineficientes chips Dunnington hexa core basado en núcleos tres Penryn dual core con 3 MB de L2 shared por pareja y 6 MB de L3 compartida con una latencia superior a los 100 ciclos!!!

Dunnington_Xeon Intel Xeon Dunnington. 6 cores 3 L2 de 3 MB y 16 MB de L3 shared en 45 nm.

AMD e Intel en 2010

En 2010 AMD seguirá refinando el diseño de Shanghai. Hace un mes aproximadamente lanzó el nuevo stepping C3 que reduce el consumo y disipación térmica así como permite mayores overclocks en cores y uncore (caché L3, North Bridge y controladoras de memoria).

Introducirá un verdadero estado C1E lo que reducirá el consumo. Probablemente veremos versiones a 3.6 GHz del Phenom II X4 BE y como novedad la introducción del hexa core Istambul de 45 nm y 6 MB de L3 procedente de las actuales gamas de servidores Opteron de la serie (quizás Phenom II X6??) en el mercado de sobremesa llamado Thuban.

Westmere_wafer Wafer de procesadores Intel Westmere de 32 nm.

Intel tiene previsto la migración a 32 nm con los núcleos Westmere, la evolución de Nehalem. En el terreno más prestacional veremos los Westmere de 6 cores con SMT que elevará a 12 el número de threads por procesador. Contarán con 12 MB de L3 y varias mejoras micro arquitecturales.

westmereEl futuro Westmere dual core 32nm, 4 MB de L3 compartida y 256 KB L2 por core.

En principio Intel no tiene planes de un quad core de 32 nm basado en núcleos Westmere, para ello habrá que esperar a Sandy Bridge en 2011. Lo que sí habrá es un hexacore nativo llamado Gulftown:

gulftown32nm_6core Gulftown 6 cores, 12 MB L3 y 12 threads en 32 nm.

La buena noticia para algunos de mis clientes es que será compatible con la mayoría de actuales placas base con chipset X58 y socket LGA 1366.

AMD e Intel en 2011

Intel introducirá Sandy Bridge, su nueva microarquitectura tras Nehalem. Incluirá también SMT y la interconexión del procesador con el Uncore y los buses y cachés L3 compartidas será a través de un anchísimo ring bus que proporcionará latencias menores que en los actuales diseños.

003Sandy Bridge 32 nm, la próxima evolución microarquitectural de Intel.

En el siguiente artículo haré una educada estimación de la siguiente microarquitectura de AMD, el revolucionario core Bulldozer de 32 nm que verá la luz en 2011.

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

AMD Magny Cours 12 cores. AMD vuelve a la pelea. Actualizado - LowLevelHardware

Advanced Micro Devices (AMD) se encuentra en una difícil situación: competir en solitario contra un rival de un tamaño muy superior y con unos recursos financieros, humanos y tecnológicos excepcionales: Intel.

48cores48 cores en acción. Cuatro chips Magny Cours de 12 núcleos. Fuente: AMD.unprocessed

AMD ya ha demostrado públicamente los procesadores Magny Cours en servidores de cuatro sockets para un total de 48 núcleos de procesamiento, estarán disponibles en el mercado a principios de 2010 como vemos en el siguiente roadmap:

MagnyCours_RoadmapAMD Server Roadmap 2009 – 2010. Magny Cours en Q1 2010

magny_cours_bgAMD Magny Cours 12 cores. El nuevo Opteron serie 6000.

Dirk Meyer al mando de AMD está llevando a cabo una estrategia muy eficiente dados los recursos con los que cuenta. Está claro que AMD no puede de la noche a la mañana dar a luz un núcleo de ejecución tan elaborado y potente como los integrados en la arquitectura Nehalem de Intel.

Lo que sí puede hacer es aprovechar una de sus ventajas competitivas: su pequeño tamaño por core.

La ventaja de AMD: su pequeño core

Los núcleos de ejecución de AMD en los Phenom o Phenom II tienen una superficie netamente inferior y un número de transistores menor que los de su rival. AMD puede entonces jugar una carta:

Integrar más procesadores que su rival en sus nuevos procesadores para competir en mayor igualdad. Los núcleos de Shanghai rondan los 15 mm2 frente a los 24 mm2 de los cores de Nehalem con SMT (HyperThreading).

magny_cours_die AMD Magny Cours 12 cores. Un MCM compuesto de dos dies Istambul.

Magny Cours será un chip MCM compuesto por dos procesadores Istambul de seis núcleos (cada uno en un die separado), derivados de los actuales Shanghai de cuatro núcleos.

Dado que cada uno de los dos dies superará probablemente los 300 mm2 irá montado sobre el enorme socket G34, del que ya hable en un artículo anterior.

[g34[3].png]El socket G34 de AMD.

magny-cours_chipAMD Magny Cours, nótese el encapsulado alargado para encajar en el socket G34.

Cada die Istambul Integrará cuatro enlaces HyperTransport utilizando uno de ellos para comunicación entre los dies (entre los dos procesadores Istambul).

En el terreno de las controladoras de memoria nos encontramos con un quad channel DDR3 1600MHz para un ancho de banda sin precedentes hasta la fecha de 51.2 GB/s. Cada procesador Istambul dispondrá de dos controladoras DDR3.

Comparación dies Shanghai – Istambul

Istambul añade dos núcleos al ya conocido diseño quad core de 45 nm de Shanghai del que he hablado y analizado en profundidad.

Istambul_Shanghai

AMD Istambul (izquierda) frente a Shanghai (derecha) a escala.

Los ingenieros de AMD han tenido un duro trabajo para optimizar el diseño de Shanghai para introducir dos núcleos extra. Han reposicionado la caché L3 de 6 MB más a lo ancho del die, compactando ligeramente su área, dejando mayor espacio en la vertical para los dos cores de más (los superiores).

Los cuatro núcleos centrales se mantienen invariados, así como la disposición de las dos controladoras de memoria (en la parte superior) aunque algo más compactas.

Se observa también que ha crecido en anchura el tamaño del uncore para poder así reducir su dimensión vertical.

Como vemos su superficie total se incrementa moderadamente, sobre los 300 mm2, aunque superará a la de Intel Nehalem quad core (unos 265 mm2).

Actualizado, imágenes de alta resolución del die de Istambul:

Fotografías cortesía de AMD.unprocessed en Flickr.

3464778308_9956d2736b_o[1]Pulsa aquí para ampliar.

3463961733_3078324a98_o[1] Pulsa aquí para ampliar.

En resumen, un as en la manga de un AMD que está siguiendo la mejor estrategia de la mano de Dirk Meyer, un dirigente eminentemente técnico con grandes conocimientos del diseño de procesadores, que fue jefe de diseño del exitoso procesador Athlon, al frente de la segunda compañía del mundo x86, AMD.

viernes, 21 de noviembre de 2008

AMD Phenom II. Actualizado - LowLevelHardware

En poco más de un mes, en enero de 2009, AMD empezará a comercializar los AMD Phenom II basados en el core Shanghai de 45 nm y 6 MB de caché L3.

amd_02[1]

En un principio saldrán a la luz las versiones AM2+ para memoria dual DDR2 1066 compatibles con las actuales placas base y más adelante los AM3 para DDR3.

Shanghai

Con Shanghai, AMD fabrica el procesador que habría deseado sacar al mercado a finales de 2007. El tamaño de caché L3 de Barcelona (Phenom 65 nm) es, como todos sabéis, insuficiente para el software actual.

amd_analyst_day_banner

Más todavía, Barcelona tiene una grave carencia de ancho de banda de caché L3, tanto que ahoga sus prestaciones. Esto es debido al pequeño ancho del bus L2-L3 (128 bit bidireccional)  y a su baja frecuencia (1.8 GHz y 2 GHz en los Phenom actuales).

1237333[1]

En los nuevos Phenom II habrá modelos (como el 940 BE) que contarán con una frecuencia del Uncore de 2.2 GHz, lo que permitirá mayores velocidades de su L3 y menores latencias.

El overclock, con refrigeración convencional, se extenderá hasta los 4 GHz y con medios más exóticos rondará los 5 GHz hasta los casi 6 GHz con LN2 según pruebas realizadas el día 13 en el AMD Financial Analyst Day con chips stepping C2-H, un stepping inferior al que tendremos en retail en Enero.

1237334[1]

En términos sencillos, una L3 de gran tamaño, ayuda sobretodo en casos de acceso aleatorio a datos, proceso de enteros (ofimática, compresión y descompresión de ficheros, ...) y menos en situaciones de coma flotante y streaming (vídeo).

1237344[1]

En valores absolutos ni Intel ni AMD están satisfechos con sus tamaños presentes de caché por núcleo. Tamaño de LLC (Last Level Cache) por núcleo en procesadores actuales:

  • Core 2 Penryn 45nm: 3 MB por core
  • Core i7 45 nm: 2 MB por core
  • AMD Barcelona 65 nm: 1 MB por core (512 KB+ 512 KB)
  • AMD Shanghai 45 nm: 2 MB por core (512 KB + 1536 KB)

Los arquitectos de CPU consideran estos valores insuficientes y esperan a los 32 nm para poder implantar en sus diseños L3s de tamaños más eficientes.

Recordar que doblar el tamaño de una caché multiplica su tasa de acierto por 1.41 (raíz cuadrada de 2) y más aciertos de caché significan menos accesos a memoria con su dilatada latencia de 150 - 200 ciclos.

1237345[1]

En Q1 2009  AMD lanzará la plataforma AM3 con dual channel DDR3, que convivirá con el actual AM2+. Los modelos acabados en 5 corresponden a AM3.

1237350[1]

Y será ya en el nodo de 32 nm cuando AMD lance el six-core nativo Orochi (antes conocido como Istambul) con una L3 de más de 6 MB y yo creo que más de 8 MB (aunque depende de la geometría final del diseño) y de la densidad de la L3 de AMd en 32 nm.

amd_roadmap_2008_2011

Y todo esto nos lleva a la reestructuración total de AMD debido a sus problemas financieros. Recordemos que se desprende de sus fábricas de semiconductores y funda junto a otros grupos inversores The Foundry Company, que será la que desde ahora se ocupará de la fabricación en sí de los diseños de AMD.

Para más información ver este artículo pasado en ProfessionalSAT.

AMD_manuf

Aquí podemos ver el roadmap para 2009 - 2010 de fabricación de The foundry Company. Esperemos que este cambio estratégico sea beneficioso y AMD pueda centrarse en el diseño puro de procesadores.

AMD_manufB

La división gráfica de AMD, ATI, podrá acceder también a recursos de The foundry Company, aunque siempre en proceso Bulk o proceso general.

 amd_phenom_2_logo

En resumen, buenas expectativas para los Phenom II que esperemos se materialicen en Enero. Según AMD, en el diseño de este procesador han puesto énfasis en el ahorro energético y la baja disipación térmica y en la optimización de los puntos que hacían de Barcelona un mediocre overclocker.

Post scriptum:

Un AMD Phenom II 940BE a 3 GHz tendrá prestaciones similares a un Phenom actual a unos 3.5 - 3.6 GHz. En Fritz Chess Benchmark espero índices sobre los  8500 - 9000 puntos. Es decir, sobre la velocidad de un C2Q 9450 o 9550, lo cual para AMD es todo un salto en prestaciones (un Phenom 9950BE obtiene unos 6100 puntos).

jueves, 17 de julio de 2008

AMD contraataca

AMD, frente a la amenaza del Intel Nehalem, prepara una ofensiva basada en su mayor ventaja competitiva frente a Intel: su menor superficie y número de transistores por núcleo.

g34

Este será el nuevo socket G34 dotado de cuatro canales de DDR3 hasta 1600 MHz para un ancho de banda agregado de 51,2 GB/s (!!) cuatro enlaces HT3, de ahí el masivo número de pines.

El nuevo roadmap de AMD es una evolución del anterior de Mayo de este año.

Roadmap de AMD Mayo 2008. Fuente: AMD.

La idea actual de AMD es atacar a su rival Intel con una de sus ventajas competitivas: el pequeño tamaño de los núcleos de procesamiento (cores) de sus procesadores K10 comparado con los cores de los Penryn y más todavía con los masivos núcleos de Nehalem con SMT.

En el anterior roadmap AMD eliminó el octacore nativo monolítico y el sucesor quadcore de Shanghai, el procesador Montreal con 1 MB L2 por núcleo.

En Q4 2008 AMD presentará el die shrink del procesador Barcelona K10 en 45 nm, Shanghai:

znlejm65[1]

El procesador Intel Nehalem, previsto para Q4 2008, la competencia directa de Shanghai y sus derivativas:

En 2009 AMD prevé:

  • Aumentar la frecuencia de Shanghai 45nm, lanzado en Q4 2008.
  • En Q3 2009 lanzar Istambul 45 nm, un 6 core monolítico con 6 MB de L3 igual que Shanghai  Memoria DDR2 dual channel.
  • Istambul será un procesador basado en Shanghai con dos núcleos más, para un total de 6. Mantendrá todas las demás características del anterior.

En 2010 los planes de AMD incluyen:

  • Sao-Paulo 6 core 45 nm, un 6 core monolítico evolución de Istambul con 6 MB L3, soporte dual channel DDR3, Probe filter, 4 enlaces HT3.
  • Magni-Cours, un dual-hexa core compuesto por dos dies Istambul y 6 + 6 MB de L3 y soporte DDR3, Probe filter, 4 enlaces HT3. La memoria serán cuatro canales de DDR3.
  • Un dual-quad core compuesto de dos dies Shanghai con las mismas características que Magni-Cours.

AMD despeja algunas dudas planteadas anteriormente (extraído de http://lowlevelhardware.blogspot.com/2008/05/nuevo-roadmap-de-amd.html):

"El 12-núcleos Magni-Cours contará con un Probe filter para evitar en parte el tráfico de coherencia de cachés entre las dos L3 de 6 MB de dos los dies de 6 núcleos. Me gustaría saber si contará con dos o cuatro controladoras de DDR3, doce núcleos son demasiados para únicamente dos canales pese a las altísimas frecuencias de DDR3."

Cada die hexacore de Magni-Cours tendrá dos controladoras DDR3 independientes (unganged), para un total de cuatro canales, la arquitectura de memoria será NUMA.

En los procesadores de 8 y 12 núcleos, que serán MCMs compuestos respectivamente por dos dies de 4 y 6 núcleos, AMD utilizará enlaces HT3 para la comunicación entre los dos dies y cada uno contará con dos canales de DDR3.

Probablemente y a igualdad de proceso de fabricación (en 45 nm) AMD será capaz de integrar más núcleos para un mismo tamaño final de silicio, lo que le otorgará una ventaja competitiva sobre Intel.

Esto hará de 2009 y 2010 una época interesante. Podemos decir que AMD va a evolucionar su arquitectura dejando invariantes sus núcleos de procesamiento.

En esencia los núcleos de Shanghai serán iguales a los del actual K10 Barcelona 65 nm y mucho me temo que en 2010 AMD seguirá con la misma política y en sus diseños mantendrá estos cores.

La evolución se centrará en:

  • Aumentar el número de núcleos.
  • Incrementar la frecuencia.
  • Aumentar el ancho de banda (paso a DDR3).
  • Crear MCMs como el Pentium D o el Core2Quad basados en CPUs ya existentes (Magni-Cours).
  • Activar el HT3 y aumentar su número hasta 4 por procesador.

En resumen, los planes de AMD se me antojan los más razonables en la situación actual. AMD debe luchar con Intel de la manera más eficiente con los recursos a su disposición y un hexacore derivado de Shanghai y de ahí un MCM de 12 núcleos es un desarrollo sencillo para la marca con base en Dresden, Alemania.

MCM: multi Chip module.

Etiquetas de Technorati: ,,

sábado, 10 de mayo de 2008

El nuevo roadmap de AMD, Mayo 2008.

Se veía venir: cambio de planes para el diseñador y fabricante de procesadores con base en Alemania. AMD ha reestructurado su roadmap, retrasando la salida a la luz de los núcleos sucesores del K10 quadcore sustituyéndolos por derivativas del core Shanghai de 45nm.
.
Whitepaper de AMD sobre el proceso de 45 nm.
.

Actual roadmap de AMD. Mayo 2008. Fuente: AMD.


Novedades más importantes del último roadmap:

  • AMD elimina el procesador sustituto de Shanghai, Montreal, que iba a contar con 1 MB de L2 por núcleo (Shanghai cuenta con 512 KB L2 por núcleo).
  • Reposiciona Shanghai para finales del 4º cuatrimestre de 2008 (inicialmente estaba programado para Q2 2008).
  • Se eliminan los octacores monolíticos (un die, ocho núcleos) dando paso a un hexacore nativo llamado Istambul para 3Q 2009 con soporte DDR2 y la misma arquitectura y cachés que Shanghai (6 MB L3).
  • En 2010 AMD propone un dual-hexacore llamado Magni-Cours compuesto por dos dies Istambul y 6 + 6 MB de L3 y soporte DDR3, Probe filter, 4 enlaces HT3.


Anterior roadmap de AMD. Diciembre 2007. Fuente AMD.



La desaparición de Montreal quadcore en mi opinión no es significativa, pues no iba a aportar demasiado en el terreno prestacional y nada en cuanto a arquitectura. Más lamento la pérdida del octacore nativo (un solo die) con 12 MB L3 unificada y 1 MB por núcleo. AMD está dejando el camino peligrosamente despejado al procesador Intel Nehalem.

.
El 12-núcleos Magni-Cours contará con un Probe filter para evitar en parte el tráfico de coherencia de cachés entre las dos L3 de 6 MB de dos los dies de 6 núcleos. Me gustaría saber si contará con dos o cuatro controladoras de DDR3, doce núcleos son demasiados para únicamente dos canales pese a las altísimas frecuencias de DDR3.

.
En cuanto al segmento de sobremesa, no nos depara novedades en 2008. A principios de 2009 llegará Suzuka, un Shanghai (4 núcleos) con soporte DDR3 y 6 MB L3 con velocidades de reloj en torno alos 3 GHz.
.

Die de Shanghai quadcore 45 nm. Fuente AMD.
.

Para más información acerca de los planes futuros de AMD e Intel recomiendo estos enlaces a artículos de esta misma página:

Por cierto, en ningún lugar se cita la transición a 32 nm, y eso que el roadmap se adentra en 2010. En esos momentos Intel estará de lleno en los 32 nm con Nehalem-c y la nueva arquitectura Gesher que en 2011 se prevee migre a los 22nm.



Roadmap de Intel hasta 2012.