2장


SMS 1.5 버그

이 장에는 UltraSPARC IV+ 프로세서를 지원하는 SMS 패치에서 수정된 버그 뿐만 아니라 알려진 SMS 1.5 버그에 대한 정보가 들어 있습니다. 이 장에서는 다음 절에 대해 설명합니다.


본 업데이트의 버그 수정 사항

이 절에서는 SMS 1.5 소프트웨어의 버그 및 UltraSPARC IV+ 프로세서를 지원하는 SMS 패치에서 수정된 관련 버그를 나열합니다.



참고 - UltraSPARC IV+ 프로세서 지원을 위해 패치 120648-02가 필요합니다.



UltraSPARC IV+ CPU 오류 처리 개선(CR ID 6257778)

패치 120843-01은 UltraSPARC IV+ 프로세서를 포함하도록 OpenBoottrademark PROM의 오류 처리 및 복구 기능을 향상시킵니다.

prtdiag는 C5 슬롯에 대한 잘못된 버스 주파수를 표시함(CR ID 6286277)

카드를 슬롯 1 (c5v0)에 핫플러그하고 시스템을 재부팅한 후, prtdiag는 점유된 슬롯에 대한 올바른 버스 주파수를 표시하지만 다른 빈 슬롯의 버스 주파수 대해 잘못된 보고를 합니다. 이는 패치 120843-01에서 해결되었습니다.

"PCI IOC ECC Tests" 실패 - 164 또는 그 이상의 이중 코어 UltraSPARC IV+를 갖춘 Starcat(CR ID 6255743)

이중 코어 UltraSPARC IV+ 보드가 설치된 Sun Fire E25K/E20K 시스템에서 lpost는 진단 레벨 64, 96 또는 127에 실패할 수 있습니다. 오류 발생 시, lpost는 다음 오류 메시지를 반환합니다.


{SB03/P0/C1} ERROR: TEST=PCI IOC Ecc Tests,SUBTEST=PCI IOC ECC 

 

패치 120648-02는 이 문제를 해결합니다.

1500 MHz의 UltraSPARC IV+ GA를 지원하도록 hpost를 수정함(CR ID 6270911)

SMS 1.5에서 hpost는 UltraSPARC IV+ 보드를 지원하기 위해 수정되어야 합니다. 패치 120648-02는 이를 수정합니다.

Solaris에서 재부팅시 hpost -q가 "Out Of Config on Timeout" 에 실패함(CR ID 6324035)

UltraSPARC IV+ 보드에서 도메인을 재부팅할 경우 UltraSPARC IV+ 보드상의 Solaris 9 4/04 OS를 실행 중인 Sun Fire E25K/E20K 시스템은 간혹 시간 초과됩니다. 시스템이 다음 오류 메시지를 반환합니다.

 


Proccore SB0/P0/C0 timed out on test Domain Advanced Tests id=0x6F. Test Failed.FAIL Proccore SB0/P0/C0: test_seq_cwd(): failed out of config on timeout
 
(Timeout Secs Given: 30)

 

패치 120648-02는 이 문제를 해결합니다.

UltraSPARC IV+ 버전 2.1 Early Lots가 내부 전용이어야 함(CR 6292571)

고객 시스템용으로 출시된 첫번째 UltraSPARC IV+ 프로세서는 버전 2.1.1입니다. 패치 120648-02는 고객용으로 부적합하고 구성 외의 것에 오류가 있는 이전 버전 2.1 프로세서를 감지하기 위해 POST를 수정합니다.

버전 2.1과 2.1.1을 모두 2.1인 MaskID로 구별할 수 없음을 주의하십시오. POST는 다른 전기적으로 판독 가능한 정보를 기반으로 구별합니다.

UltraSPARC IV+: PN 1500 MHz의 marginvoltage vcore 마이너스가 정확한 여분의 전압을 표시하지 않음(CR 6288445)

이 버그는 1500 MHz UltraSPARC IV+ 보드에만 적용됩니다. 간혹, -m-1 옵션과 함께 marginvoltage 명령을 사용하면 잘못된 값을 반환합니다. 몇 초 후 해당 명령을 다시 실행하면 올바른 값을 반환합니다. 이는 패치 120789-01에서 해결되었습니다.

UltraSPARC IV+: UltraSPARC IV+ vcore에 대한 marginvoltage 출력 형식이 올바르지 않음(CR 6290143)

이 버그는 1500 MHz UltraSPARC IV+ 보드에만 적용됩니다. 사용자가marginvoltage 명령과 함께 -m-1 또는 -m+1 옵션을 사용하면 시스템이 잘못된 출력 형식을 반환합니다. 예를 들어, -m+1 명령을 사용하면 UltraSPARC IV+ 보드에서 Nom+3% (voltage) 대신에 Nom (voltage)의 변경값을 반환하지만 UltraSPARC IV 및 UltraSPARC III 보드에서는 올바른 출력을 반환합니다. 패치 120789-01은 이 문제를 해결합니다.

RFE: AVL-FS2 (Starcat): 새 UltraSPARC IV+ CPU 오류의 진단 제공(CR ID 6277467)

UltraSPARC IV+ 프로세서에는 UltraSPARC IV 및 III+ 프로세서 기능 외에도 추가적인 오류 감지 및 RAS 기능이 포함되어 있습니다. 이 CR은 UltraSPARC IV+가 보고할 수 있는 새로운 오류를 진단하는 가용성 기능의 개선 사항에 대해 설명합니다. 이 개선 사항으로 Availability는 Solaris 9 도메인에 대한 비치명적 오류와 모든 프로세서 유형에 대한 모든 치명적 오류를 진단합니다. 패치 120827-01은 이 개선 사항을 제공합니다.

SC CPU는 프로세서 공격을 발생하지 않도록 비 FMA 도메인의 L3/L2 캐시 오류를 처리해야 함(CR ID 6302265)

UltraSPARC IV+ 칩에는 세 가지 레벨의 캐시가 있습니다. 레벨 2와 3은 데이터 캐시를 참조하고 레벨 2는 프로세서 내부에 있으며 레벨 3은 프로세서 외부에 있습니다.

때때로 오류는 역기능으로 추가적인 오류를 생성합니다. 데이터 캐시의 레벨에서 오류가 발생할 때 Availability 소프트웨어는 오류의 근본적인 원인을 진단하고 역기능 오류(또는 오류)를 제거합니다. 이는 진단 가능성을 지원할 뿐만 아니라 역기능 오류로 인해 희생 구성 요소가 공격받지 않음을 확인합니다. 패치 120827-01은 이 조건을 해결합니다.

연속하여 Dstop 이벤트를 전송하는 hwad는 지연과 잘못된 dsmd ASR의 원인이 됨(CR ID 6302843)

여러 도메인을 실행 중인 시스템에서, dsmd가 오류 상태 후 도메인을 복구하기 전에 hwad는 실행 중인 도메인 각각에 dstop (도메인 중지) 이벤트를 실행해야 합니다. 이러한 dstop가 연속으로 실행되어서 초기 dstop가 실행된 시간과 모든 도메인이 복구되었을 때의 시간 사이의 지연이 발생했습니다.

패치 120789-01은 dstop이 개별 스레드를 사용하는 병렬식 도메인에 지금 실행되어 지연이 발생하지 않도록 이 문제를 해결합니다.

CPU 이벤트에 대한 SERD Tunable은 S9U8, S10U1/FMA와 SMS 1.5 사이의 일관성이 없음(CR ID 6309365)

UltraSPARC IV+ 프로세서의 추가적인 캐시 레벨을 갖으려면 SC 측 SERD (Soft Error Rate Discriminator)에는 Solaris 9 도메인의 기존 임계값에 정렬하도록 다른 임계값이 필요합니다. 조정없이는 도메인은 SC 측을 진단하기 전에 프로세서를 오프라인하며 프로세서의 상태는 올바르게 업데이트되지 않습니다.

패치 120827-01은 두 운영 체제 버전과 프로세서의 지원되는 모든 유형에 대한 SMS 1.5 소프트웨어 사이의 일관성이 있도록 이 문제를 해결합니다.


SMS 1.5 소프트웨어의 알려진 버그

이 절에서는 SMS 1.5에 가장 큰 영향을 미치는 중요 버그 정보를 요약합니다.

NetConnect에 대한 FMA 이벤트 보고가 수정된 섀시 일련 번호를 선택하지 않음(CR ID 5052078)

setcsn 명령을 사용하여 Sun Fire 최고급 서버의 섀시 일련 번호(CSN)를 SC에 설정하는 작업을 하지 않은 채로 서버를 실행하는 경우, 도메인 정지(Dstop)의 이벤트 보고에 있는 일련 번호가 비어있으면 FMA(Fault Management Architecture) 보고가 NetConnect로 전송됩니다.

문제 해결: setcsn 명령을 사용하여 섀시 일련 번호를 설정한 후 SMS를 재시작합니다. CSN이 이벤트 보고에 나타나게 하려면 SMS를 재시작해야 합니다.

SC에 섀시 일련 번호를 설정하는 방법에 대한 자세한 내용은 System Management Services(SMS) 1.5 설치 안내서를 참조하십시오.

ndd/dev/scman man_pathgroups_report 출력에 설명이 필요함(CR ID 6252771)

ndd(1M) 명령은 특정 장치 드라이버 매개변수를 읽고 쓰기 위하여 루트로서 실행될 수 있습니다. scman(7D)(ndd/dev/scman)는 Management(MAN) Network의 Sun Fire E25K/E20K SC 측을 관리하며 ndd(1M) 명령을 지원합니다.

scman(7D)의 man_pathgroups_report 매개변수가 올바르게 해석되지 않은 경우, 소프트웨어로 인해 오류가 발생할 때, 심각한 하드웨어 오류가 발생한 것처럼 보일 수 있습니다. 즉, 문제의 근본적인 원인을 찾으려면 하드웨어 스와핑을 해야 한다는 잘못된 결과를 내릴 수 있게 됩니다.

man_pathgroups_report 매개변수를 지정하면 다음과 같은 출력 결과를 확인할 수 있습니다.


# ndd /dev/scman man_pathgroups_report
MAN Pathgroup report: (* == error)
Interface       Destination             Active Path     Alternate Paths
----------------------------------------------------------------
scman1          Other SSC               eri0 eri0 exp 0, hme1 exp 0 *

 

마지막 줄의 별표(*)는 "hme1 물리적 인터페이스가 마지막으로 사용된 시간에 오류 발생"을 나타냅니다. 기록상, 대부분의 오류는 하드웨어가 아닌 소프트웨어에 의해 발생합니다.

MAN 네트워크 집단이 더 이상 "고동" 메시지에 응답하지 않거나 잘못된 dlpi(7P) 상태 전환이 있을 경우, 소프트웨어는 오류를 발생시킵니다. 루트로서 다음 명령을 실행하여 이전의 경우를 반복적으로 생성할 수 있습니다(위와 같은 정확한 출력이 나타난다고 가정).


# ndd -set /dev/scman man_set_active_path '1 0 1'

 

해당 명령을 실행하는 SC(예: SC0)의 경우, 활성 경로가 eri0에서 hme1로 전환됩니다. 잠시 동안 SC1은 물리적 인터페이스 eri0의 패킷을 계속 전송하고 SC0은 hme1의 패킷을 전송하게 됩니다. 잠시 후, 두 SC는 동일한 인터페이스를 사용하여 동기화 및 통신을 하게 됩니다. 그러나 각 SC에 별표가 표시되어 오류가 발생했던 마지막 인터페이스를 보여줍니다. 이 경우, 해당 오류는 소프트웨어로 인해 발생합니다(해당 오류는 "고동" 메시지 시퀀스에 대해 응답하지 않음). 이것은 치명적인 하드웨어 오류가 아닙니다.

만약 치명적인 하드웨어 오류가 상주하고 있다면 출력 결과에는 별표가 표시되었을 것입니다. 그러나, 별표가 표시되는 원인이 전적으로 하드웨어에 있다고 가정해서는 안됩니다.


SMS 1.5 문서 정오표

이 절에서는 SMS 1.5 매뉴얼 페이지 및 문서의 오류를 요약합니다.

marginvoltage(1M)

marginvoltage 매뉴얼 페이지는 다음을 설명합니다.

여분 설정은 다음의 전원 주기에 지속적이지 않습니다.

해당 문장은 코어 전압에 대해서만 true입니다. 다른 모든 설정은 지속적입니다.

rcfgadm(1M)

CR ID 4945049

rcfgadm(1M) man 페이지의 참고 사항은 다음과 같이 나타나야 합니다.

rcfgadm 명령이 실패하면, 보드는 원래 상태로 복귀하지 않습니다. dxs 또는 dcs 오류 메시지가 도메인에 기록됩니다. 해당 오류가 복구될 수 있는 경우, 명령을 다시 시도할 수 있습니다.

single-step bullet해당 도메인에서 Solaris 8 또는 Solaris 9 OS를 실행 중인 경우, 다음을 확인합니다.

1. 해당 명령을 다시 시도하기 전에, 도메인의 /etc/inetd.conf에 다음 dcs 항목이 존재하는지, 해당 항목이 비활성화되지는 않았는지 확인합니다.


sun-dr stream tcp wait root /usr/lib/dcs dcs
sun-dr stream tcp6 wait root /usr/lib/dcs dcs

 

2. 해당 오류가 복구 가능한 경우, 보드를 사용하려면 도메인을 재부팅해야 합니다.

single-step bullet도메인에서 Solaris 10 OS를 실행 중인 경우, 이제 dcs는 SMF (Service Management Facility)의 일부입니다. 다음 단계를 수행하십시오.

1. 루트로 로그인했는지 확인하십시오.

2. 도메인의 시스템 프롬프트에 다음 명령을 입력하십시오.


# inetadm | grep dcs
 
disabled disabled svc: /platform/sun4u/dcs: default

 

3. dcs가 위의 예와 같이 비활성화될 경우, 다음 명령을 입력하여 활성화합니다.


# svcadm enable svc:/platform/sun4u/dcs:tcp 

 

testemail(1M)

CR ID 5047803

testemail(1M) man 페이지에 있는 -c 옵션의 설명이 다음과 같이 나타나야 합니다.

testemail은 오류 클래스 또는 컴마로 분리된 오류 클래스의 목록을 사용하여 이벤트를 생성합니다.

-c 오류_클래스, 오류_클래스, 오류_클래스

올바른 오류 클래스의 예는 /etc/opt/SUNWSMS/config/SF15000.dict 파일에 포함되어 있습니다.

CR ID 6221370

설명 절의 참고 사항은 다음과 같이 나타나야 합니다.

Ecache 자원을 사용하여 testemail을 호출할 때에는 Ecache가 포함된 시스템 보드의 전원이 켜져있는지 확인해야 합니다. 그러지 않으면, testemail의 호출에 오류가 발생하고 어떤 전자 우편도 생성되지 않습니다.

System Management Services(SMS) 1.5 Administrator Guide

1장, 5페이지:

VCMON의 설명은 다음과 같이 나타나야 합니다.

SMS 소프트웨어에 전압 코어 모니터링 매개변수(VCMON)가 추가되었습니다. VCMON가 활성화되면 프로세서의 전압 변화 또는 편류를 모니터링합니다. VCMON에서 전압 상승을 감지하면(보통 소켓 연결 문제점을 나타냄), 사용자에게 FMA 이벤트를 알리고 해당 프로세서의 구성 요소 상태(CHS)를 고장으로 표시합니다.

10장 190페이지:

showboards 명령의 설명에서 -a 옵션은 -v로 나타나야 합니다.

showenvironment 명령에서 "장치" 범주는 삭제되어야 합니다.

11장 201페이지:

첫번째 예는 다음과 같이 나타나야 합니다.

showlogs -d 도메인_표시기 -p s

두번째 예는 다음과 같이 나타나야 합니다.

showlogs -d 도메인_표시기 -p c

247페이지의 부록 A:

다음 명령이 추가되어야 합니다.

smsinstall: SMS 소프트웨어를 설치합니다.

smsupgrade: 시스템에 설치된 기존의 SMS 소프트웨어를 업그레이드합니다.

부록 B(CR 6227544, 4943474):

오류 코드 11300과 50000 사이에 다음과 같은 오류 메시지 범주가 추가되어야 합니다.

11500-11699: EFHD 메시지 전용

11700-11899: ELAD 메시지 전용

11900-12099: ERD 메시지 전용

12100-12299: Event Utilities 메시지 전용

12300-12499: Wcapp 메시지 전용

12500-12699: FRUID 관련 메시지 전용

12700-12799: EBD 메시지 전용

System Management Services(SMS) 1.5 설치 안내서

5페이지:

하드웨어 호환성 표(표 2-1)는 도메인과 시스템 제어기(SC)에 대한 Solaris 8의 첫번째 지원 버전으로 Solaris 8 2/02를 나열해야 합니다.

이 표에는 인쇄상의 오류가 포함되어 있습니다. 1.65 MHz UltraSPARC 프로세서에 관련됩니다. 올바른 속도는 1.5 MHz여야 합니다.

SMS 1.5는 설치 안내서에 설명된 4 GB 크기 및 2 GB의 /swap 파티션 크기를 지원합니다. SMS 1.5에 대한 권장 파티션 크기는 다음과 같습니다.


0

/ (root)

8 GB

1

swap

4 GB

4

OLDS/LVM 데이터베이스(metadb)

32 MB

5

OLDS/LVM 데이터베이스(metadb)

 

32 MB

7

/export/install

나머지 부분


 

16페이지:

장애 조치를 비활성화하기 전에 SMS를 시작 및 실행 중이어야 합니다.

17페이지:

Java 버전 1.2.2가 설치되었는지 확인하려면 시스템 프롬프트에 명령 java -version을 입력합니다.

3단계가 다음과 같이 나타나야 합니다.

smsupgrade 명령을 실행하여 SMS를 다시 설치합니다.

30페이지:

섀시 일련 번호(CSN)을 기록하기 전에 SMS를 시작 및 실행 중이어야 합니다.

39페이지:

예는 sc1이 아닌 sc0을 표시해야 합니다.

40페이지:

flashupdate 예에 -f 스위치가 없습니다. 다음과 같이 나타나야 합니다.

-f /opt/SUNWsms/hostobjs/sgcpu.flash

44페이지:

2단계 다음에는 이 절차의 3단계가 있어야 합니다. 3단계가 다음과 같이 나타나야 합니다.

Solaris OS를 업그레이드합니다. 17페이지의 "SC에 Solaris OS 설치 또는 업그레이드"를 참조하십시오.

3단계 다음에는 4단계가 있어야 하며 다음과 같이 나타나야 합니다.

주요 OS 업그레이드 후에 SMS를 다시 설치하려면 smsupgrade를 실행하십시오(34페이지 참조). 위를 수행하지 않으려면 다음 단계로 진행하고 SMS 구성을 복원하십시오.

제목 "SMS 소프트웨어 재설치"는 "SMS 구성 복원"과 같이 나타나야 합니다.