/[suikacvs]/markup/html/whatpm/Whatpm/HTML/Tokenizer.pm

Diff of /markup/html/whatpm/Whatpm/HTML/Tokenizer.pm

Parent Directory | Revision Log | View Patch Patch

-revision 1.11 by wakaba,
Wed Oct 15 10:50:38 2008 UTC
+revision 1.13 by wakaba,
Thu Oct 16 03:39:57 2008 UTC
 Line 15 
 BEGIN {
      CHARACTER_TOKEN
      PI_TOKEN
      ABORT_TOKEN
+     END_OF_DOCTYPE_TOKEN
    );
    our %EXPORT_TAGS = (
-Line 27 
 BEGIN {
+Line 28 
 BEGIN {
        CHARACTER_TOKEN
        PI_TOKEN
        ABORT_TOKEN
+       END_OF_DOCTYPE_TOKEN
      )],
    );
  }
+ ## NOTE: Differences from the XML5 draft are marked as "XML5:".
  ## Token types
- sub DOCTYPE_TOKEN () { 1 }
+ sub DOCTYPE_TOKEN () { 1 } ## XML5: No DOCTYPE token.
  sub COMMENT_TOKEN () { 2 }
  sub START_TAG_TOKEN () { 3 }
  sub END_TAG_TOKEN () { 4 }
  sub END_OF_FILE_TOKEN () { 5 }
  sub CHARACTER_TOKEN () { 6 }
- sub PI_TOKEN () { 7 } # XML5
+ sub PI_TOKEN () { 7 } ## NOTE: XML only.
- sub ABORT_TOKEN () { 8 } # Not a token actually
+ sub ABORT_TOKEN () { 8 } ## NOTE: For internal processing.
+ sub END_OF_DOCTYPE_TOKEN () { 9 } ## NOTE: XML only
+ ## XML5: XML5 has "empty tag token".  In this implementation, it is
+ ## represented as a start tag token with $self->{self_closing} flag
+ ## set to true.
+ ## XML5: XML5 has "short end tag token".  In this implementation, it
+ ## is represented as an end tag token with $token->{tag_name} flag set
+ ## to an empty string.
  package Whatpm::HTML;
-Line 114 
 sub HEXREF_HEX_STATE () { 48 }
+Line 127 
 sub HEXREF_HEX_STATE () { 48 }
  sub ENTITY_NAME_STATE () { 49 }
  sub PCDATA_STATE () { 50 } # "data state" in the spec
- ## XML states
+ ## XML-only states
  sub PI_STATE () { 51 }
  sub PI_TARGET_STATE () { 52 }
  sub PI_TARGET_AFTER_STATE () { 53 }
  sub PI_DATA_STATE () { 54 }
  sub PI_AFTER_STATE () { 55 }
  sub PI_DATA_AFTER_STATE () { 56 }
+ sub DOCTYPE_INTERNAL_SUBSET_STATE () { 57 }
+ sub DOCTYPE_INTERNAL_SUBSET_AFTER_STATE () { 58 }
+ sub DOCTYPE_TAG_STATE () { 59 }
+ sub BOGUS_DOCTYPE_INTERNAL_SUBSET_AFTER_STATE () { 60 }
  ## Tree constructor state constants (see Whatpm::HTML for the full
  ## list and descriptions)
-Line 186 
 sub _initialize_tokenizer ($) {
+Line 203 
 sub _initialize_tokenizer ($) {
    #$self->{is_xml} (if XML)
    $self->{state} = DATA_STATE; # MUST
-   $self->{s_kwd} = ''; # state keyword
+   $self->{s_kwd} = ''; # Data state keyword
+   #$self->{kwd} = ''; # State-dependent keyword; initialized when used
    #$self->{entity__value}; # initialized when used
    #$self->{entity__match}; # initialized when used
    $self->{content_model} = PCDATA_CONTENT_MODEL; # be
-Line 231 
 sub _initialize_tokenizer ($) {
+Line 249 
 sub _initialize_tokenizer ($) {
  ##   ->{data} (COMMENT_TOKEN, CHARACTER_TOKEN, PI_TOKEN)
  ##   ->{has_reference} == 1 or 0 (CHARACTER_TOKEN)
  ##   ->{last_index} (ELEMENT_TOKEN): Next attribute's index - 1.
+ ##   ->{has_internal_subset} = 1 or 0 (DOCTYPE_TOKEN)
  ## NOTE: The "self-closing flag" is hold as |$self->{self_closing}|.
  ##     |->{self_closing}| is used to save the value of |$self->{self_closing}|
  ##     while the token is pushed back to the stack.
-Line 250 
 my $is_space = {
+Line 270 
 my $is_space = {
 x0009 => 1, # CHARACTER TABULATION (HT)
 x000A => 1, # LINE FEED (LF)
    #0x000B => 0, # LINE TABULATION (VT)
-x000C => 1, # FORM FEED (FF)
+x000C => 1, # FORM FEED (FF) ## XML5: Not a space character.
    #0x000D => 1, # CARRIAGE RETURN (CR)
 x0020 => 1, # SPACE (SP)
  };
-Line 530 
 sub _get_next_token ($) {
+Line 550 
 sub _get_next_token ($) {
            redo A;
          } elsif ($self->{nc} == 0x0021) { # !
-           $self->{s_kwd} = '<' unless $self->{escape};
+           $self->{s_kwd} = $self->{escaped} ? '' : '<';
            #
          } else {
+           $self->{s_kwd} = '';
            #
          }
          ## reconsume
          $self->{state} = DATA_STATE;
-         $self->{s_kwd} = '';
          return  ({type => CHARACTER_TOKEN, data => '<',
                    line => $self->{line_prev},
                    column => $self->{column_prev},
-Line 720 
 sub _get_next_token ($) {
+Line 740 
 sub _get_next_token ($) {
        if ($self->{content_model} & CM_LIMITED_MARKUP) { # RCDATA | CDATA
          if (defined $self->{last_stag_name}) {
            $self->{state} = CDATA_RCDATA_CLOSE_TAG_STATE;
-           $self->{s_kwd} = '';
+           $self->{kwd} = '';
            ## Reconsume.
            redo A;
          } else {
-Line 873 
 sub _get_next_token ($) {
+Line 893 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == CDATA_RCDATA_CLOSE_TAG_STATE) {
-       my $ch = substr $self->{last_stag_name}, length $self->{s_kwd}, 1;
+       my $ch = substr $self->{last_stag_name}, length $self->{kwd}, 1;
        if (length $ch) {
          my $CH = $ch;
          $ch =~ tr/a-z/A-Z/;
-Line 881 
 sub _get_next_token ($) {
+Line 901 
 sub _get_next_token ($) {
          if ($nch eq $ch or $nch eq $CH) {
            ## Stay in the state.
-           $self->{s_kwd} .= $nch;
+           $self->{kwd} .= $nch;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 900 
 sub _get_next_token ($) {
+Line 920 
 sub _get_next_token ($) {
            $self->{s_kwd} = '';
            ## Reconsume.
            return  ({type => CHARACTER_TOKEN,
-                     data => '</' . $self->{s_kwd},
+                     data => '</' . $self->{kwd},
                      line => $self->{line_prev},
-                     column => $self->{column_prev} - 1 - length $self->{s_kwd},
+                     column => $self->{column_prev} - 1 - length $self->{kwd},
                     });
            redo A;
          }
-Line 918 
 sub _get_next_token ($) {
+Line 938 
 sub _get_next_token ($) {
            $self->{state} = DATA_STATE;
            $self->{s_kwd} = '';
            return  ({type => CHARACTER_TOKEN,
-                     data => '</' . $self->{s_kwd},
+                     data => '</' . $self->{kwd},
                      line => $self->{line_prev},
-                     column => $self->{column_prev} - 1 - length $self->{s_kwd},
+                     column => $self->{column_prev} - 1 - length $self->{kwd},
                     });
            redo A;
          } else {
-Line 929 
 sub _get_next_token ($) {
+Line 949 
 sub _get_next_token ($) {
                = {type => END_TAG_TOKEN,
                   tag_name => $self->{last_stag_name},
                   line => $self->{line_prev},
-                  column => $self->{column_prev} - 1 - length $self->{s_kwd}};
+                  column => $self->{column_prev} - 1 - length $self->{kwd}};
            $self->{state} = TAG_NAME_STATE;
            ## Reconsume.
            redo A;
-Line 2168 
 sub _get_next_token ($) {
+Line 2188 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == BOGUS_COMMENT_STATE) {
-       ## (only happen if PCDATA state)
        ## NOTE: Unlike spec's "bogus comment state", this implementation
        ## consumes characters one-by-one basis.
        if ($self->{nc} == 0x003E) { # >
+         if ($self->{in_subset}) {
-         $self->{state} = DATA_STATE;
-         $self->{s_kwd} = '';
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2192 
 sub _get_next_token ($) {
+Line 2215 
 sub _get_next_token ($) {
          return  ($self->{ct}); # comment
          redo A;
        } elsif ($self->{nc} == -1) {
+         if ($self->{in_subset}) {
-         $self->{state} = DATA_STATE;
-         $self->{s_kwd} = '';
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2221 
 sub _get_next_token ($) {
+Line 2249 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == MARKUP_DECLARATION_OPEN_STATE) {
-       ## (only happen if PCDATA state)
+       ## XML5: "Markup declaration state" and "DOCTYPE markup
+       ## declaration state".
        if ($self->{nc} == 0x002D) { # -
-Line 2243 
 sub _get_next_token ($) {
+Line 2272 
 sub _get_next_token ($) {
          ## ASCII case-insensitive.
          $self->{state} = MD_DOCTYPE_STATE;
-         $self->{s_kwd} = chr $self->{nc};
+         $self->{kwd} = chr $self->{nc};
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2262 
 sub _get_next_token ($) {
+Line 2291 
 sub _get_next_token ($) {
                 $self->{nc} == 0x005B) { # [
          $self->{state} = MD_CDATA_STATE;
-         $self->{s_kwd} = '[';
+         $self->{kwd} = '[';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2332 
 sub _get_next_token ($) {
+Line 2361 
 sub _get_next_token ($) {
 x0054, # T
 x0059, # Y
 x0050, # P
-           ]->[length $self->{s_kwd}] or
+           ]->[length $self->{kwd}] or
            $self->{nc} == [
              undef,
 x006F, # o
-Line 2340 
 sub _get_next_token ($) {
+Line 2369 
 sub _get_next_token ($) {
 x0074, # t
 x0079, # y
 x0070, # p
-           ]->[length $self->{s_kwd}]) {
+           ]->[length $self->{kwd}]) {
          ## Stay in the state.
-         $self->{s_kwd} .= chr $self->{nc};
+         $self->{kwd} .= chr $self->{nc};
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2356 
 sub _get_next_token ($) {
+Line 2385 
 sub _get_next_token ($) {
      }
          redo A;
-       } elsif ((length $self->{s_kwd}) == 6 and
+       } elsif ((length $self->{kwd}) == 6 and
                 ($self->{nc} == 0x0045 or # E
                  $self->{nc} == 0x0065)) { # e
-         if ($self->{s_kwd} ne 'DOCTYP') {
+         if ($self->{is_xml} and
+             ($self->{kwd} ne 'DOCTYP' or $self->{nc} == 0x0065)) {
            ## XML5: case-sensitive.
            $self->{parse_error}->(level => $self->{level}->{must}, type => 'lowercase keyword', ## TODO
-Line 2391 
 sub _get_next_token ($) {
+Line 2421 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment',
                          line => $self->{line_prev},
-                         column => $self->{column_prev} - 1 - length $self->{s_kwd});
+                         column => $self->{column_prev} - 1 - length $self->{kwd});
          $self->{state} = BOGUS_COMMENT_STATE;
          ## Reconsume.
          $self->{ct} = {type => COMMENT_TOKEN,
-                                   data => $self->{s_kwd},
+                                   data => $self->{kwd},
                                    line => $self->{line_prev},
-                                   column => $self->{column_prev} - 1 - length $self->{s_kwd},
+                                   column => $self->{column_prev} - 1 - length $self->{kwd},
                                   };
          redo A;
        }
-Line 2408 
 sub _get_next_token ($) {
+Line 2438 
 sub _get_next_token ($) {
              '[CD' => 0x0041, # A
              '[CDA' => 0x0054, # T
              '[CDAT' => 0x0041, # A
-           }->{$self->{s_kwd}}) {
+           }->{$self->{kwd}}) {
          ## Stay in the state.
-         $self->{s_kwd} .= chr $self->{nc};
+         $self->{kwd} .= chr $self->{nc};
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2424 
 sub _get_next_token ($) {
+Line 2454 
 sub _get_next_token ($) {
      }
          redo A;
-       } elsif ($self->{s_kwd} eq '[CDATA' and
+       } elsif ($self->{kwd} eq '[CDATA' and
                 $self->{nc} == 0x005B) { # [
          if ($self->{is_xml} and
              not $self->{tainted} and
-Line 2459 
 sub _get_next_token ($) {
+Line 2489 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment',
                          line => $self->{line_prev},
-                         column => $self->{column_prev} - 1 - length $self->{s_kwd});
+                         column => $self->{column_prev} - 1 - length $self->{kwd});
          $self->{state} = BOGUS_COMMENT_STATE;
          ## Reconsume.
          $self->{ct} = {type => COMMENT_TOKEN,
-                                   data => $self->{s_kwd},
+                                   data => $self->{kwd},
                                    line => $self->{line_prev},
-                                   column => $self->{column_prev} - 1 - length $self->{s_kwd},
+                                   column => $self->{column_prev} - 1 - length $self->{kwd},
                                   };
          redo A;
        }
-Line 2486 
 sub _get_next_token ($) {
+Line 2516 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment');
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
-         $self->{s_kwd} = '';
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2506 
 sub _get_next_token ($) {
+Line 2541 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed comment');
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
-         $self->{s_kwd} = '';
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2550 
 sub _get_next_token ($) {
+Line 2590 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment');
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
-         $self->{s_kwd} = '';
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2570 
 sub _get_next_token ($) {
+Line 2615 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed comment');
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
-         $self->{s_kwd} = '';
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2614 
 sub _get_next_token ($) {
+Line 2664 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed comment');
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
-         $self->{s_kwd} = '';
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2663 
 sub _get_next_token ($) {
+Line 2718 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed comment');
-         $self->{s_kwd} = '';
+         if ($self->{in_subset}) {
-         $self->{state} = DATA_STATE;
-         $self->{s_kwd} = '';
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2692 
 sub _get_next_token ($) {
+Line 2751 
 sub _get_next_token ($) {
        }
      } elsif ($self->{state} == COMMENT_END_STATE) {
        if ($self->{nc} == 0x003E) { # >
+         if ($self->{in_subset}) {
-         $self->{state} = DATA_STATE;
-         $self->{s_kwd} = '';
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2731 
 sub _get_next_token ($) {
+Line 2795 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed comment');
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
-         $self->{s_kwd} = '';
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2779 
 sub _get_next_token ($) {
+Line 2848 
 sub _get_next_token ($) {
          redo A;
        } else {
+         ## XML5: Unless EOF, swith to the bogus comment state.
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space before DOCTYPE name');
          $self->{state} = BEFORE_DOCTYPE_NAME_STATE;
          ## reconsume
          redo A;
        }
      } elsif ($self->{state} == BEFORE_DOCTYPE_NAME_STATE) {
+       ## XML5: "DOCTYPE root name before state".
        if ($is_space->{$self->{nc}}) {
          ## Stay in the state
-Line 2802 
 sub _get_next_token ($) {
+Line 2874 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
+         ## XML5: No parse error.
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'no DOCTYPE name');
          $self->{state} = DATA_STATE;
          $self->{s_kwd} = '';
-Line 2830 
 sub _get_next_token ($) {
+Line 2903 
 sub _get_next_token ($) {
          return  ($self->{ct}); # DOCTYPE (quirks)
          redo A;
+       } elsif ($self->{is_xml} and $self->{nc} == 0x005B) { # [
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no DOCTYPE name');
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # DOCTYPE
+         redo A;
        } else {
          $self->{ct}->{name} = chr $self->{nc};
-Line 2849 
 sub _get_next_token ($) {
+Line 2941 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == DOCTYPE_NAME_STATE) {
- ## ISSUE: Redundant "First," in the spec.
+       ## XML5: "DOCTYPE root name state".
+       ## ISSUE: Redundant "First," in the spec.
        if ($is_space->{$self->{nc}}) {
          $self->{state} = AFTER_DOCTYPE_NAME_STATE;
-Line 2895 
 sub _get_next_token ($) {
+Line 2990 
 sub _get_next_token ($) {
          return  ($self->{ct}); # DOCTYPE
          redo A;
+       } elsif ($self->{is_xml} and $self->{nc} == 0x005B) { # [
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # DOCTYPE
+         redo A;
        } else {
          $self->{ct}->{name}
-Line 2914 
 sub _get_next_token ($) {
+Line 3027 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == AFTER_DOCTYPE_NAME_STATE) {
+       ## XML5: Corresponding to XML5's "DOCTYPE root name after
+       ## state", but implemented differently.
        if ($is_space->{$self->{nc}}) {
          ## Stay in the state
-Line 2961 
 sub _get_next_token ($) {
+Line 3077 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x0050 or # P
                 $self->{nc} == 0x0070) { # p
          $self->{state} = PUBLIC_STATE;
-         $self->{s_kwd} = chr $self->{nc};
+         $self->{kwd} = chr $self->{nc};
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2977 
 sub _get_next_token ($) {
+Line 3094 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x0053 or # S
                 $self->{nc} == 0x0073) { # s
          $self->{state} = SYSTEM_STATE;
-         $self->{s_kwd} = chr $self->{nc};
+         $self->{kwd} = chr $self->{nc};
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{is_xml} and $self->{nc} == 0x005B) { # [
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2990 
 sub _get_next_token ($) {
+Line 3125 
 sub _get_next_token ($) {
        $self->{set_nc}->($self);
      }
+         return  ($self->{ct}); # DOCTYPE
          redo A;
        } else {
-Line 3018 
 sub _get_next_token ($) {
+Line 3154 
 sub _get_next_token ($) {
 x0042, # B
 x004C, # L
 x0049, # I
-           ]->[length $self->{s_kwd}] or
+           ]->[length $self->{kwd}] or
            $self->{nc} == [
              undef,
 x0075, # u
 x0062, # b
 x006C, # l
 x0069, # i
-           ]->[length $self->{s_kwd}]) {
+           ]->[length $self->{kwd}]) {
          ## Stay in the state.
-         $self->{s_kwd} .= chr $self->{nc};
+         $self->{kwd} .= chr $self->{nc};
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3041 
 sub _get_next_token ($) {
+Line 3177 
 sub _get_next_token ($) {
      }
          redo A;
-       } elsif ((length $self->{s_kwd}) == 5 and
+       } elsif ((length $self->{kwd}) == 5 and
                 ($self->{nc} == 0x0043 or # C
                  $self->{nc} == 0x0063)) { # c
+         if ($self->{is_xml} and
+             ($self->{kwd} ne 'PUBLI' or $self->{nc} == 0x0063)) { # c
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'lowercase keyword', ## TODO: type
+                           text => 'PUBLIC',
+                           line => $self->{line_prev},
+                           column => $self->{column_prev} - 4);
+         } else {
+         }
          $self->{state} = BEFORE_DOCTYPE_PUBLIC_IDENTIFIER_STATE;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 3062 
 sub _get_next_token ($) {
+Line 3207 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after DOCTYPE name',
                          line => $self->{line_prev},
-                         column => $self->{column_prev} + 1 - length $self->{s_kwd});
+                         column => $self->{column_prev} + 1 - length $self->{kwd});
          $self->{ct}->{quirks} = 1;
          $self->{state} = BOGUS_DOCTYPE_STATE;
-Line 3077 
 sub _get_next_token ($) {
+Line 3222 
 sub _get_next_token ($) {
 x0053, # S
 x0054, # T
 x0045, # E
-           ]->[length $self->{s_kwd}] or
+           ]->[length $self->{kwd}] or
            $self->{nc} == [
              undef,
 x0079, # y
 x0073, # s
 x0074, # t
 x0065, # e
-           ]->[length $self->{s_kwd}]) {
+           ]->[length $self->{kwd}]) {
          ## Stay in the state.
-         $self->{s_kwd} .= chr $self->{nc};
+         $self->{kwd} .= chr $self->{nc};
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3100 
 sub _get_next_token ($) {
+Line 3245 
 sub _get_next_token ($) {
      }
          redo A;
-       } elsif ((length $self->{s_kwd}) == 5 and
+       } elsif ((length $self->{kwd}) == 5 and
                 ($self->{nc} == 0x004D or # M
                  $self->{nc} == 0x006D)) { # m
+         if ($self->{is_xml} and
+             ($self->{kwd} ne 'SYSTE' or $self->{nc} == 0x006D)) { # m
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'lowercase keyword', ## TODO: type
+                           text => 'SYSTEM',
+                           line => $self->{line_prev},
+                           column => $self->{column_prev} - 4);
+         } else {
+         }
          $self->{state} = BEFORE_DOCTYPE_SYSTEM_IDENTIFIER_STATE;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 3121 
 sub _get_next_token ($) {
+Line 3275 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after DOCTYPE name',
                          line => $self->{line_prev},
-                         column => $self->{column_prev} + 1 - length $self->{s_kwd});
+                         column => $self->{column_prev} + 1 - length $self->{kwd});
          $self->{ct}->{quirks} = 1;
          $self->{state} = BOGUS_DOCTYPE_STATE;
-Line 3210 
 sub _get_next_token ($) {
+Line 3364 
 sub _get_next_token ($) {
          return  ($self->{ct}); # DOCTYPE
          redo A;
+       } elsif ($self->{is_xml} and $self->{nc} == 0x005B) { # [
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no PUBLIC literal');
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # DOCTYPE
+         redo A;
        } else {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after PUBLIC');
-Line 3420 
 sub _get_next_token ($) {
+Line 3593 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
+         if ($self->{is_xml}) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'no SYSTEM literal');
+         } else {
+         }
          $self->{state} = DATA_STATE;
          $self->{s_kwd} = '';
-Line 3450 
 sub _get_next_token ($) {
+Line 3628 
 sub _get_next_token ($) {
          return  ($self->{ct}); # DOCTYPE
          redo A;
+       } elsif ($self->{is_xml} and $self->{nc} == 0x005B) { # [
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no SYSTEM literal');
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # DOCTYPE
+         redo A;
        } else {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after PUBLIC literal');
-Line 3550 
 sub _get_next_token ($) {
+Line 3747 
 sub _get_next_token ($) {
          return  ($self->{ct}); # DOCTYPE
          redo A;
+       } elsif ($self->{is_xml} and $self->{nc} == 0x005B) { # [
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no SYSTEM literal');
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # DOCTYPE
+         redo A;
        } else {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after SYSTEM');
-Line 3585 
 sub _get_next_token ($) {
+Line 3802 
 sub _get_next_token ($) {
      }
          redo A;
-       } elsif ($self->{nc} == 0x003E) { # >
+       } elsif (not $self->{is_xml} and $self->{nc} == 0x003E) { # >
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed SYSTEM literal');
-Line 3656 
 sub _get_next_token ($) {
+Line 3873 
 sub _get_next_token ($) {
      }
          redo A;
-       } elsif ($self->{nc} == 0x003E) { # >
+       } elsif (not $self->{is_xml} and $self->{nc} == 0x003E) { # >
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed SYSTEM literal');
-Line 3757 
 sub _get_next_token ($) {
+Line 3974 
 sub _get_next_token ($) {
          return  ($self->{ct}); # DOCTYPE
          redo A;
+       } elsif ($self->{is_xml} and $self->{nc} == 0x005B) { # [
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # DOCTYPE
+         redo A;
        } else {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after SYSTEM literal');
-Line 3796 
 sub _get_next_token ($) {
+Line 4031 
 sub _get_next_token ($) {
          return  ($self->{ct}); # DOCTYPE
          redo A;
+       } elsif ($self->{is_xml} and $self->{nc} == 0x005B) { # [
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # DOCTYPE
+         redo A;
        } elsif ($self->{nc} == -1) {
          $self->{state} = DATA_STATE;
-Line 3808 
 sub _get_next_token ($) {
+Line 4061 
 sub _get_next_token ($) {
        } else {
          my $s = '';
-         $self->{read_until}->($s, q[>], 0);
+         $self->{read_until}->($s, q{>[}, 0);
          ## Stay in the state
-Line 3976 
 sub _get_next_token ($) {
+Line 4229 
 sub _get_next_token ($) {
        } elsif ($self->{nc} == 0x0023) { # #
          $self->{state} = ENTITY_HASH_STATE;
-         $self->{s_kwd} = '#';
+         $self->{kwd} = '#';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3996 
 sub _get_next_token ($) {
+Line 4249 
 sub _get_next_token ($) {
          require Whatpm::_NamedEntityList;
          $self->{state} = ENTITY_NAME_STATE;
-         $self->{s_kwd} = chr $self->{nc};
+         $self->{kwd} = chr $self->{nc};
-         $self->{entity__value} = $self->{s_kwd};
+         $self->{entity__value} = $self->{kwd};
          $self->{entity__match} = 0;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 4047 
 sub _get_next_token ($) {
+Line 4300 
 sub _get_next_token ($) {
            $self->{nc} == 0x0058) { # X
          $self->{state} = HEXREF_X_STATE;
-         $self->{s_kwd} .= chr $self->{nc};
+         $self->{kwd} .= chr $self->{nc};
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 4064 
 sub _get_next_token ($) {
+Line 4317 
 sub _get_next_token ($) {
                 $self->{nc} <= 0x0039) { # 0..9
          $self->{state} = NCR_NUM_STATE;
-         $self->{s_kwd} = $self->{nc} - 0x0030;
+         $self->{kwd} = $self->{nc} - 0x0030;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 4110 
 sub _get_next_token ($) {
+Line 4363 
 sub _get_next_token ($) {
        if (0x0030 <= $self->{nc} and
            $self->{nc} <= 0x0039) { # 0..9
-         $self->{s_kwd} *= 10;
+         $self->{kwd} *= 10;
-         $self->{s_kwd} += $self->{nc} - 0x0030;
+         $self->{kwd} += $self->{nc} - 0x0030;
          ## Stay in the state.
-Line 4147 
 sub _get_next_token ($) {
+Line 4400 
 sub _get_next_token ($) {
          #
        }
-       my $code = $self->{s_kwd};
+       my $code = $self->{kwd};
        my $l = $self->{line_prev};
        my $c = $self->{column_prev};
        if ($charref_map->{$code}) {
-Line 4190 
 sub _get_next_token ($) {
+Line 4443 
 sub _get_next_token ($) {
          # 0..9, A..F, a..f
          $self->{state} = HEXREF_HEX_STATE;
-         $self->{s_kwd} = 0;
+         $self->{kwd} = 0;
          ## Reconsume.
          redo A;
        } else {
-Line 4208 
 sub _get_next_token ($) {
+Line 4461 
 sub _get_next_token ($) {
            $self->{s_kwd} = '';
            ## Reconsume.
            return  ({type => CHARACTER_TOKEN,
-                     data => '&' . $self->{s_kwd},
+                     data => '&' . $self->{kwd},
                      line => $self->{line_prev},
-                     column => $self->{column_prev} - length $self->{s_kwd},
+                     column => $self->{column_prev} - length $self->{kwd},
                     });
            redo A;
          } else {
-           $self->{ca}->{value} .= '&' . $self->{s_kwd};
+           $self->{ca}->{value} .= '&' . $self->{kwd};
            $self->{state} = $self->{prev_state};
            $self->{s_kwd} = '';
            ## Reconsume.
-Line 4226 
 sub _get_next_token ($) {
+Line 4479 
 sub _get_next_token ($) {
        if (0x0030 <= $self->{nc} and $self->{nc} <= 0x0039) {
          # 0..9
-         $self->{s_kwd} *= 0x10;
+         $self->{kwd} *= 0x10;
-         $self->{s_kwd} += $self->{nc} - 0x0030;
+         $self->{kwd} += $self->{nc} - 0x0030;
          ## Stay in the state.
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 4244 
 sub _get_next_token ($) {
+Line 4497 
 sub _get_next_token ($) {
        } elsif (0x0061 <= $self->{nc} and
                 $self->{nc} <= 0x0066) { # a..f
-         $self->{s_kwd} *= 0x10;
+         $self->{kwd} *= 0x10;
-         $self->{s_kwd} += $self->{nc} - 0x0060 + 9;
+         $self->{kwd} += $self->{nc} - 0x0060 + 9;
          ## Stay in the state.
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 4262 
 sub _get_next_token ($) {
+Line 4515 
 sub _get_next_token ($) {
        } elsif (0x0041 <= $self->{nc} and
                 $self->{nc} <= 0x0046) { # A..F
-         $self->{s_kwd} *= 0x10;
+         $self->{kwd} *= 0x10;
-         $self->{s_kwd} += $self->{nc} - 0x0040 + 9;
+         $self->{kwd} += $self->{nc} - 0x0040 + 9;
          ## Stay in the state.
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 4300 
 sub _get_next_token ($) {
+Line 4553 
 sub _get_next_token ($) {
          #
        }
-       my $code = $self->{s_kwd};
+       my $code = $self->{kwd};
        my $l = $self->{line_prev};
        my $c = $self->{column_prev};
        if ($charref_map->{$code}) {
-Line 4337 
 sub _get_next_token ($) {
+Line 4590 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == ENTITY_NAME_STATE) {
-       if (length $self->{s_kwd} < 30 and
+       if (length $self->{kwd} < 30 and
            ## NOTE: Some number greater than the maximum length of entity name
            ((0x0041 <= $self->{nc} and # a
              $self->{nc} <= 0x005A) or # x
-Line 4347 
 sub _get_next_token ($) {
+Line 4600 
 sub _get_next_token ($) {
              $self->{nc} <= 0x0039) or # 9
             $self->{nc} == 0x003B)) { # ;
          our $EntityChar;
-         $self->{s_kwd} .= chr $self->{nc};
+         $self->{kwd} .= chr $self->{nc};
-         if (defined $EntityChar->{$self->{s_kwd}}) {
+         if (defined $EntityChar->{$self->{kwd}}) {
            if ($self->{nc} == 0x003B) { # ;
-             $self->{entity__value} = $EntityChar->{$self->{s_kwd}};
+             $self->{entity__value} = $EntityChar->{$self->{kwd}};
              $self->{entity__match} = 1;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 4367 
 sub _get_next_token ($) {
+Line 4620 
 sub _get_next_token ($) {
              #
            } else {
-             $self->{entity__value} = $EntityChar->{$self->{s_kwd}};
+             $self->{entity__value} = $EntityChar->{$self->{kwd}};
              $self->{entity__match} = -1;
              ## Stay in the state.
-Line 4415 
 sub _get_next_token ($) {
+Line 4668 
 sub _get_next_token ($) {
          if ($self->{prev_state} != DATA_STATE and # in attribute
              $self->{entity__match} < -1) {
-           $data = '&' . $self->{s_kwd};
+           $data = '&' . $self->{kwd};
            #
          } else {
-Line 4427 
 sub _get_next_token ($) {
+Line 4680 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'bare ero',
                          line => $self->{line_prev},
-                         column => $self->{column_prev} - length $self->{s_kwd});
+                         column => $self->{column_prev} - length $self->{kwd});
-         $data = '&' . $self->{s_kwd};
+         $data = '&' . $self->{kwd};
          #
        }
-Line 4451 
 sub _get_next_token ($) {
+Line 4704 
 sub _get_next_token ($) {
                    data => $data,
                    has_reference => $has_ref,
                    line => $self->{line_prev},
-                   column => $self->{column_prev} + 1 - length $self->{s_kwd},
+                   column => $self->{column_prev} + 1 - length $self->{kwd},
                   });
          redo A;
        } else {
-Line 4521 
 sub _get_next_token ($) {
+Line 4774 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'no pic'); ## TODO: type
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
-         $self->{s_kwd} = '';
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
          ## Reconsume.
          return  ($self->{ct}); # pi
          redo A;
-Line 4593 
 sub _get_next_token ($) {
+Line 4850 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'no pic'); ## TODO: type
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
-         $self->{s_kwd} = '';
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
          ## Reprocess.
          return  ($self->{ct}); # pi
          redo A;
-Line 4619 
 sub _get_next_token ($) {
+Line 4880 
 sub _get_next_token ($) {
        }
      } elsif ($self->{state} == PI_AFTER_STATE) {
        if ($self->{nc} == 0x003E) { # >
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
-         $self->{s_kwd} = '';
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 4665 
 sub _get_next_token ($) {
+Line 4930 
 sub _get_next_token ($) {
      } elsif ($self->{state} == PI_DATA_AFTER_STATE) {
        ## XML5: Same as "pi after state" in XML5
        if ($self->{nc} == 0x003E) { # >
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
-         $self->{s_kwd} = '';
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 4701 
 sub _get_next_token ($) {
+Line 4970 
 sub _get_next_token ($) {
          ## Reprocess.
          redo A;
        }
+     } elsif ($self->{state} == DOCTYPE_INTERNAL_SUBSET_STATE) {
+       if ($self->{nc} == 0x003C) { # <
+         $self->{state} = DOCTYPE_TAG_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0025) { # %
+         ## XML5: Not defined yet.
+         ## TODO:
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x005D) { # ]
+         delete $self->{in_subset};
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_AFTER_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($is_space->{$self->{nc}}) {
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed internal subset'); ## TODO: type
+         delete $self->{in_subset};
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+         ## Reconsume.
+         return  ({type => END_OF_DOCTYPE_TOKEN});
+         redo A;
+       } else {
+         unless ($self->{internal_subset_tainted}) {
+           ## XML5: No parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'string in internal subset');
+           $self->{internal_subset_tainted} = 1;
+         }
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_INTERNAL_SUBSET_AFTER_STATE) {
+       if ($self->{nc} == 0x003E) { # >
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ({type => END_OF_DOCTYPE_TOKEN});
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+         ## Reconsume.
+         return  ({type => END_OF_DOCTYPE_TOKEN});
+         redo A;
+       } else {
+         ## XML5: No parse error and stay in the state.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after internal subset'); ## TODO: type
+         $self->{state} = BOGUS_DOCTYPE_INTERNAL_SUBSET_AFTER_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == BOGUS_DOCTYPE_INTERNAL_SUBSET_AFTER_STATE) {
+       if ($self->{nc} == 0x003E) { # >
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ({type => END_OF_DOCTYPE_TOKEN});
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+         ## Reconsume.
+         return  ({type => END_OF_DOCTYPE_TOKEN});
+         redo A;
+       } else {
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_TAG_STATE) {
+       if ($self->{nc} == 0x0021) { # !
+         $self->{state} = MARKUP_DECLARATION_OPEN_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003F) { # ?
+         $self->{state} = PI_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'bare stago');
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+         ## Reconsume.
+         redo A;
+       } else {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'bare stago', ## XML5: Not a parse error.
+                         line => $self->{line_prev},
+                         column => $self->{column_prev});
+         $self->{state} = BOGUS_COMMENT_STATE;
+         $self->{ct} = {type => COMMENT_TOKEN,
+                        data => '',
+                       }; ## NOTE: Will be discarded.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
      } else {
        die "$0: $self->{state}: Unknown state";

 Legend:



Removed from v.1.11
 


changed lines


 
Added in v.1.13
 Legend:



Removed from v.1.11
 


changed lines


 
Added in v.1.13
-Removed from v.1.11
+Added in v.1.13

admin@suikawiki.org	ViewVC Help
Powered by ViewVC 1.1.24