/[suikacvs]/markup/html/whatpm/Whatpm/HTML/Tokenizer.pm

Diff of /markup/html/whatpm/Whatpm/HTML/Tokenizer.pm

Parent Directory | Revision Log | View Patch Patch

-revision 1.3 by wakaba,
Tue Oct 14 05:34:05 2008 UTC
+revision 1.11 by wakaba,
Wed Oct 15 10:50:38 2008 UTC
 Line 114 
 sub HEXREF_HEX_STATE () { 48 }
  sub ENTITY_NAME_STATE () { 49 }
  sub PCDATA_STATE () { 50 } # "data state" in the spec
+ ## XML states
+ sub PI_STATE () { 51 }
+ sub PI_TARGET_STATE () { 52 }
+ sub PI_TARGET_AFTER_STATE () { 53 }
+ sub PI_DATA_STATE () { 54 }
+ sub PI_AFTER_STATE () { 55 }
+ sub PI_DATA_AFTER_STATE () { 56 }
  ## Tree constructor state constants (see Whatpm::HTML for the full
  ## list and descriptions)
-Line 178 
 sub _initialize_tokenizer ($) {
+Line 186 
 sub _initialize_tokenizer ($) {
    #$self->{is_xml} (if XML)
    $self->{state} = DATA_STATE; # MUST
-   #$self->{s_kwd}; # state keyword - initialized when used
+   $self->{s_kwd} = ''; # state keyword
    #$self->{entity__value}; # initialized when used
    #$self->{entity__match}; # initialized when used
    $self->{content_model} = PCDATA_CONTENT_MODEL; # be
-Line 208 
 sub _initialize_tokenizer ($) {
+Line 216 
 sub _initialize_tokenizer ($) {
  ## A token has:
  ##   ->{type} == DOCTYPE_TOKEN, START_TAG_TOKEN, END_TAG_TOKEN, COMMENT_TOKEN,
- ##       CHARACTER_TOKEN, or END_OF_FILE_TOKEN
+ ##       CHARACTER_TOKEN, END_OF_FILE_TOKEN, PI_TOKEN, or ABORT_TOKEN
  ##   ->{name} (DOCTYPE_TOKEN)
  ##   ->{tag_name} (START_TAG_TOKEN, END_TAG_TOKEN)
+ ##   ->{target} (PI_TOKEN)
  ##   ->{pubid} (DOCTYPE_TOKEN)
  ##   ->{sysid} (DOCTYPE_TOKEN)
  ##   ->{quirks} == 1 or 0 (DOCTYPE_TOKEN): "force-quirks" flag
-Line 218 
 sub _initialize_tokenizer ($) {
+Line 227 
 sub _initialize_tokenizer ($) {
  ##        ->{name}
  ##        ->{value}
  ##        ->{has_reference} == 1 or 0
- ##   ->{data} (COMMENT_TOKEN, CHARACTER_TOKEN)
+ ##        ->{index}: Index of the attribute in a tag.
+ ##   ->{data} (COMMENT_TOKEN, CHARACTER_TOKEN, PI_TOKEN)
+ ##   ->{has_reference} == 1 or 0 (CHARACTER_TOKEN)
+ ##   ->{last_index} (ELEMENT_TOKEN): Next attribute's index - 1.
  ## NOTE: The "self-closing flag" is hold as |$self->{self_closing}|.
  ##     |->{self_closing}| is used to save the value of |$self->{self_closing}|
  ##     while the token is pushed back to the stack.
-Line 362 
 sub _get_next_token ($) {
+Line 374 
 sub _get_next_token ($) {
          }
        } elsif ($self->{nc} == 0x002D) { # -
          if ($self->{content_model} & CM_LIMITED_MARKUP) { # RCDATA | CDATA
-           $self->{s_kwd} .= '-';
+           if ($self->{s_kwd} eq '<!-') {
-           if ($self->{s_kwd} eq '<!--') {
              $self->{escape} = 1; # unless $self->{escape};
              $self->{s_kwd} = '--';
              #
-           } elsif ($self->{s_kwd} eq '---') {
+           } elsif ($self->{s_kwd} eq '-') {
              $self->{s_kwd} = '--';
              #
+           } elsif ($self->{s_kwd} eq '<!' or $self->{s_kwd} eq '-') {
+             $self->{s_kwd} .= '-';
+             #
            } else {
+             $self->{s_kwd} = '-';
              #
            }
          }
-Line 420 
 sub _get_next_token ($) {
+Line 435 
 sub _get_next_token ($) {
            if ($self->{s_kwd} eq '--') {
              delete $self->{escape};
+             #
            } else {
+             #
            }
+         } elsif ($self->{is_xml} and $self->{s_kwd} eq ']]') {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unmatched mse', ## TODO: type
+                           line => $self->{line_prev},
+                           column => $self->{column_prev} - 1);
+           #
          } else {
+           #
          }
          $self->{s_kwd} = '';
          #
+       } elsif ($self->{nc} == 0x005D) { # ]
+         if ($self->{s_kwd} eq ']' or $self->{s_kwd} eq '') {
+           $self->{s_kwd} .= ']';
+         } elsif ($self->{s_kwd} eq ']]') {
+           #
+         } else {
+           $self->{s_kwd} = '';
+         }
+         #
        } elsif ($self->{nc} == -1) {
          $self->{s_kwd} = '';
-Line 446 
 sub _get_next_token ($) {
+Line 482 
 sub _get_next_token ($) {
                     data => chr $self->{nc},
                     line => $self->{line}, column => $self->{column},
                    };
-       if ($self->{read_until}->($token->{data}, q[-!<>&],
+       if ($self->{read_until}->($token->{data}, q{-!<>&\]},
                                  length $token->{data})) {
          $self->{s_kwd} = '';
        }
        ## Stay in the data state.
-       if ($self->{content_model} == PCDATA_CONTENT_MODEL) {
+       if (not $self->{is_xml} and
+           $self->{content_model} == PCDATA_CONTENT_MODEL) {
          $self->{state} = PCDATA_STATE;
        } else {
-Line 473 
 sub _get_next_token ($) {
+Line 510 
 sub _get_next_token ($) {
        return  ($token);
        redo A;
      } elsif ($self->{state} == TAG_OPEN_STATE) {
+       ## XML5: "tag state".
        if ($self->{content_model} & CM_LIMITED_MARKUP) { # RCDATA | CDATA
          if ($self->{nc} == 0x002F) { # /
-Line 500 
 sub _get_next_token ($) {
+Line 539 
 sub _get_next_token ($) {
          ## reconsume
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          return  ({type => CHARACTER_TOKEN, data => '<',
                    line => $self->{line_prev},
                    column => $self->{column_prev},
-Line 541 
 sub _get_next_token ($) {
+Line 581 
 sub _get_next_token ($) {
            $self->{ct}
              = {type => START_TAG_TOKEN,
-                tag_name => chr ($self->{nc} + 0x0020),
+                tag_name => chr ($self->{nc} + ($self->{is_xml} ? 0 : 0x0020)),
                 line => $self->{line_prev},
                 column => $self->{column_prev}};
            $self->{state} = TAG_NAME_STATE;
-Line 583 
 sub _get_next_token ($) {
+Line 623 
 sub _get_next_token ($) {
                            line => $self->{line_prev},
                            column => $self->{column_prev});
            $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 602 
 sub _get_next_token ($) {
+Line 643 
 sub _get_next_token ($) {
            redo A;
          } elsif ($self->{nc} == 0x003F) { # ?
+           if ($self->{is_xml}) {
-           $self->{parse_error}->(level => $self->{level}->{must}, type => 'pio',
-                           line => $self->{line_prev},
+             $self->{state} = PI_STATE;
-                           column => $self->{column_prev});
-           $self->{state} = BOGUS_COMMENT_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-           $self->{ct} = {type => COMMENT_TOKEN, data => '',
+       $self->{line_prev} = $self->{line};
-                                     line => $self->{line_prev},
+       $self->{column_prev} = $self->{column};
-                                     column => $self->{column_prev},
+       $self->{column}++;
-                                    };
+       $self->{nc}
-           ## $self->{nc} is intentionally left as is
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
-           redo A;
+     } else {
-         } else {
+       $self->{set_nc}->($self);
+     }
+             redo A;
+           } else {
+             $self->{parse_error}->(level => $self->{level}->{must}, type => 'pio',
+                             line => $self->{line_prev},
+                             column => $self->{column_prev});
+             $self->{state} = BOGUS_COMMENT_STATE;
+             $self->{ct} = {type => COMMENT_TOKEN, data => '',
+                            line => $self->{line_prev},
+                            column => $self->{column_prev},
+                           };
+             ## $self->{nc} is intentionally left as is
+             redo A;
+           }
+         } elsif (not $self->{is_xml} or $is_space->{$self->{nc}}) {
            $self->{parse_error}->(level => $self->{level}->{must}, type => 'bare stago',
                            line => $self->{line_prev},
                            column => $self->{column_prev});
            $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
            ## reconsume
            return  ({type => CHARACTER_TOKEN, data => '<',
-Line 627 
 sub _get_next_token ($) {
+Line 686 
 sub _get_next_token ($) {
                     });
            redo A;
+         } else {
+           ## XML5: "<:" is a parse error.
+           $self->{ct} = {type => START_TAG_TOKEN,
+                                     tag_name => chr ($self->{nc}),
+                                     line => $self->{line_prev},
+                                     column => $self->{column_prev}};
+           $self->{state} = TAG_NAME_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+           redo A;
          }
        } else {
          die "$0: $self->{content_model} in tag open";
-Line 635 
 sub _get_next_token ($) {
+Line 714 
 sub _get_next_token ($) {
        ## NOTE: The "close tag open state" in the spec is implemented as
        ## |CLOSE_TAG_OPEN_STATE| and |CDATA_RCDATA_CLOSE_TAG_STATE|.
+       ## XML5: "end tag state".
        my ($l, $c) = ($self->{line_prev}, $self->{column_prev} - 1); # "<"of"</"
        if ($self->{content_model} & CM_LIMITED_MARKUP) { # RCDATA | CDATA
          if (defined $self->{last_stag_name}) {
-Line 647 
 sub _get_next_token ($) {
+Line 728 
 sub _get_next_token ($) {
            ## NOTE: See <http://krijnhoetmer.nl/irc-logs/whatwg/20070626#l-564>.
            $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
            ## Reconsume.
            return  ({type => CHARACTER_TOKEN, data => '</',
                      line => $l, column => $c,
-Line 660 
 sub _get_next_token ($) {
+Line 742 
 sub _get_next_token ($) {
          $self->{ct}
              = {type => END_TAG_TOKEN,
-                tag_name => chr ($self->{nc} + 0x0020),
+                tag_name => chr ($self->{nc} + ($self->{is_xml} ? 0 : 0x0020)),
                 line => $l, column => $c};
          $self->{state} = TAG_NAME_STATE;
-Line 695 
 sub _get_next_token ($) {
+Line 777 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'empty end tag',
                          line => $self->{line_prev}, ## "<" in "</>"
                          column => $self->{column_prev} - 1);
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+         if ($self->{is_xml}) {
+           ## XML5: No parse error.
+           ## NOTE: This parser raises a parse error, since it supports
+           ## XML1, not XML5.
+           ## NOTE: A short end tag token.
+           my $ct = {type => END_TAG_TOKEN,
+                     tag_name => '',
+                     line => $self->{line_prev},
+                     column => $self->{column_prev} - 1,
+                    };
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
        $self->{column_prev} = $self->{column};
-Line 711 
 sub _get_next_token ($) {
+Line 806 
 sub _get_next_token ($) {
        $self->{set_nc}->($self);
      }
+           return  ($ct);
+         } else {
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         }
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'bare etago');
+         $self->{s_kwd} = '';
          $self->{state} = DATA_STATE;
          # reconsume
-Line 723 
 sub _get_next_token ($) {
+Line 834 
 sub _get_next_token ($) {
                   });
          redo A;
-       } else {
+       } elsif (not $self->{is_xml} or
+                $is_space->{$self->{nc}}) {
-         $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus end tag');
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus end tag',
+                         line => $self->{line_prev}, # "<" of "</"
+                         column => $self->{column_prev} - 1);
          $self->{state} = BOGUS_COMMENT_STATE;
          $self->{ct} = {type => COMMENT_TOKEN, data => '',
                                    line => $self->{line_prev}, # "<" of "</"
-Line 738 
 sub _get_next_token ($) {
+Line 852 
 sub _get_next_token ($) {
          ## generated from the bogus end tag, as defined in the
          ## "bogus comment state" entry.
          redo A;
+       } else {
+         ## XML5: "</:" is a parse error.
+         $self->{ct} = {type => END_TAG_TOKEN,
+                        tag_name => chr ($self->{nc}),
+                        line => $l, column => $c};
+         $self->{state} = TAG_NAME_STATE; ## XML5: "end tag name state".
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
        }
      } elsif ($self->{state} == CDATA_RCDATA_CLOSE_TAG_STATE) {
        my $ch = substr $self->{last_stag_name}, length $self->{s_kwd}, 1;
-Line 764 
 sub _get_next_token ($) {
+Line 897 
 sub _get_next_token ($) {
          } else {
            $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
            ## Reconsume.
            return  ({type => CHARACTER_TOKEN,
                      data => '</' . $self->{s_kwd},
-Line 782 
 sub _get_next_token ($) {
+Line 916 
 sub _get_next_token ($) {
            ## Reconsume.
            $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
            return  ({type => CHARACTER_TOKEN,
                      data => '</' . $self->{s_kwd},
                      line => $self->{line_prev},
-Line 833 
 sub _get_next_token ($) {
+Line 968 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 851 
 sub _get_next_token ($) {
+Line 987 
 sub _get_next_token ($) {
        } elsif (0x0041 <= $self->{nc} and
                 $self->{nc} <= 0x005A) { # A..Z
-         $self->{ct}->{tag_name} .= chr ($self->{nc} + 0x0020);
+         $self->{ct}->{tag_name}
+             .= chr ($self->{nc} + ($self->{is_xml} ? 0 : 0x0020));
            # start tag or end tag
          ## Stay in this state
-Line 884 
 sub _get_next_token ($) {
+Line 1021 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          # reconsume
          return  ($self->{ct}); # start tag or end tag
-Line 923 
 sub _get_next_token ($) {
+Line 1061 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == BEFORE_ATTRIBUTE_NAME_STATE) {
+       ## XML5: "Tag attribute name before state".
        if ($is_space->{$self->{nc}}) {
          ## Stay in the state
-Line 954 
 sub _get_next_token ($) {
+Line 1094 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 973 
 sub _get_next_token ($) {
+Line 1114 
 sub _get_next_token ($) {
                 $self->{nc} <= 0x005A) { # A..Z
          $self->{ca}
-             = {name => chr ($self->{nc} + 0x0020),
+             = {name => chr ($self->{nc} + ($self->{is_xml} ? 0 : 0x0020)),
                 value => '',
                 line => $self->{line}, column => $self->{column}};
          $self->{state} = ATTRIBUTE_NAME_STATE;
-Line 1021 
 sub _get_next_token ($) {
+Line 1162 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          # reconsume
          return  ($self->{ct}); # start tag or end tag
-Line 1033 
 sub _get_next_token ($) {
+Line 1175 
 sub _get_next_token ($) {
 x003D => 1, # =
              }->{$self->{nc}}) {
+           ## XML5: Not a parse error.
            $self->{parse_error}->(level => $self->{level}->{must}, type => 'bad attribute name');
          } else {
+           ## XML5: ":" raises a parse error and is ignored.
          }
          $self->{ca}
              = {name => chr ($self->{nc}),
-Line 1056 
 sub _get_next_token ($) {
+Line 1200 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == ATTRIBUTE_NAME_STATE) {
+       ## XML5: "Tag attribute name state".
        my $before_leave = sub {
          if (exists $self->{ct}->{attributes} # start tag or end tag
              ->{$self->{ca}->{name}}) { # MUST
-Line 1066 
 sub _get_next_token ($) {
+Line 1212 
 sub _get_next_token ($) {
            $self->{ct}->{attributes}->{$self->{ca}->{name}}
              = $self->{ca};
+           $self->{ca}->{index} = ++$self->{ct}->{last_index};
          }
        }; # $before_leave
-Line 1102 
 sub _get_next_token ($) {
+Line 1249 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
+         if ($self->{is_xml}) {
+           ## XML5: Not a parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr value'); ## TODO: type
+         } else {
+         }
          $before_leave->();
          if ($self->{ct}->{type} == START_TAG_TOKEN) {
-Line 1116 
 sub _get_next_token ($) {
+Line 1271 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1134 
 sub _get_next_token ($) {
+Line 1290 
 sub _get_next_token ($) {
        } elsif (0x0041 <= $self->{nc} and
                 $self->{nc} <= 0x005A) { # A..Z
-         $self->{ca}->{name} .= chr ($self->{nc} + 0x0020);
+         $self->{ca}->{name}
+             .= chr ($self->{nc} + ($self->{is_xml} ? 0 : 0x0020));
          ## Stay in the state
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 1149 
 sub _get_next_token ($) {
+Line 1306 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x002F) { # /
+         if ($self->{is_xml}) {
+           ## XML5: Not a parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr value'); ## TODO: type
+         } else {
+         }
          $before_leave->();
          $self->{state} = SELF_CLOSING_START_TAG_STATE;
-Line 1183 
 sub _get_next_token ($) {
+Line 1347 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          # reconsume
          return  ($self->{ct}); # start tag or end tag
-Line 1192 
 sub _get_next_token ($) {
+Line 1357 
 sub _get_next_token ($) {
          if ($self->{nc} == 0x0022 or # "
              $self->{nc} == 0x0027) { # '
+           ## XML5: Not a parse error.
            $self->{parse_error}->(level => $self->{level}->{must}, type => 'bad attribute name');
          } else {
-Line 1212 
 sub _get_next_token ($) {
+Line 1378 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == AFTER_ATTRIBUTE_NAME_STATE) {
+       ## XML5: "Tag attribute name after state".
        if ($is_space->{$self->{nc}}) {
          ## Stay in the state
-Line 1243 
 sub _get_next_token ($) {
+Line 1411 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
+         if ($self->{is_xml}) {
+           ## XML5: Not a parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr value'); ## TODO: type
+         } else {
+         }
          if ($self->{ct}->{type} == START_TAG_TOKEN) {
            $self->{last_stag_name} = $self->{ct}->{tag_name};
-Line 1259 
 sub _get_next_token ($) {
+Line 1435 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1278 
 sub _get_next_token ($) {
+Line 1455 
 sub _get_next_token ($) {
                 $self->{nc} <= 0x005A) { # A..Z
          $self->{ca}
-             = {name => chr ($self->{nc} + 0x0020),
+             = {name => chr ($self->{nc} + ($self->{is_xml} ? 0 : 0x0020)),
                 value => '',
                 line => $self->{line}, column => $self->{column}};
          $self->{state} = ATTRIBUTE_NAME_STATE;
-Line 1295 
 sub _get_next_token ($) {
+Line 1472 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x002F) { # /
+         if ($self->{is_xml}) {
+           ## XML5: Not a parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr value'); ## TODO: type
+         } else {
+         }
          $self->{state} = SELF_CLOSING_START_TAG_STATE;
-Line 1326 
 sub _get_next_token ($) {
+Line 1510 
 sub _get_next_token ($) {
          } else {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
+         $self->{s_kwd} = '';
          $self->{state} = DATA_STATE;
          # reconsume
-Line 1333 
 sub _get_next_token ($) {
+Line 1518 
 sub _get_next_token ($) {
          redo A;
        } else {
+         if ($self->{is_xml}) {
+           ## XML5: Not a parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr value'); ## TODO: type
+         } else {
+         }
          if ($self->{nc} == 0x0022 or # "
              $self->{nc} == 0x0027) { # '
+           ## XML5: Not a parse error.
            $self->{parse_error}->(level => $self->{level}->{must}, type => 'bad attribute name');
          } else {
-Line 1359 
 sub _get_next_token ($) {
+Line 1553 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == BEFORE_ATTRIBUTE_VALUE_STATE) {
+       ## XML5: "Tag attribute value before state".
        if ($is_space->{$self->{nc}}) {
          ## Stay in the state
-Line 1427 
 sub _get_next_token ($) {
+Line 1623 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1460 
 sub _get_next_token ($) {
+Line 1657 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          return  ($self->{ct}); # start tag or end tag
-Line 1468 
 sub _get_next_token ($) {
+Line 1666 
 sub _get_next_token ($) {
        } else {
          if ($self->{nc} == 0x003D) { # =
+           ## XML5: Not a parse error.
            $self->{parse_error}->(level => $self->{level}->{must}, type => 'bad attribute value');
+         } elsif ($self->{is_xml}) {
+           ## XML5: No parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unquoted attr value'); ## TODO
          } else {
          }
-Line 1488 
 sub _get_next_token ($) {
+Line 1691 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == ATTRIBUTE_VALUE_DOUBLE_QUOTED_STATE) {
+       ## XML5: "Tag attribute value double quoted state".
        if ($self->{nc} == 0x0022) { # "
+         ## XML5: "Tag attribute name before state".
          $self->{state} = AFTER_ATTRIBUTE_VALUE_QUOTED_STATE;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 1505 
 sub _get_next_token ($) {
+Line 1711 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x0026) { # &
+         ## XML5: Not defined yet.
          ## NOTE: In the spec, the tokenizer is switched to the
          ## "entity in attribute value state".  In this implementation, the
          ## tokenizer is switched to the |ENTITY_STATE|, which is an
-Line 1542 
 sub _get_next_token ($) {
+Line 1750 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          return  ($self->{ct}); # start tag or end tag
          redo A;
        } else {
+         if ($self->{is_xml} and $self->{nc} == 0x003C) { # <
+           ## XML5: Not a parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'lt in attr value'); ## TODO: type
+         } else {
+         }
          $self->{ca}->{value} .= chr ($self->{nc});
          $self->{read_until}->($self->{ca}->{value},
-                               q["&],
+                               q["&<],
                                length $self->{ca}->{value});
          ## Stay in the state
-Line 1569 
 sub _get_next_token ($) {
+Line 1784 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == ATTRIBUTE_VALUE_SINGLE_QUOTED_STATE) {
+       ## XML5: "Tag attribute value single quoted state".
        if ($self->{nc} == 0x0027) { # '
+         ## XML5: "Before attribute name state" (sic).
          $self->{state} = AFTER_ATTRIBUTE_VALUE_QUOTED_STATE;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 1586 
 sub _get_next_token ($) {
+Line 1804 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x0026) { # &
+         ## XML5: Not defined yet.
          ## NOTE: In the spec, the tokenizer is switched to the
          ## "entity in attribute value state".  In this implementation, the
          ## tokenizer is switched to the |ENTITY_STATE|, which is an
-Line 1623 
 sub _get_next_token ($) {
+Line 1843 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          return  ($self->{ct}); # start tag or end tag
          redo A;
        } else {
+         if ($self->{is_xml} and $self->{nc} == 0x003C) { # <
+           ## XML5: Not a parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'lt in attr value'); ## TODO: type
+         } else {
+         }
          $self->{ca}->{value} .= chr ($self->{nc});
          $self->{read_until}->($self->{ca}->{value},
-                               q['&],
+                               q['&<],
                                length $self->{ca}->{value});
          ## Stay in the state
-Line 1650 
 sub _get_next_token ($) {
+Line 1877 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == ATTRIBUTE_VALUE_UNQUOTED_STATE) {
+       ## XML5: "Tag attribute value unquoted state".
        if ($is_space->{$self->{nc}}) {
+         ## XML5: "Tag attribute name before state".
          $self->{state} = BEFORE_ATTRIBUTE_NAME_STATE;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 1667 
 sub _get_next_token ($) {
+Line 1897 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x0026) { # &
+         ## XML5: Not defined yet.
          ## NOTE: In the spec, the tokenizer is switched to the
          ## "entity in attribute value state".  In this implementation, the
          ## tokenizer is switched to the |ENTITY_STATE|, which is an
-Line 1703 
 sub _get_next_token ($) {
+Line 1936 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1736 
 sub _get_next_token ($) {
+Line 1970 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          return  ($self->{ct}); # start tag or end tag
-Line 1748 
 sub _get_next_token ($) {
+Line 1983 
 sub _get_next_token ($) {
 x003D => 1, # =
              }->{$self->{nc}}) {
+           ## XML5: Not a parse error.
            $self->{parse_error}->(level => $self->{level}->{must}, type => 'bad attribute value');
          } else {
-Line 1804 
 sub _get_next_token ($) {
+Line 2040 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1851 
 sub _get_next_token ($) {
+Line 2088 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## Reconsume.
          return  ($self->{ct}); # start tag or end tag
          redo A;
-Line 1862 
 sub _get_next_token ($) {
+Line 2100 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == SELF_CLOSING_START_TAG_STATE) {
+       ## XML5: "Empty tag state".
        if ($self->{nc} == 0x003E) { # >
          if ($self->{ct}->{type} == END_TAG_TOKEN) {
-Line 1881 
 sub _get_next_token ($) {
+Line 2121 
 sub _get_next_token ($) {
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1912 
 sub _get_next_token ($) {
+Line 2153 
 sub _get_next_token ($) {
          } else {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
+         ## XML5: "Tag attribute name before state".
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## Reconsume.
          return  ($self->{ct}); # start tag or end tag
          redo A;
-Line 1933 
 sub _get_next_token ($) {
+Line 2176 
 sub _get_next_token ($) {
        if ($self->{nc} == 0x003E) { # >
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1950 
 sub _get_next_token ($) {
+Line 2194 
 sub _get_next_token ($) {
        } elsif ($self->{nc} == -1) {
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2051 
 sub _get_next_token ($) {
+Line 2296 
 sub _get_next_token ($) {
                                    line => $self->{line_prev},
                                    column => $self->{column_prev} - 2,
                                   };
-         $self->{state} = COMMENT_START_STATE;
+         $self->{state} = COMMENT_START_STATE; ## XML5: "comment state".
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2114 
 sub _get_next_token ($) {
+Line 2359 
 sub _get_next_token ($) {
        } elsif ((length $self->{s_kwd}) == 6 and
                 ($self->{nc} == 0x0045 or # E
                  $self->{nc} == 0x0065)) { # e
+         if ($self->{s_kwd} ne 'DOCTYP') {
+           ## XML5: case-sensitive.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'lowercase keyword', ## TODO
+                           text => 'DOCTYPE',
+                           line => $self->{line_prev},
+                           column => $self->{column_prev} - 5);
+         } else {
+         }
          $self->{state} = DOCTYPE_STATE;
          $self->{ct} = {type => DOCTYPE_TOKEN,
                                    quirks => 1,
-Line 2172 
 sub _get_next_token ($) {
+Line 2426 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{s_kwd} eq '[CDATA' and
                 $self->{nc} == 0x005B) { # [
+         if ($self->{is_xml} and
+             not $self->{tainted} and
+             @{$self->{open_elements} or []} == 0) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'cdata outside of root element',
+                           line => $self->{line_prev},
+                           column => $self->{column_prev} - 7);
+           $self->{tainted} = 1;
+         } else {
+         }
          $self->{ct} = {type => CHARACTER_TOKEN,
                                    data => '',
                                    line => $self->{line_prev},
-Line 2224 
 sub _get_next_token ($) {
+Line 2489 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2243 
 sub _get_next_token ($) {
+Line 2509 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed comment');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2286 
 sub _get_next_token ($) {
+Line 2553 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2305 
 sub _get_next_token ($) {
+Line 2573 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed comment');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2348 
 sub _get_next_token ($) {
+Line 2617 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed comment');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2375 
 sub _get_next_token ($) {
+Line 2645 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == COMMENT_END_DASH_STATE) {
+       ## XML5: "comment dash state".
        if ($self->{nc} == 0x002D) { # -
          $self->{state} = COMMENT_END_STATE;
-Line 2393 
 sub _get_next_token ($) {
+Line 2665 
 sub _get_next_token ($) {
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed comment');
+         $self->{s_kwd} = '';
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2420 
 sub _get_next_token ($) {
+Line 2694 
 sub _get_next_token ($) {
        if ($self->{nc} == 0x003E) { # >
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2437 
 sub _get_next_token ($) {
+Line 2712 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x002D) { # -
+         ## XML5: Not a parse error.
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'dash in comment',
                          line => $self->{line_prev},
                          column => $self->{column_prev});
-Line 2458 
 sub _get_next_token ($) {
+Line 2734 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed comment');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2465 
 sub _get_next_token ($) {
+Line 2742 
 sub _get_next_token ($) {
          redo A;
        } else {
+         ## XML5: Not a parse error.
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'dash in comment',
                          line => $self->{line_prev},
                          column => $self->{column_prev});
-Line 2526 
 sub _get_next_token ($) {
+Line 2804 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'no DOCTYPE name');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2545 
 sub _get_next_token ($) {
+Line 2824 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'no DOCTYPE name');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          return  ($self->{ct}); # DOCTYPE (quirks)
-Line 2588 
 sub _get_next_token ($) {
+Line 2868 
 sub _get_next_token ($) {
        } elsif ($self->{nc} == 0x003E) { # >
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2607 
 sub _get_next_token ($) {
+Line 2888 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          $self->{ct}->{quirks} = 1;
-Line 2650 
 sub _get_next_token ($) {
+Line 2932 
 sub _get_next_token ($) {
        } elsif ($self->{nc} == 0x003E) { # >
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2669 
 sub _get_next_token ($) {
+Line 2952 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          $self->{ct}->{quirks} = 1;
-Line 2897 
 sub _get_next_token ($) {
+Line 3181 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'no PUBLIC literal');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2918 
 sub _get_next_token ($) {
+Line 3203 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          $self->{ct}->{quirks} = 1;
-Line 2964 
 sub _get_next_token ($) {
+Line 3250 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed PUBLIC literal');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2985 
 sub _get_next_token ($) {
+Line 3272 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed PUBLIC literal');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          $self->{ct}->{quirks} = 1;
-Line 3033 
 sub _get_next_token ($) {
+Line 3321 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed PUBLIC literal');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3054 
 sub _get_next_token ($) {
+Line 3343 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed PUBLIC literal');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          $self->{ct}->{quirks} = 1;
-Line 3132 
 sub _get_next_token ($) {
+Line 3422 
 sub _get_next_token ($) {
        } elsif ($self->{nc} == 0x003E) { # >
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3152 
 sub _get_next_token ($) {
+Line 3443 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          $self->{ct}->{quirks} = 1;
-Line 3229 
 sub _get_next_token ($) {
+Line 3521 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'no SYSTEM literal');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3250 
 sub _get_next_token ($) {
+Line 3543 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          $self->{ct}->{quirks} = 1;
-Line 3296 
 sub _get_next_token ($) {
+Line 3590 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed SYSTEM literal');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3317 
 sub _get_next_token ($) {
+Line 3612 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed SYSTEM literal');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          $self->{ct}->{quirks} = 1;
-Line 3365 
 sub _get_next_token ($) {
+Line 3661 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed SYSTEM literal');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3386 
 sub _get_next_token ($) {
+Line 3683 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed SYSTEM literal');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          $self->{ct}->{quirks} = 1;
-Line 3432 
 sub _get_next_token ($) {
+Line 3730 
 sub _get_next_token ($) {
        } elsif ($self->{nc} == 0x003E) { # >
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3451 
 sub _get_next_token ($) {
+Line 3750 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          $self->{ct}->{quirks} = 1;
-Line 3480 
 sub _get_next_token ($) {
+Line 3780 
 sub _get_next_token ($) {
        if ($self->{nc} == 0x003E) { # >
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3498 
 sub _get_next_token ($) {
+Line 3799 
 sub _get_next_token ($) {
        } elsif ($self->{nc} == -1) {
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          return  ($self->{ct}); # DOCTYPE
-Line 3526 
 sub _get_next_token ($) {
+Line 3828 
 sub _get_next_token ($) {
        ## NOTE: "CDATA section state" in the state is jointly implemented
        ## by three states, |CDATA_SECTION_STATE|, |CDATA_SECTION_MSE1_STATE|,
        ## and |CDATA_SECTION_MSE2_STATE|.
+       ## XML5: "CDATA state".
        if ($self->{nc} == 0x005D) { # ]
-Line 3543 
 sub _get_next_token ($) {
+Line 3847 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == -1) {
+         if ($self->{is_xml}) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'no mse'); ## TODO: type
+         } else {
+         }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
-     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+         ## Reconsume.
-       $self->{line_prev} = $self->{line};
-       $self->{column_prev} = $self->{column};
-       $self->{column}++;
-       $self->{nc}
-           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
-     } else {
-       $self->{set_nc}->($self);
-     }
          if (length $self->{ct}->{data}) { # character
            return  ($self->{ct}); # character
-Line 3587 
 sub _get_next_token ($) {
+Line 3889 
 sub _get_next_token ($) {
        ## ISSUE: "text tokens" in spec.
      } elsif ($self->{state} == CDATA_SECTION_MSE1_STATE) {
+       ## XML5: "CDATA bracket state".
        if ($self->{nc} == 0x005D) { # ]
          $self->{state} = CDATA_SECTION_MSE2_STATE;
-Line 3604 
 sub _get_next_token ($) {
+Line 3908 
 sub _get_next_token ($) {
          redo A;
        } else {
+         ## XML5: If EOF, "]" is not appended and changed to the data state.
          $self->{ct}->{data} .= ']';
-         $self->{state} = CDATA_SECTION_STATE;
+         $self->{state} = CDATA_SECTION_STATE; ## XML5: Stay in the state.
          ## Reconsume.
          redo A;
        }
      } elsif ($self->{state} == CDATA_SECTION_MSE2_STATE) {
+       ## XML5: "CDATA end state".
        if ($self->{nc} == 0x003E) { # >
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3651 
 sub _get_next_token ($) {
+Line 3959 
 sub _get_next_token ($) {
          $self->{ct}->{data} .= ']]'; # character
          $self->{state} = CDATA_SECTION_STATE;
-         ## Reconsume.
+         ## Reconsume. ## XML5: Emit.
          redo A;
        }
      } elsif ($self->{state} == ENTITY_STATE) {
-Line 3719 
 sub _get_next_token ($) {
+Line 4027 
 sub _get_next_token ($) {
        if ($self->{prev_state} == DATA_STATE) {
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
          ## Reconsume.
          return  ({type => CHARACTER_TOKEN, data => '&',
                    line => $self->{line_prev},
-Line 3729 
 sub _get_next_token ($) {
+Line 4038 
 sub _get_next_token ($) {
          $self->{ca}->{value} .= '&';
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
          ## Reconsume.
          redo A;
        }
-Line 3779 
 sub _get_next_token ($) {
+Line 4089 
 sub _get_next_token ($) {
          if ($self->{prev_state} == DATA_STATE) {
            $self->{state} = $self->{prev_state};
+           $self->{s_kwd} = '';
            ## Reconsume.
            return  ({type => CHARACTER_TOKEN,
                      data => '&#',
-Line 3790 
 sub _get_next_token ($) {
+Line 4101 
 sub _get_next_token ($) {
            $self->{ca}->{value} .= '&#';
            $self->{state} = $self->{prev_state};
+           $self->{s_kwd} = '';
            ## Reconsume.
            redo A;
          }
-Line 3855 
 sub _get_next_token ($) {
+Line 4167 
 sub _get_next_token ($) {
        if ($self->{prev_state} == DATA_STATE) {
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
          ## Reconsume.
          return  ({type => CHARACTER_TOKEN, data => chr $code,
+                   has_reference => 1,
                    line => $l, column => $c,
                   });
          redo A;
-Line 3865 
 sub _get_next_token ($) {
+Line 4179 
 sub _get_next_token ($) {
          $self->{ca}->{value} .= chr $code;
          $self->{ca}->{has_reference} = 1;
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
          ## Reconsume.
          redo A;
        }
-Line 3890 
 sub _get_next_token ($) {
+Line 4205 
 sub _get_next_token ($) {
          if ($self->{prev_state} == DATA_STATE) {
            $self->{state} = $self->{prev_state};
+           $self->{s_kwd} = '';
            ## Reconsume.
            return  ({type => CHARACTER_TOKEN,
                      data => '&' . $self->{s_kwd},
-Line 3901 
 sub _get_next_token ($) {
+Line 4217 
 sub _get_next_token ($) {
            $self->{ca}->{value} .= '&' . $self->{s_kwd};
            $self->{state} = $self->{prev_state};
+           $self->{s_kwd} = '';
            ## Reconsume.
            redo A;
          }
-Line 4003 
 sub _get_next_token ($) {
+Line 4320 
 sub _get_next_token ($) {
        if ($self->{prev_state} == DATA_STATE) {
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
          ## Reconsume.
          return  ({type => CHARACTER_TOKEN, data => chr $code,
+                   has_reference => 1,
                    line => $l, column => $c,
                   });
          redo A;
-Line 4013 
 sub _get_next_token ($) {
+Line 4332 
 sub _get_next_token ($) {
          $self->{ca}->{value} .= chr $code;
          $self->{ca}->{has_reference} = 1;
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
          ## Reconsume.
          redo A;
        }
-Line 4125 
 sub _get_next_token ($) {
+Line 4445 
 sub _get_next_token ($) {
        if ($self->{prev_state} == DATA_STATE) {
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
          ## Reconsume.
          return  ({type => CHARACTER_TOKEN,
                    data => $data,
+                   has_reference => $has_ref,
                    line => $self->{line_prev},
                    column => $self->{column_prev} + 1 - length $self->{s_kwd},
                   });
-Line 4137 
 sub _get_next_token ($) {
+Line 4459 
 sub _get_next_token ($) {
          $self->{ca}->{value} .= $data;
          $self->{ca}->{has_reference} = 1 if $has_ref;
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
+         ## Reconsume.
+         redo A;
+       }
+     ## XML-only states
+     } elsif ($self->{state} == PI_STATE) {
+       if ($is_space->{$self->{nc}} or
+           $self->{nc} == 0x003F or # ? ## XML5: Same as "Anything else"
+           $self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'bare pio', ## TODO: type
+                         line => $self->{line_prev},
+                         column => $self->{column_prev}
+                             - 1 * ($self->{nc} != -1));
+         $self->{state} = BOGUS_COMMENT_STATE;
+         ## Reconsume.
+         $self->{ct} = {type => COMMENT_TOKEN,
+                        data => '?',
+                        line => $self->{line_prev},
+                        column => $self->{column_prev}
+                            - 1 * ($self->{nc} != -1),
+                       };
+         redo A;
+       } else {
+         $self->{ct} = {type => PI_TOKEN,
+                        target => chr $self->{nc},
+                        data => '',
+                        line => $self->{line_prev},
+                        column => $self->{column_prev} - 1,
+                       };
+         $self->{state} = PI_TARGET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == PI_TARGET_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         $self->{state} = PI_TARGET_AFTER_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no pic'); ## TODO: type
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## Reconsume.
+         return  ($self->{ct}); # pi
+         redo A;
+       } elsif ($self->{nc} == 0x003F) { # ?
+         $self->{state} = PI_AFTER_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } else {
+         ## XML5: typo ("tag name" -> "target")
+         $self->{ct}->{target} .= chr $self->{nc}; # pi
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
          redo A;
        }
+     } elsif ($self->{state} == PI_TARGET_AFTER_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } else {
+         $self->{state} = PI_DATA_STATE;
+         ## Reprocess.
+         redo A;
+       }
+     } elsif ($self->{state} == PI_DATA_STATE) {
+       if ($self->{nc} == 0x003F) { # ?
+         $self->{state} = PI_DATA_AFTER_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no pic'); ## TODO: type
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+         ## Reprocess.
+         return  ($self->{ct}); # pi
+         redo A;
+       } else {
+         $self->{ct}->{data} .= chr $self->{nc}; # pi
+         $self->{read_until}->($self->{ct}->{data}, q[?],
+                               length $self->{ct}->{data});
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         ## Reprocess.
+         redo A;
+       }
+     } elsif ($self->{state} == PI_AFTER_STATE) {
+       if ($self->{nc} == 0x003E) { # >
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # pi
+         redo A;
+       } elsif ($self->{nc} == 0x003F) { # ?
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no s after target', ## TODO: type
+                         line => $self->{line_prev},
+                         column => $self->{column_prev}); ## XML5: no error
+         $self->{ct}->{data} .= '?';
+         $self->{state} = PI_DATA_AFTER_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } else {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no s after target', ## TODO: type
+                         line => $self->{line_prev},
+                         column => $self->{column_prev}
+                             + 1 * ($self->{nc} == -1)); ## XML5: no error
+         $self->{ct}->{data} .= '?'; ## XML5: not appended
+         $self->{state} = PI_DATA_STATE;
+         ## Reprocess.
+         redo A;
+       }
+     } elsif ($self->{state} == PI_DATA_AFTER_STATE) {
+       ## XML5: Same as "pi after state" in XML5
+       if ($self->{nc} == 0x003E) { # >
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # pi
+         redo A;
+       } elsif ($self->{nc} == 0x003F) { # ?
+         $self->{ct}->{data} .= '?';
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } else {
+         $self->{ct}->{data} .= '?'; ## XML5: not appended
+         $self->{state} = PI_DATA_STATE;
+         ## Reprocess.
+         redo A;
+       }
      } else {
        die "$0: $self->{state}: Unknown state";
      }

 Legend:



Removed from v.1.3
 


changed lines


 
Added in v.1.11
 Legend:



Removed from v.1.3
 


changed lines


 
Added in v.1.11
-Removed from v.1.3
+Added in v.1.11

admin@suikawiki.org	ViewVC Help
Powered by ViewVC 1.1.24